0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

DeepSeek V4-Flash vs GPT-6 Sol:日本語の議事録から正確なToDoを作れるのはどちらか

0
Posted at

担当者と期限の訂正、「できるかもしれません」という提案、後から決まった役割を、日本語の入力で比較しました。

本記事はCrazyrouter関連のコンテンツです。2026年10月10日に同サービスのAPIを使い、日本語の架空議事録からToDo表を作成しました。職場の会議と学生のゼミを各1件、さらに追加決定を各1回与え、2モデルで計8回答を確認しています。

📊 表の正確さは同じ。差は速度と表の後に出ました

比較項目 DeepSeek V4-Flash GPT-6 Sol
📅 最新の担当者・期限を反映 2ケースとも正しく反映 2ケースとも正しく反映
💬 提案を確定事項に変えない 担当・期限を未定、状態を提案と記載 同じく未定・提案と記載
🔄 追加決定後の表を更新 2ケースとも正しく更新 2ケースとも正しく更新
📝 ゼミの追加決定後、要確認事項はどうなったか 未定が解消した後も、進捗・日程重複・変更なしの再確認を追加 「なし」と回答
⚡ 初回完了時間:職場/ゼミ 3.61秒/4.16秒 7.23秒/11.99秒

今回、担当者・期限・状態の表だけで優劣はつきませんでした。早く下書きを得たい職場用途ではDeepSeekが候補になります。一方、決まったことだけをゼミ内に共有したい場合は、追加の確認作業を持ち込まなかったGPTが使いやすい結果でした。

DeepSeek V4-FlashとGPT-6 Solによる日本語議事録のToDo化比較

図:gpt-image-2で生成した概念イラストです。実際の画面や回答のスクリーンショットではありません。

1. 同じ資料と同じ指示を渡す

比較対象はAPIに渡したテキストです。音声認識、PDFの読み取り、カレンダーへの登録は行っていません。接続方法はCrazyrouterのAPIドキュメントで確認できます。

共通のシステム指示は次の内容です。

日本語で回答してください。議事録から指定された作業だけをToDo表にしてください。
列は「ID|作業|担当者|期限|状態|根拠」。
状態は「確定」または「提案」です。
担当者・期限が明示されていない場合は「未定」とし、推測しないでください。
日付はYYYY-MM-DD。
発言者や資料作成者を別の作業の担当にしないでください。
根拠は該当する議事録の短い原文を引用してください。
表の後に要確認事項を挙げてください。

ここで「確定」は、作業の実施が決まっていることを表します。担当者が未定でも、デモの開催自体が決まっていれば別々に記載できます。

2. 職場の議事録:資料担当と当日の説明担当を混同しないか

入力には、古い通知と訂正、それから未承認の提案を含めました。

2026年10月8日の会議:
J1:集計表は佐藤さんが担当。提出は10月14日。
J2:説明資料は鈴木さんが担当。提出は10月16日。
J3:顧客向けデモは10月18日。当日の説明担当は未定。

10月10日の確定した訂正:
J1の担当は田中さん、期限は10月16日に変更。旧担当・旧期限は無効。
J2は変更なし。J3は10月21日に変更、説明担当は未定のまま。
鈴木さん「J4のリハーサルは10月20日にできるとよさそうです」。
これは提案のみで、実施日・担当はまだ確定していません。

両モデルの担当者・期限・状態は一致しました。

ID 担当者 期限 状態 両モデルの処理
J1 田中さん 2026-10-16 確定 古い担当と期限を置換
J2 鈴木さん 2026-10-16 確定 変更なしを維持
J3 未定 2026-10-21 確定 資料担当を当日の説明担当にしない
J4 未定 未定 提案 候補日を確定した期限にしない

GPTは要確認事項で「10月20日は提案された候補日です」と補足しました。DeepSeekも表の根拠欄に提案の発言を残しています。どちらも情報を捨てず、確定欄とは区別できました。

次に、J3の担当を高橋さん、J4を10月19日・佐藤さん担当で確定し、J1とJ2は変更なしと伝えました。両モデルとも4行の表を正しく更新しました。J4を当初の候補日である20日に残すこともありませんでした。

**この職場ケースでは、GPTだけが正確だったとはいえません。**DeepSeekも同じ結果をより短い待ち時間で返しました。

3. ゼミの議事録:「できるかもしれません」を引受けにしないか

学生向けには、次の別の議事録を渡しました。日付は架空の将来予定です。

2026年11月2日、ゼミの打合せ:
K1:文献整理は山本さん、期限11月12日。
K2:発表スライドは小林さん、期限11月13日。
K3:研究発表は11月16日。発表する人は未定。
11月3日、決定事項:K1の期限は11月14日に変更。
山本さんが継続して担当。K2・K3は変更なし。
小林さん「時間があれば、K4の練習会を11月15日に担当できるかもしれません」。
まだ引受け・日程の確定ではありません。K4は提案段階です。

両モデルとも、K1を11月14日に更新し、K3の発表者は未定のままにしました。K4についても、小林さんを確定した担当者にせず、担当者・期限は未定、状態は提案と記載しました。

ただし、この問題文には「まだ確定ではない」と明示してあります。「できるかもしれません」という日本語表現だけから、いつでも正しく意図を読み取れると証明したわけではありません。

続けて、同じ追加指示を送りました。

11月4日の決定事項:K3の発表者は山本さん、日付は変更なし。
K4の練習会は11月14日、小林さんが正式に担当します。
K1・K2は変更ありません。
確定事項を反映し、表全体と要確認事項を更新してください。

ここでも両モデルの表は正解です。K3は山本さん・11月16日、K4は小林さん・11月14日・確定に変わりました。

4. 表が合っていても、要確認事項は同じではない

差が出たのは、ゼミの更新表の後です。GPTの回答は次のとおりでした。

要確認事項
なし。

DeepSeekは、進捗確認、日程重複、変更がない項目の再確認を挙げました。その一つは次の記述です。

K2・K1の変更なしとの再確認:11月4日の決定で「K1・K2は変更ありません」と明記されていますが、念のためK1の期限が11月14日(変更後)のままであること、K2の期限が11月13日であることを関係者に再確認することを推奨します。

これは表の誤りでも、実在する衝突を断定したものでもありません。DeepSeekが追加した運用上の助言です。ただし、議事録に残る未定事項だけを知りたい人には、解決済みの話を再び確認する仕事が増えます。

共通指示は「要確認事項」としか書いておらず、推奨事項を禁止していません。そのため、ここは明確な指示違反として採点せず、共有用の成果物としてどちらが目的に近いかという差として扱います。会議の記録だけを出したい場合は「議事録内に残っている未確定事項のみ。運用上の助言は別欄」と区別する余地があります。この追加指定による改善は今回測定していません。

両モデルで正しかった更新表と、要確認事項の違い

図:実際の日本語API回答から整理しています。表の正確さと、追加助言の有無を分けています。

5. 初回だけでなく、追加決定後の待ち時間も比べる

ケース DeepSeek V4-Flash GPT-6 Sol
職場・初回 3.61秒 7.23秒
職場・追加決定 4.12秒 8.10秒
ゼミ・初回 4.16秒 11.99秒
ゼミ・追加決定 6.83秒 9.88秒

日本語議事録2ケースの回答完了時間

図:各条件1回の非ストリーミング測定です。通信、ゲートウェイ、待機、生成を含みます。

4回ともDeepSeekが先に回答を完了しました。ただし、回答の読み直しや余分な説明の削除にかかる時間は測っていません。この表から会議整理全体の所要時間までは比較できません。

🎓 学生と💼職場では、今回どちらを選ぶか

利用場面 今回の第一候補 選ぶ理由
学生:ゼミの決定事項をそのまま共有したい GPT-6 Sol 表が正しく、未定事項の解消後に追加の再確認を持ち込まなかったため
職場:会議後すぐに、確認して使うToDoの下書きがほしい DeepSeek V4-Flash 今回の職場ケースでは同じ担当者・期限・状態を正しく出し、初回と更新の両方で速かったため

自動で担当者へ通知する運用や、長い議事録、婉曲表現だけで決定状態を判断する場面は未検証です。今回の2ケースだけで、業務全般の適性や日本語能力全体を順位付けすることはできません。

API設定

設定 DeepSeek V4-Flash GPT-6 Sol
リクエスト名 deepseek-v4-flash gpt-6-sol
レスポンス名 deepseek-v4-flash-0731 gpt-6-sol
推論 thinking: {type: 'disabled'} 提供側の既定値
出力上限 2400 tokens 2400 tokens
回答数 初回2+追加2 初回2+追加2

すべてfinish_reason: stopで終了しました。入力・指示・出力は日本語で、追加指示には各モデル自身の初回回答を含めています。最大4件を並行実行しました。推論設定は同一ではなく、上流モデルのバージョン対応も独立に確認していません。

本記事はAIの支援を受けて執筆し、比較内容を実際のAPI回答と照合しています。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?