「いい感じにまとめて」と頼んで、がっかりする理由
目次
アンケートの自由記述を200件ほど貼り付けて、「いい感じにまとめて」とAIに頼む。数秒で、見出し付きの整った要約が返ってきます。
読んでみると、どこも間違っていない。なのに、使えない。
言い直しても、また少し違うものが返ってくる。3回目あたりで「AIってこの程度か」と画面を閉じる。そんな経験をした人は少なくないはずです。
原因を、AIの性能か、プロンプトの「コツ」を知らないことに求めたくなります。ただ、人間同士の依頼の研究と生成AIの研究を並べると、別の原因が見えてきます。足りないのは言い回しより、頼んだ人の頭の中にしかない「選ぶ基準」です。
「まとめて」は「何を捨てるか決めて」という依頼
要約するとは、元の情報の大半を捨てることです。200件の声を1ページにするなら、残せるのはごく一部です。
では、どれを残すのか。
好意的な声を多めに拾うのか、不満を優先するのか。件数の多い意見を並べるのか、1件だけでも重い指摘を拾うのか。どれを選んでも、要約としては成り立ちます。
「いい感じ」という言葉には、この取捨選択の基準がまるごと詰まっています。たとえば頼んだ人は、来月の部長会議で「このイベントを続けるか」を判断してもらう資料を作りたかったのかもしれません。それなら欲しかったのは、改善要望と不満の整理です。
でも、その事情は依頼文のどこにも書かれていません。AIが返した「満足の声が多数、一部に改善要望も」という無難な要約は、別の目的には合っていた答えです。
頼んだ側は、自分の言葉が伝わっていると思い込む
それなら最初から書けばいい。そう思えますが、頼む側には、自分の依頼に何が足りないのかが見えにくいという問題があります。
2005年、心理学者のジャスティン・クルーガー氏とニコラス・エプリー氏らは、メールで皮肉が伝わるかを調べる実験を報告しました(Journal of Personality and Social Psychology掲載)。参加者は用意された短い文から選んで相手に送り、それが皮肉か本気かを相手が当てられるかを予想します。
声で読み上げて伝えた場合、受け手はおよそ4分の3を正しく判定しました。メールで送った場合の正答率は、当てずっぽうと区別できない水準でした。ところが送り手の自信は、声でもメールでもほとんど変わりませんでした。
著者らは、この過信を自己中心性で説明しています。送り手は自分の意図を知っているので、文字だけを読んだ相手にも同じように「聞こえる」と感じてしまうのです。
「いい感じにまとめて」も同じ構造です。頼んだ本人には、部長会議も、続けるかどうかの判断も見えています。だから、その9文字で伝わった気がする。
千田和央さんの『GitLabに学ぶ パフォーマンスを最大化させるドキュメンテーション技術』は、文章でのやりとりを中心に働く組織の書き方をまとめた本です。そこでも、「かなり」「新しい」のような度合いの曖昧な言葉を、数字や日付に置き換えて解釈の余地を減らすよう勧めています。文字だけのやりとりでは、読み手が補う余地がそのまま誤解の余地になるからです。
AIは聞き返さず、「よくある答え」で空欄を埋める
人間の部下なら、ここで「これ、何に使うんですか」と聞き返してくれるかもしれません。AIは多くの場合、聞き返しません。
2024年の自然言語処理の国際会議ACLで発表されたCLAMBERという研究は、曖昧な質問を約1万2千件集め、既存の言語モデルが曖昧さに気づいて確認の質問をできるかを調べました。結果は、曖昧さを見抜く力も、的確な確認の質問を作る力も限られていた、というものです。考える過程を書かせる工夫や例示を加えても、改善はわずかでした。
2024年時点のモデルでの結果なので、新しいモデルでは改善している可能性もあります。それでも、「AIが自分から意図を確かめてくれる」と期待して依頼を短くするのは危うい、とは言えます。
では、聞き返さないAIは空欄をどう埋めるのか。
松本勇気さんは『生成AI「戦力化」の教科書』で、言語モデルを「物知りでタフで賢い新入社員」にたとえたうえで、その限界を挙げています。確率的に「それっぽい続き」を作る仕組みであること。会話を超えた記憶を持たず、渡された情報がすべてであること。
この2つを合わせると、がっかりの正体が見えます。目的が書かれていなければ、AIは「よくありそうな要約」を作る。よくありそうな要約は、誰の目的にもそこそこ合い、誰の目的にもぴったりとは合いません。
ここで、よく勧められる「あなたはベテランのマーケターです」のような役割の指定を思い出す人もいるでしょう。ミシガン大学などの研究チームは、162種類の役割を4系統の言語モデルに与え、2,410問の事実問題で正答率を比べました(EMNLP 2024 Findings)。
役割を与えても、全体として成績は上がりませんでした。役割によって上下はあるものの、どの役割が効くかを事前に見分けるのは難しく、自動で選ばせても、でたらめに選ぶのと大差なかったと報告されています。
事実問題の正答率という限られた条件での結果です。それでも、役割という決まり文句が目的や基準の欠けを埋めてくれるわけではないことは読み取れます。
渡すべきは、目的、読み手、判断基準、完成形
では何を渡せばいいのか。人に仕事を任せる技術が、そのまま参考になります。
伊庭正康さんは『できるリーダーは、「これ」しかやらない』で、経験の浅いメンバーに任せるときは、なぜその仕事をお願いするのかという目的と具体的なやり方を伝え、最後に内容を復唱してもらうよう勧めています。復唱は、伝えたつもりの中身と伝わった中身のずれを、作業が始まる前に見つけるための手順です。
AIの開発元も、同じ方向のことを書いています。Anthropicは自社のプロンプト指南で、AIを「優秀だが、あなたの職場の慣習や仕事の進め方を知らない新入社員」として扱うよう勧めています。そして、指示に理由を添えると、AIがそこから一般化して的を絞った答えを返しやすくなると説明しています。
たとえば「省略記号を使わないで」とだけ言うより、「読み上げソフトで音声にするので、発音できない省略記号は使わないで」と言うほうがいい。理由がわかれば、AIは書かれていない似たケースにも対応できます。
この記事では、渡す情報を次の4つに整理します。
目的:何に使うのか。何が決まればいいのか 読み手:誰が読むのか。その人は何を知っていて、何を知らないのか 判断基準:何を優先し、何を捨てるのか 完成形:分量、形式、構成。できれば見本
冒頭のアンケートなら、こうなります。
「来月の部長会議で、この交流イベントを続けるかを判断してもらうための資料です。部長はアンケートを読んでいません。好意的な感想より、改善要望と不満を優先してください。件数の多い順に並べ、1件だけでも運営上のリスクに関わる指摘は残してください。A4一枚、冒頭に結論を3行、その下に要望の上位5つを件数付きで」
誰に、何を、いつまでにと5W1Hを埋めても、「何を捨てるか」は出てきません。4つのうち、「いい感じ」に最も多く詰まっていたのは判断基準です。
依頼文を送る前にできる3つのこと
誤解:詳しく書けば書くほど良い → 分量を増やしても、判断基準が抜けていればAIは無難な選択をします。まず「AよりBを優先」の形で1行書くのが、いちばん効く改善です。
誤解:いいプロンプトには決まった型や呪文がある → 決まり文句より、その仕事に固有の事情のほうが効きます。その事情を知っているのは、頼む人だけです。
明日から試せる行動を3つに絞ります。
1つ目は、送信前に4つの項目を1行ずつ書くことです。目的、読み手、判断基準、完成形。書けない項目があれば、そこがAIに勝手に決められる部分です。
2つ目は、いきなり書かせずに復唱させることです。「作業を始める前に、この依頼をどう理解したかを3行で説明して。不明点があれば質問して」と添えます。AIは自分からは聞き返しにくいので、聞き返す機会を依頼文の中に作っておきます。
3つ目は、同僚テストです。Anthropicの指南には、「その仕事の事情をほとんど知らない同僚にプロンプトを見せて、その通りに作業してもらう。同僚が戸惑うなら、AIも戸惑う」という基準があります。事情を知らない人が読んで同じものを作れるか。5分あれば確かめられます。
おわりに
「いい感じにまとめて」と頼んだとき、AIが受け取ったのは、あなたの頭の中にある会議室でも部長の顔でもなく、9文字だけでした。
次にがっかりしたら、返ってきた要約を直す前に、自分の依頼文から「何を捨ててほしかったのか」が読み取れるかを確かめてみてください。
この記事で参考にした本
『GitLabに学ぶ パフォーマンスを最大化させるドキュメンテーション技術』千田和央さん → 文章でのやりとりでは、曖昧な表現を数字や日付に置き換えて解釈の余地を減らすという書き方の原則
『生成AI「戦力化」の教科書』松本勇気さん → 言語モデルは確率的に「それっぽい続き」を作り、渡された情報がすべてという限界の整理
『できるリーダーは、「これ」しかやらない』伊庭正康さん → 任せるときは目的とやり方を伝え、復唱でずれを確かめるという依頼の手順
合わせて読みたい
AIに聞いても答えが出ないのは、問題が言葉になる前だから 依頼文を書くより手前で、困りごとそのものが言葉になっていない段階を扱ったコラムです。4つの項目のうち「目的」が書けないときに読むと、つまずきの場所が見えてきます。
『「何回説明しても伝わらない」はなぜ起こるのか?』今井むつみ|伝わらないのは「言い方」ではなく「心の読み方」のズレだった 自分の意図が相手にも見えていると思い込む仕組みを、認知科学から解説した本の書評です。人への依頼で同じすれ違いが起きる理由がわかります。
AIが同じでも、成果がバラつく組織の盲点 AIの出力を何で評価するかを、チームで言葉にして共有する話です。この記事の「判断基準」を、個人の依頼文から職場の共通ルールへ広げたいときに役立ちます。