汎用LLMが製品の主張をファクトチェックできない理由
AIコーチは営業担当者に、顧客対応が完璧だったと伝えます。 強いラポール。優れたペース配分。的確な反論対応。 そして会話の途中、営業担当者は自信満々にこう言います。 「当社のエンタープライズプランは、APIコールが無制限です。」 AIは高いスコアを与えます。ただし、一つ問題があります。御社の価格表では、エンタープライズプランのAPIコールは月1,000万件までとなっています。 会話は申し分ありませんでした。しかし、製品情報は間違っていました。そして、AIコーチがその主張を自社の文書と照合していなかったとすれば、それを知る術はありませんでした。 言語モデルは製品を知らない 現代のAIに関する大きな誤解の一つは、AIが「御社のビジネスを知っている」というものです。実際にはそうではありません。 大規模言語モデルは、自然な会話を生成することに驚くほど長けています。概念を説明し、文書を要約し、リアルな顧客対応をシミュレートすることもできます。しかし確実にできないのは、御社の最新の製品カタログ、先月の価格改定、あるいは法務チームが先週承認したばかりのコンプライアンス文言を正確に記憶しておくことです。その情報は御社に属するものであり、モデルに属するものではありません。 営業担当者が製品に関する主張をした際、AIコーチにはそれを確認できる信頼できる拠り所が必要です。そうでなければ、推測することしかできません。そして、自信に満ちた流暢な言葉で装われた推測こそが、ハルシネーションにほかなりません。 もっともらしさは真実とは違う ほとんどのAIコーチングプラットフォームがつまずくのは、まさにこの点です。ある発言は、完全に間違っていても、一見きわめて妥当に聞こえることがあります。 「当社の保証期間は48か月です」「当社のソフトウェアはPlatform Xと直接連携します」「この機能はProfessionalプランに含まれています」 これらの発言はどれも信じられそうに聞こえます。そしてどれも、事実ではない可能性があります。汎用モデルは、こうした発言が真実かどうかを知りません。知っているのは、他の何百万もの企業の製品から学習したパターンに基づいて、それがもっともらしく聞こえるかどうかだけです。これは営業において危険な区別であり、セールストレーニングにおけるLLMハルシネーションの核心にある問題です。もっともらしく聞こえる誤答と正答は、もっともらしさだけを確認するシステムにとって見分けがつきません。 顧客は、もっともらしく聞こえるものを買うのではありません。真実に基づいて購入するのです。 判定が一つでは足りない理由 AIコーチに各主張を「正しい」か「誤り」かで判定させたくなるのは自然なことです。しかし実際には、それだけの粒度では役に立ちません。主張が誤っている場合、その失敗の仕方は大きく二通りに分かれ、営業担当者はどちらなのかを知る必要があります。 矛盾 — 主張が自社の文書と直接食い違っている場合です。価格表が月1,000万件としているのに、*「APIコールは無制限」*と発言するのは矛盾です。正しい具体的な数字が存在するのに、営業担当者はそれとは異なる数字を述べています。 不十分 — 主張が必ずしも間違っているわけではないものの、発言のままでは確認できない場合です。方針で必須とされる開示事項を含めずに*「これは完全に準拠しています」*と言う担当者は、厳密には間違ったことを言ったわけではありません — ただ、文書がそのままの形では裏付けられない発言をしたのです。規制のある販売現場では、このバケットが最もコストの高いものになることが少なくありません。なぜなら、トーンと自信の度合いしか確認しないシステムには、これが見えないからです。 そこに裏付けあり — 主張が現行の文書と一致し、出典も添えられている状態 —...





