AKAが開発、提供を行っている英語スピーキングテスト対策アプリ「Musio ESAT-J」に公立高校入試問題に対応した演習コンテンツが新登場します。
AKA(アメリカ本社:AKASTUDY LIMITED 米国カリフォルニア州、日本法人:AKA株式会社 東京都台東区、代表:Raymond Jung)は人工知能エンジン及び人工知能ソーシャルロボットを開発しています。
■ESAT-J対策アプリ「Musio ESAT-J」
東京都では小・中・高で一貫した英語教育の強化を掲げており、2022年度より「中学校英語スピーキングテスト(ESAT-J: English Speaking Achievement Test for Junior High School Students)」が導入されています。ESAT-Jは「話すこと」に特化した試験であり、3年生を対象に行われているYEAR3は都立高校受験でもスコアが活用されています。さらに2024年からは中学校1、2年生を対象としたYEAR1、2も実施されています。
広く英語力の向上を求められている中、AKAは英語学習コンテンツの提供を通して得たノウハウやデータをもとに、ESAT-J対策ソリューションを開発。個人ユーザー向け「Musio ESAT-J」、教育機関向け「Musio ESAT-J通信教育」の2つのアプリケーションを提供し、中学英語教育の底上げに尽力しています。
◾️「Musio ESAT-J」に公立高校入試問題を新たに搭載
英語スピーキングテスト対策アプリ「Musio ESAT-J」に、高校入試対策演習のコンテンツ「入試」が新たに搭載され、8月にリリースされました。今回のアップデートにより、スピーキング学習者だけでなく、高校受験を控える全国の中学3年生が入試対策として利用できるようになります。
- 模擬テストをいつでもどこでも
アプリを利用することで、スマートフォンやタブレットなど端末一つで実際の高校入試の模擬テストの演習が完結できます。出先や移動時間などのスキマ時間を効果的に使い、手軽に高校入試対策を行えます。
- AIによる採点
選択問題から記述問題まで、すべての設問の採点がAIによって客観的に実施されます。自身では採点が難しい記述式の採点までカバーすることができます。
- 分野ごとの分析結果
分野ごとにAIによる分析結果を確認ができるため、自身の苦手・得意な点を客観的に把握することができ、効率的な復習につながります。
「Musio ESAT-J」に、コンテンツが追加される形で「入試」が提供をされます。「Musio ESAT-J」とともに、「入試」のコンテンツも利用することで、スピーキングテストに加えリスニングを含む筆記問題の対策も可能となり、英語入試に万全な備えを行うことができます。
先駆けとなる8月のリリースでは東京都・神奈川県・埼玉県・大阪府・愛知県の5都府県の高校入試コンテンツの提供を開始します。そのほかの地域も順次アップデートを予定しており、多くのニーズに対応する予定です。
◾️都内公立中学校で実証実験を開始
個人のお客様だけでなく、教育機関におけるニーズも把握すべく、現在、都内5校と「Musio ESAT-J通信教育」の実証実験の準備を進めています。今年秋頃から順次開始し、より現場の教師、生徒の声を取り入れることでMusio ESAT-Jの実用性と有用性を大きくアップデートさせていきます。
また、多くの教育機関でご利用いただけるよう、iOS端末に加えてAndroid端末やChromebookでもMusio ESAT-Jをご利用いただけるようになりました。アプリをインストールすればすぐにサービスを利用でき、今後はWindows端末への対応を予定しています。
英語学習へのソリューションや「Musio ESAT-J&入試」、「Musio ESAT-J&入試 通信教育」にご関心のある方は、弊社のMusio ESAT-J 担当の二瓶(viola@akacorp.jp)までご連絡ください。
【『Musio ESAT-J&入試』をインストール】
-
20分間の監査を実行し、自社スタックが事実をチェックしていないことに気づいたあるフィンテック企業
セールスイネーブルメント責任者は、18ヶ月間ずっと自分のプラットフォームのダッシュボードを信頼してきました。 完了率は高く、共感スコアは右肩上がり。担当者たちは練習時間を積み重ねていました。すべてが健全に見えていました。 そんなある日、彼女は当ブログの監査ガイド記事を読みました。そこにはシンプルなテストが提案されていました:最近変更された製品に関する事実を1つ選び、練習セッションで古い値を自信を持って発言し、プラットフォームがそれをどう処理するか見てみる、というものです。 20分後、答えが出ました。プラットフォームは何も言いませんでした。 フラグもなし。訂正もなし。引用元もなし。ただ合格点と、「ペース配分が素晴らしい」というコメントだけでした。 これは、あるフィンテック企業がこのテストを実行して何を発見し、その後どう対処したかについての物語です。 準備:明確でチェック可能な事実 この企業は、中堅企業からエンタープライズ企業まで幅広い加盟店に決済処理・不正検知プラットフォームを提供しています。同社の製品は複雑です:段階的な料金体系、取引量に応じた割引、決済サイクル、そして地域や取引種別によって異なるコンプライアンス要件。 6ヶ月前、同社は1つの具体的な項目を変更しました:新規加盟店の標準的な決済サイクルが、新しいマネーロンダリング対策のスクリーニング要件により、「営業日3日」から「営業日5日」に変更されたのです。この変更は文書化され、営業チームにも通知され、社内ナレッジベースも更新されていました。 しかし、セールスイネーブルメント責任者は、自社のAIトレーニングプラットフォームが、いまだに「3営業日」と言い続ける担当者を実際に検出できるかどうかを、これまで一度もテストしたことがありませんでした。 彼女はこの事実を監査対象に選びました——明確な前後比較ができる、チェックしやすい発言内容です。 テスト:古い値を自信を持って発言する 彼女はブログの提案どおり、自らテストを実行しました。 プラットフォームで通常の練習セッションを開始し、会話の自然な流れの中で、古い値を滑らかに、完全な自信を持って発言しました:「はい、新規加盟店様は営業日3日以内でのお支払いが可能です」。 言い訳めいた言葉はありません。「たしか」もありません。「確認します」もありません。実際の商談で優秀な担当者が話すであろう、自信に満ちた流暢な発言そのものでした。 彼女はセッションを完了し、フィードバックを確認しました。 結果:沈黙 プラットフォームは高いスコアを与えました。共感:優秀。反論対応:模範的。ペース配分:強い。総合評価:合格。 彼女が発言した具体的な内容——「3営業日以内でのお支払い」——は、一切言及されませんでした。フラグも、訂正も、指摘さえもありませんでした。 プラットフォームは彼女のトーン、構成、話し方を採点していました。その裏にある事実をチェックする仕組みは、まったく存在していなかったのです。 彼女はブログが推奨する2つ目のテストも実行しました:「不十分(insufficient)」版です。完全に間違っているわけではないものの、必須の開示事項——具体的には、高取引量の加盟店向けの標準リスク開示——が欠けている発言をしました。プラットフォームはこれも、何のコメントもなく合格させました。 2つのテスト。2つの失敗。合計20分。 沈黙のコスト セールスイネーブルメント責任者は、この結果をVP of Salesに共有しました。彼は驚きませんでした。 彼は2四半期にわたって失注案件のレビューを追跡していました。その期間で: トレーニングプラットフォームのダッシュボードは、高い完了率と改善する共感スコアを示していました。しかし、これらの指標が測定していたのは、トレーニングが「実施された」ことであり、知識が「存在する」ことではありませんでした。 監査で明らかになった沈黙が、その理由を説明していました。プラットフォームには、担当者が正しいことを学んでいるかどうかを知る方法がなかったのです。ただ、話しているときにそれが良く聞こえるかどうかしか分かっていませんでした。 この業界が重要な理由 決済サイクルの誤った案内は、単に1つの商談を失うだけでは済みません。加盟店は予定される決済日を基準にキャッシュフローを計画しています。担当者が3日と約束したのに実際は5日かかった場合、加盟店の業務に支障が生じ、エスカレーションにつながります。 さらに開示の側面もあります。フィンテック製品には、担当者が一貫して含めるべき必須の通知事項や、法域ごとに異なる文言が付随します。決済サイクルを自信満々に誤って伝えたり、必須の開示事項を省略したりする担当者は、単なるスタイル上のミスを犯しているわけではありません——このような数値主導の技術的な商談では、後になって発覚するほどコストが高くなる、まさにそのタイプの事実的なギャップなのです。 このフィンテック企業のセールスイネーブルメント責任者は、率直にこう語っています: 「私たちは単に商談を失っていただけではありませんでした。実態と合わない期待を顧客に持たせてしまい、それが数ヶ月後にサポートチケットとして表面化し続けていたのです。トレーニングプラットフォームは、そのどれも見えていませんでした」 介入策:沈黙を具体性に置き換える この企業は、両方の監査テストに合格する**EOS(akaeos.com)**にプラットフォームを置き換えました。 練習セッションで同じ発言——「3営業日以内でのお支払い」——がなされたとき、EOSはそれを異なる方法で処理しました: 「矛盾(Contradicted):新規加盟店様には営業日5日の決済サイクルが適用されます。Merchant Onboarding Guide v6.2、セクション4.1を参照。」 不十分版のテストも同様の扱いを受けました。欠けていた開示事項は、それを義務付けるポリシーへの具体的な参照とともにフラグ付けされました。 この違いは微妙なものではありませんでした。一方のプラットフォームは自信を採点し、もう一方は事実を検証したのです。 90日後の結果 この企業は45名の担当者を対象に90日間のパイロットを実施しました。 練習セッション1回あたりの事実の誤りは68%減少しました(2.8→0.9)——これが主要な成果です。 しかし、セールスイネーブルメント責任者は、本当の変化はもっと単純なものだったと語っています: 「以前は、担当者たちが実際に何を話しているのか、まったく分かりませんでした。ダッシュボードは素晴らしく見えても、誰が事実を正しく伝えているかは分からなかったんです。今は分かります。どの担当者の、どの発言についても、EOSのマネージャーダッシュボードを通じて、それが裏付けられているか、矛盾しているか、不十分かを確認でき、引用元も見ることができます」 あなたのスタックで、この20分間の監査を実行してみましたか? 12ページのレポート『Beyond Roleplay: The Rise of the…
-
AIセールストレーニングスタックを製品ハルシネーションについて監査する方法(ステップバイステップ)
御社のAIセールストレーニングプラットフォームが本当にファクトチェックを行っているかどうかを知るのに、ベンダーのデモは必要ありません。必要なのは、約20分と、一つの古くなった情報だけです。 これは、今日すぐに実行できるテストです——ロールプレイ・シミュレーター、LMS、通話採点ツール、あるいはそれらの組み合わせ、今お使いのものが何であっても構いません。ここで評価しているのは新しいベンダーではありません。今使っているスタックが実際に何をしているのか、そのダッシュボードが主張している内容と比べてどうなのかを確かめるのです。 なぜこのテストが必要なのか——ダッシュボードを鵜呑みにしないために どのAIトレーニングプラットフォームも、何かしらを報告してきます——完了率、トーンのスコア、共感度の評価。しかし、それらのどれ一つとして、営業担当者が自信満々に御社の製品について誤った発言をした場合に、プラットフォームがそれを検出できるかどうかは教えてくれません。それを知る唯一の方法は、わざとそれを起こしてみて、システムがどう反応するかを見ることです。 ステップ1:変わったと分かっている主張を一つ選ぶ 現在の文書の中から、以前とは異なる具体的な事実を一つ見つけてください——値上げされた価格、変更された仕様、削除されたプラン内容、以前は36か月だったものが今は48か月になっている条件など。次の2つの条件を満たす必要があります。 価格帯、保証期間、機能の提供状況、コンプライアンス上の免責事項——いずれも適した題材です。曖昧なものは避けてください。判断が分かれるようなものではなく、はっきりと検証可能な事実を選ぶことが重要です。 ステップ2:練習セッションで、以前の値を自信を持って発言する プラットフォーム上で、通常の練習通話またはロールプレイ・セッションを開始してください。会話の自然な流れの中で、以前の値をあたかも現在も有効であるかのように——よどみなく、迷いなく——発言します。「〜だと思います」や「確認します」とは言わないでください。実際の通話で自信満々の、流暢な営業担当者が言うであろう言い方で発言してください。 ここが重要な点です。このテストの目的は、自信だけで合格してしまうかどうかを見ることにあります。もし自信なさげに聞こえてしまうと、実際の商談を壊す原因になっているものを、正しくテストできていないことになります。 ステップ3:セッションを完了し、フィードバックを注意深く読む いつも通りに練習セッションを終え、プラットフォームが生成するフィードバックやスコアを開いてください。一つの数字だけをざっと見るのではなく、実際のコメントを読んでください。 自問してみましょう。 ほとんどのプラットフォームは、その主張について一切何も言わないことでステップ3を「通過」します。その沈黙自体が結果です。つまり、システムはトーン、ペース配分、構成を採点していただけで、その根底にある事実を確認する仕組みを一切持っていなかったということです。 ステップ4:「不十分」バージョンのテストを実行する 矛盾した主張だけがテストすべき失敗モードではありません。今度は、明確に間違っているわけではないが、御社のポリシーが求める何かが欠けている主張で、同じ演習を繰り返してください——コンプライアンス上の開示事項、必須の但し書き、特定の主張と必ずセットで述べるべき条件などです。その主張を自信を持って発言しつつ、必須の部分を省いてください。 明確な誤答しかチェックしないプラットフォームは、通常このバージョンをまんまと通過してしまいます。これは重要なことを教えてくれます——「厳密には嘘ではないが、完全には裏付けられない」主張を捉える手段を持っていないということです。そして規制産業や技術的な販売において、この種の主張こそが最もコストの高いものであることが少なくありません。 ステップ5:見つかった結果を採点する これで、二つのテスト結果が手元にあるはずです。単なる合格・不合格ではなく、実際に何が起きたかを三つのカテゴリーで表現してみましょう。 どちらかのテストが二番目か三番目のカテゴリーに当てはまったなら、あなたはギャップを見つけたことになります。それは仮定の話ではありません——あなたは今、自分自身のプラットフォームで、自社の文書を使って、約20分でそれが実際に起きるのを目撃したのです。 このテストだけでなく、監査フレームワーク全体が知りたいですか? 弊社の12ページのレポート『Beyond Roleplay: The Rise of the Sales Knowledge Engine』には、完全な10問の自己監査チェックリスト、その背後にあるファクトグラウンデッド検証のアーキテクチャ、そして新しいものを評価する前に確認すべきデータ主権に関する質問が収録されています。[ホワイトペーパーをダウンロード →] 実際に事実を検証するスタックなら、どうなっていたか 対比のために、両方のテストに合格するとはどういうことかを見てみましょう。フィードバックは、あなたが行った具体的な主張の内容を名指しします。単なる正解・不正解よりも高い解像度を与えてくれます——正確、一部誤り、事実誤り、あるいは確認不能といったものに近い区分で、単に「問題がある」というだけでなく、どんな種類の問題を見ているのかが分かるようになっています。(具体的な分類のラベルはプラットフォームによって異なります——三種類のものもあれば、四種類のものもあります。重要なのは言葉そのものではなく、この解像度です。) そして、事実誤りまたは確認不能とフラグが立てられたものについては、その説明が行動に移せるほど具体的であるべきです——どのポリシー、仕様、または要件と照合しているのかであって、単に「製品情報を確認してください」ではありません。すべてのプラットフォームが、その判断の根拠となる正確な出典箇所を見せてくれるわけではありません。それは、思い込みで済ませるのではなく、ベンダーに直接尋ねるべき正当な質問です。しかし、その判断の理由づけ自体は、一般論ではなく具体的であるべきです。 その具体性のレベルこそが、会話を採点するだけのプラットフォームと、実際に検証するプラットフォームとの違いです。 次にベンダーと話す前に、これをやっておく価値がある理由 このテストの実行に、新しいツールも、トライアルアカウントも、営業担当者との電話も必要ありません。必要なのは、今お使いのログイン情報と、すでに変わったと分かっている一つの事実だけです。もし今四半期の後半に新しいプラットフォームを評価する予定があるなら、この同じテストを各ベンダーのデモに対して実行することが、本物の検証と、よくできたロールプレイのデモとを見分ける最も速い方法の一つです。 そして、もし今お使いのプラットフォームがこのテストの両バージョンに失敗したとしても、それはパニックになる理由ではありません。それは有用な情報です。御社のトレーニングプログラムが、実際に何から——そして何からは——現在守ってくれていないのかを、正確に教えてくれるのです。 自社の文書が、そのままナレッジチェックになる様子をご覧ください。 EOSは、御社の製品文書を実践練習と証明可能な知識へと変えます——主張の抽出、ファクトグラウンデッド検証、そして営業担当者が実際に何を知っているかを明らかにする自動生成クイズ。app.akaeos.com で最大5席まで無料で始めるか、**[ホワイトペーパー全文をダウンロード]**してください。
-
LLMの幻覚をなくした、あるソフトウェア企業の営業トレーニング改革
VP of Salesには、本来あってはならない問題がありました。 彼のチームはAIロールプレイ・トレーニングで好成績を収めていました。共感スコアは高く、反論対応は模範的。プラットフォームのフィードバックは一貫してポジティブでした——強いラポール、優れたペース配分、明快なコミュニケーション。 それにもかかわらず、失注案件のレビューでは同じ失敗パターンが繰り返し現れていました。担当者が、存在しない製品機能を自信満々に語る。実際には上限があるのに「無制限」だと言う。まだベータ版の統合機能。3ヶ月前に変更済みの価格条件。 担当者は素晴らしく話していました。製品情報は間違っていました。 トレーニングプラットフォームには、それを知る術がありませんでした——なぜなら、そのプラットフォームは「もっともらしさ」をチェックしていて、「真実」をチェックしていなかったからです。 これは、あるB2Bソフトウェア企業——ここでは「Vertex Cloud」と呼びます——がこのギャップを解消した物語です。 問題:もっともらしく聞こえる誤答 Vertex Cloudは中堅企業からエンタープライズ企業まで幅広い顧客にB2B SaaSプラットフォームを販売しています。同社の製品は複雑です:複数の料金プラン、数十の機能、シート数と契約期間によって変わる価格設定、そして四半期ごとに変わるサードパーティツールとの連携。 同社のAIトレーニングプラットフォームは、アップロードされたドキュメントから数秒で練習用の会話を生成できました。担当者はAI顧客と練習し、共感や反論対応でスコアをつけられ、何度でもシナリオを繰り返すことができました。 しかしこのプラットフォームには根本的な死角がありました:発言が「もっともらしく」聞こえるかどうかしかチェックしていなかったのです。 担当者が練習通話でEnterpriseプランに「無制限のAPI呼び出し」が含まれると自信を持って発言したとき——実際の料金表には月間1,000万回までと明記されていたにもかかわらず——プラットフォームは満点を与えました。発言の内容、つまりそれが事実かどうかは、一切評価されなかったのです。 このシステムは自信を採点していたのであって、正確性を採点していたわけではありません。そしてプラットフォームが流暢さに報酬を与えていたため、担当者は必ずしも正しくない情報についても、より自信を持って話すよう訓練されていきました。 もっともらしい誤答のコスト Vertex Cloudは介入前の6ヶ月間、その影響を追跡していました: VP of Salesは率直にこう語りました: 「うちの担当者は、自信を持って話すことはどんどん上手くなっていました。でも、正確に話せるようにはなっていなかった。プラットフォームはその違いを見分けられず、私たちにも見分けがつきませんでした」 根本原因は構造的なものでした。トレーニングプラットフォームの基盤となるLLMは、同社の実際の料金表を読んだことがありませんでした。このモデルは、他社の製品から学習したパターンをもとに「無制限のAPI呼び出し」がどう聞こえるかを知っているだけでした。担当者がそう発言したとき、モデルは「もっともらしい」と判断し、そのまま通過させたのです。 もっともらしいことと真実であることは違います。しかし汎用LLMにとって、この2つはまったく同じに見えます。 介入策:「もっともらしさ」を「検証」に置き換える Vertex Cloudは、もっともらしさをチェックするプラットフォームを**EOS(akaeos.com)**に置き換えました——モデルが持つ「ソフトウェア製品は普通こういうものだ」という一般的な知識に頼らないアプローチです。 EOSは3つの点で従来と異なるアプローチを取りました: 矛盾している、または不十分と判定されたすべての発言は、その担当者専用の、引用元付きパーソナライズド・クイズを自動生成しました。 この転換は根本的なものでした。従来のプラットフォームは「これはもっともらしく聞こえるか?」と問うていました。EOSは「これは実際に真実か——そして、それを証明する文書はどれか?」と問いました。 90日後の結果 Vertex Cloudは60名の担当者を対象に90日間のパイロットを実施しました。 練習セッション1回あたりの矛盾した発言数は71%減少しました(2.4→0.7)——これが主要な成果です。不正確な製品情報が原因の失注案件の割合も、同じ期間で同程度の70%減少しました(14%→4.2%)。 より重要な変化は、トレーニングプログラムが実際に測定する対象そのものが変わったことでした。以前は、ダッシュボードがロールプレイの実施時間、共感スコア、反論対応の評価を表示していました——これはトレーニングが「実施された」ことを測定していたにすぎません。導入後は、EOSのマネージャーダッシュボードを通じて、どの製品に関する発言が最も頻繁に誤解されているか、どの担当者に最も大きなギャップがあるか、そしてすべての製品ラインにおけるすべての担当者の認定履歴が表示されるようになりました。 ある担当者はこう語っています: 自社製品については完璧に理解していると思っていました。このシステムを使い始めた最初の週で、何ヶ月も間違って言い続けていた3つのことを指摘されました。以前のシステムは絶対にそれを見つけられませんでした。チェックしていなかったんですから。ただ『よく話せていますね』と言うだけでした なぜこの方法がうまくいったのか 従来のプラットフォームのLLMは、同社の料金表を読んだことがありませんでした。このモデルは、数千社もの他社の製品から学習したパターンをもとに、「無制限のAPI呼び出し」がどう聞こえるかを知っているだけでした。担当者がそう発言したとき、モデルは「それはソフトウェア企業がよく言うことだ」と判断し、合格点を与えたのです。 これこそが、汎用LLMを営業トレーニングに使う際の核心的な問題です:これらのモデルは真実ではなく、もっともらしさをチェックするのです。ある発言は、完全にもっともらしく聞こえながら、完全に間違っている可能性があります。「弊社の保証期間は48ヶ月です」「弊社はPlatform Xと直接連携しています」「この機能はProfessionalプランに含まれています」——これらはすべて信じられそうに聞こえます。そして、これらはすべて虚偽である可能性もあります——汎用モデルにはその違いを知る術がありません。 Vertex Cloudが代わりに構築したのは、類似製品がどう動くかについてのモデルの記憶ではなく、自社のドキュメントから出発するシステムでした。価格や機能が変わるたびにナレッジベースは再同期されます——だからこそ、7月に行われた検証が、10月になっても依然として実際の事実を反映しているのです。 営業リーダーへの示唆 もしあなたのAIトレーニングプラットフォームが、汎用LLMを使って担当者の製品知識を評価しているなら、商談が失われるまで気づかない問題を抱えている可能性があります。 そのモデルは、あなたの会社の料金表を読んだことがありません。最新の機能マトリクスも知りません。法務チームが先週承認した内容もまったく把握していません。ただ何がもっともらしく聞こえるかを知っているだけです——そして営業の現場では、もっともらしい誤答は正解とまったく同じ響きを持つのです。 解決策は、より賢い言語モデルではありません。より良い根拠です:企業が実際に公開している内容から出発し、モデルの一般的な想定ではなく、その情報源に対してすべての発言を検証するファクトグラウンデッド(事実に基づく)システムです。





Leave a Reply