解説
「小脳」と「脳」で会話を止めないAI、Tencent新モデルGanderの仕組み
音声アシスタントに話しかけている最中、返事を待つ間に別の作業を頼みたいと感じたことがある人は少なくないはずです。Tencentが発表した研究モデル「Gander」は、会話とタスク処理を担当分けすることでこの問題に取り組んでいます。仕組みを理解しておくと、社内で音声AIを使う際の判断材料になります。
何が起きたか
Tencentの音声AIチーム「Hunyuan Speech」と複数の大学の研究者が、新しいAIモデル「Gander」を発表しました。技術報告によると、音声・画像・テキストを同時に受け取りながら、複雑なタスクを裏で処理しつつ会話を続けられるよう設計されています。
Ganderは会話の受け答えを担う「小脳」と、推論や複雑なタスクを裏側で処理する「脳」を分離した構造を採用しています。「脳」の部分は既存のエージェントシステムに差し替え可能で、実験ではOpenAIのGPT-5.6系列のモデルが使われました。
音声アシスタントの性能を測るベンチマーク「Full-Duplex-Bench v3」では、100件のシナリオすべてで適切なタイミングで発話を始め、ユーザーへの割り込みは8%にとどまりました。比較対象のGPT-Realtimeは13.5%、最も成績の低い競合は約48%だったといいます。一方でタスクの正確性は、最も成績の低い競合をわずかに下回る結果でした。
Tencentは重みと学習データの公開を計画しており、コード用のGitHubリポジトリは既に公開されているとのことです。
背景・解説
「小脳」と「脳」という呼び方は、研究者が人体の構造になぞらえて名付けたものです。小脳は反射的な動きの調整を担う器官になぞらえられ、Ganderではリアルタイムの会話進行を受け持ちます。脳は複雑な思考を司る器官になぞらえられ、こちらはコードのバグ修正や資料検索といった、じっくり考える必要のあるタスクを担当します。
背景には、既存の音声アシスタントの多くが「話す」と「聞く」を交互にしか行えないという課題があります。実際の人間同士の会話では、相手の話に割り込んだり、相づちを打ちながら聞いたりといったやり取りが自然に発生します。Ganderはこの「二重の同時進行」を再現するため、映像・音声・テキストを常時処理し続ける設計になっています。会話の内容は1秒単位の区切りで処理され、話す・聞く・止まるをそのつど判断する仕組みです。
Full-Duplex-Bench v3は、こうした会話用AIをさまざまな課題設定で評価するベンチマークです。Ganderのような「会話しながらタスクをこなす」AIを専用に測る基準はまだ確立されておらず、既存のベンチマークを組み合わせて評価している段階だといいます。
同様に会話とタスク処理を分離する動きは他社にも見られます。OpenAIの「GPT-Live」は会話と推論を分けてWeb検索などを裏側のモデルに任せる仕組みを持ち、Sakana AIの「Fugu」も複数のモデルを呼び分ける構成を採用しています。
仕事や業務への影響 — AI Topicaの見方
音声で指示を出しながら別作業を並行させたい業務ほど、この二重構造の恩恵は大きくなります。例えば、コールセンターのオペレーター10人が抱える会社であれば、顧客と会話を続けながら裏で過去の対応履歴を検索するような使い方に向いています。会話用のAIと処理用のAIを分けておけば、片方の性能が上がったときにもう片方を作り直す必要がありません。
ただし、現時点のGanderはタスクの正確性で競合にわずかに劣る結果が出ています。バグ修正や在庫確認のように「間違いが許されない」業務にそのまま使うのは早計です。例えば、経理担当者2人の中小企業が請求書のチェックを音声AIに任せる場合、金額の読み上げミスが後工程に響く可能性があるため、まずは音声での進捗確認や簡単な問い合わせ対応から試すのが妥当です。
会話の割り込み精度が高いという結果は、営業や受付のように「相手を待たせない」ことが評価に直結する業務での使いどころを示しています。反対に、正確な数値処理や画像内の物体認識が絡む業務では、脳の役割を担う既存のエージェントの精度に依存する部分が大きく、Gander自体の性能だけで判断すべきではありません。
不確かな点・注意
Ganderの重みと学習データは、報告時点ではまだ公開されておらず、Tencentは「オープンソース化の手続き」を終えた後に公開する方針を示しているにとどまります。公開時期や条件については触れられていません。
タスク処理を担う「脳」の性能は外部のエージェントシステムに依存する構造のため、Gander単体の実力を測りにくい面があります。報告では、テキストを直接与えた場合の方が脳の成績が良いとされており、音声認識の誤りが総合スコアを押し下げている可能性も指摘されています。
映像や音声の理解については、物体を数えたり位置を特定したりする課題でベースモデルより成績が落ちる結果も出ています。会話の流暢さを優先する学習が、細かい認識精度を犠牲にした可能性があるとされていますが、原因の特定はこれからの課題です。スケールアップの方法や、この種のモデルを評価する標準的な手法もまだ確立されていません。