Qwen3.8-LiveTranslate(クウェン・スリー・ポイント・エイト・ライブトランスレート)とは
Qwen3.8-LiveTranslateとは、会議などの音声を聞きながら、別の言語の文字と音声を順次返すQwenの同時通訳モデルです。Qwenチームが2026年9月18日に発表しました。言葉だけでなく「誰が話したか」と直前までの会話も手がかりにする設計が特徴です。2026年9月時点の公式対応表には、日本語が入力と音声出力の両方に含まれます。
qwen3.8-livetranslate-flash-realtime複数人の会話をどう訳す?
複数人が交互に話す会議では、訳が正しくても「誰の発言か」が分からなければ議事の流れを追えません。このモデルは話す人を区別し、原語の文字と訳語の文字を同じ画面にそろえて返します。さらに、それまでの発言を手がかりに、人名や「それ」「彼」のように指す先があいまいな言葉を訳し分ける設計です。画面の原文を見ながら通訳のずれを確かめられる点も、聞き流すだけの通訳との違いでしょう。
日本語への対応と、ほかのQwenモデルとの違いは?
公式資料によると、60言語の間で訳を文字で返せ、そのうち29言語は訳を音声でも返せます(残りの31言語は文字だけ)。日本語は音声で返せる側に含まれます。ただし、どの言語の組み合わせでも同じ精度になるという意味ではありません。Qwen-MTは主に文章の翻訳、Qwen3 ASRは話した内容の文字起こしが中心。会議の録画を後から分析して要点を文字で答える用途なら、同じ日に発表されたQwen3.8-Omni-Flashの担当です。Qwen3.8-LiveTranslateは、発言を追いながらその場で別の言語にする役割に絞ったモデルです。
導入前に何を試す?
海外拠点との会議なら、まず社名・商品名が正しく伝わるか、複数人の発言を取り違えないか、日本語の音声が自然に聞けるかを短い実会議で試しましょう。社名や専門用語は、原語と訳語の組を「ホットワード」として前もって登録でき、公式は1,000語以内を推奨しています。遅延(話してから訳が出るまでの時間)の平均は、Qwenの評価で前世代の2.8秒から2.3秒へ縮みました。回線や端末を含めた実際の待ち時間を約束する数字ではないので、試用時に体感で確かめます。
設定を有効にすれば、訳した音声を話した本人に似た声で流すこともできます(ボイスクローン)。便利な反面、本人の声を複製して使う機能です。録音や声の利用について参加者の同意を得ることも運用上の確認点です。
提供元の開発者向け基盤ではAPIとして提供され、音声入力・文字出力・音声出力などは別々の課金項目。ウェブ検索や外部ツール操作には対応しないため、会議の要約や記録の自動配布まで必要なら別の仕組みを組み合わせます。通訳の質だけでなく、遅れ、費用、原文の確認手順を同じ試用条件で比べるのが現実的です。
Topicデモに『西遊記』の会話を選んだ
Qwen3.8-LiveTranslateに関するよくある質問
- カメラ映像がない会議でも使えますか?
- 使えます。公式資料では音声の入力が必須で、画像(映像のコマ)は任意です。映像も送ると、口の動きや身ぶり、画面に映った文字を手がかりにして、騒がしい場所や同じ音で意味が違う言葉の訳を補う仕組みです。
- 1時間の会議だと利用料はどのくらいですか?
- 2026年9月時点のシンガポールの定価(期間限定の割引を除く)で試算すると、会議音声1時間の入力が約0.19ドル、訳音声の出力は1時間分出ても約1.35ドルです。音声は入力が1秒7トークン、出力が1秒12.5トークンに換算され、100万トークンあたりの単価は入力音声が約7.5ドル、出力音声が約30ドル。一般向けの無料アプリではなく、Alibaba CloudのAPI経由の有料サービスです。