Qwen3.8-Omni-Flash(クウェン・スリー・ポイント・エイト・オムニ・フラッシュ)とは

Qwen3.8-Omni-Flashとは、文字・画像・音声・動画を読み取り、内容を文字で説明できるQwenのAIモデルです。Qwenチームが2026年9月18日に発表しました。会議の発言と画面上の資料、動画の音と映像を一緒に考える用途を狙う設計。ただし、Alibabaが提供するこのAPIモデルの出力は文字であり、音声で返答するRealtime版とは別です。以下は2026年9月時点の公式仕様です。

音と映像を何に使える?

会議の録画では、発言だけを聞いても「この案」の指す図表が分からないことがあります。Qwen3.8-Omni-Flashは、声と映像の両方から話している人を見分け、画面の情報で指す先のあいまいさを解いたうえで、議事録や、誰が何をするかの一覧(アクションアイテム)、プロジェクトのリスクを文字でまとめる役割。Qwenによれば、会議なら音声と映像で1時間分までをそのまま扱えます。長い動画から探したい場面を文字で示す使い方も想定されています。ウェブ検索や外部の道具を呼び出す機能もありますが、動画編集をモデル単体で完了させる意味ではありません。

LiveTranslateやRealtime版との違いは?

Qwen3.8-LiveTranslateは、話している間に別言語の訳を文字や音声で返す同時通訳向けです。一方、Qwen3.8-Omni-Flashは会議録や動画を分析して文字で答える役割。音声の返答と継続した会話が必要なら、別の「Qwen3.8-Omni-Flash-Realtime」を仕様表で選びます。「Omni」という系列名だけで出力形式を同一視しないことが重要です。

業務で試す順番は?

最初に「会議の決定事項を拾う」「研修動画から操作手順を探す」など、答えてほしい問いを一つ決めます。次に、実際の音質、映像内の文字、社内固有名詞で答えを人が照合しましょう。長い素材を扱える文脈長は、正確な理解の保証とは別です。録画・録音を外部APIへ渡す範囲と保存条件も確認しておきます。

費用の桁も押さえておきましょう。2026年9月時点の東京リージョンの単価は、入力が100万トークンあたり約0.113ドル、出力が約0.382ドル。音声は1秒が7トークンに換算されるため、1時間の会議音声を読ませても入力代は約0.003ドルと1セントに届きません。Qwenは、前世代のQwen3.5-Omni-Plusと比べて音声1時間あたりの入力価格が98%以上下がったと説明しています。ただし映像は音声とは別に数えられ、答えの長さや、3段階で選べる考える深さ(初期設定は最も深い段階)によっても費用は変わります。

Topic実演動画を「図付きノート」に変える試み

Qwenチームは、このモデルと組み合わせる公開ツール群に「Video2Note」も加えました。長い実演動画を読み、手順ごとに代表的な画面を選んで、文字と画像を並べたPDFノートにまとめる仕組みです。動画を何度も見返さずに学べる資料へ変えるという発想で、モデル単体の標準出力ではありません。

Qwen3.8-Omni-Flashに関するよくある質問

日本語の会議録を分析できますか?
対応しています。入力音声は113の言語・方言が対象で、Qwenの一覧では日本語が音声認識の74言語に含まれます(残りは中国語の方言39種)。ただし発表文には日本語だけの精度の数値は載っていないため、録音条件や社内固有の用語を含む実際の会議で確かめてください。
日本の拠点からAPIを利用できますか?
2026年9月時点の公式モデル情報には東京リージョンが掲載されています。利用するワークスペースとAPIキーの地域を合わせて設定する必要があります。

あわせて読みたい記事