Alibabaが2026年9月18日、オムニモーダル(テキスト・画像・音声・動画をまとめて扱う)モデル「Qwen3.8-Omni-Flash」をAPIで提供開始しました。 Alibaba Cloud Model Studioの公式ドキュメント によると、コンテキストウィンドウは100万トークン、音声は113の言語・方言に対応し、日本(東京)を含む6リージョンで利用できます。録画会議や長時間の動画・音声を大量に抱えている現場にとっては、処理単価の選択肢が一つ増えた形です。
仕様を先に押さえる
公式ドキュメントに書かれている数字は次のとおりです。入力はテキスト・画像・音声・動画、出力はテキストのみ。最大入力長は非thinkingモードで991,808トークン、thinkingモードで983,616トークン、最大出力長は131,072トークンです。音声の対応言語・方言は113で、これは前世代のQwen3.5-Omniと同じとされています。マルチチャネル音声(複数マイクで録った音源)にも対応します。
提供リージョンは中国(北京)、シンガポール、中国(香港)、日本(東京)、ドイツ(フランクフルト)、米国(バージニア)の6つです。APIはChat CompletionsとResponsesの形式で、OpenAI互換のSDKからも呼べます。オープンウェイトの公開は発表されておらず、現時点ではAPI経由のみの提供です。
「全部見る」のをやめて安くした
前世代からの変化として、Qwenが押し出しているのは精度よりもコストです。同社の発表によれば、音声入力のAPI費用は1時間あたりで98%以上、音声と映像を合わせた入力では93%以上下がったとしています。
仕組みとして説明されているのが「エージェント的知覚」と呼ばれる考え方です。長い動画を全フレーム均等にトークン化して読ませるのではなく、モデル自身が必要な箇所を選んで見に行く。長時間動画の理解を測るOmniVideoBenchでは、正答率が63.4から67.8に上がる一方で、1問あたりのトークン消費が約45.7%減ったという結果が示されています。精度とコストを同時に動かした、という主張です。
Qwenは29のベンチマークの平均で前世代のQwen3.5-Omni-Plus比25%以上の向上、マルチモーダルのエージェント評価WildClawBench-MMでは36.5ポイント増の71.0を報告しており、音声分野ではGemini 3.8 Flashを上回るとも述べています。ただしこれらはいずれもベンダーの自社計測で、第三者による再現はまだありません。数字は方向性の参考にとどめるのが妥当です。
会話用の音声モデルとは役割が違う
ここ2週間で、音声まわりの発表が続いています。当サイトでも OpenAIのGPT-Live-1(全二重音声) と Gemini 3.8 Live を取り上げましたが、Qwen3.8-Omni-Flashはこれらとは用途が違います。
前者2つは、人と話す前提のモデルです。こちらから話しかけると音声で返ってくる。対してQwen3.8-Omni-Flashは出力がテキストのみで、リアルタイムの会話には向きません。代わりに得意なのは、すでに存在する大量の音声・映像を読んで、要約や検索や分類の形でテキストに落とす仕事です。議事録の自動化、問い合わせ録音の傾向分析、教材動画からの索引作成といった、バッチで回す種類の処理が想定されます。
日本の読者にとっての使いどころ
東京リージョンで提供されている点が実務上は大きいと考えられます。会議録音や顧客との通話には個人情報が含まれることが多く、処理地域が選べるかどうかで社内の承認の通りやすさが変わります。ただし、リージョンを選べることと、データが保存されないことや学習に使われないことは別の話です。実際に業務データを流す前に、Model Studioのデータ取り扱い条件を契約面で確認しておく必要があります。
価格は、 QwenCloudのモデルページ に100万トークンあたり入力0.15ドル・出力0.47ドル、キャッシュヒット時の入力0.016ドルと示されています。仮に1ドル150円で換算すると、入力が約23円、出力が約71円です。レート上限は毎分200万トークン・3万リクエストとされています。ただしAlibaba Cloud Model Studio経由の場合はリージョンごとに単価が異なることがあるため、実際に契約する窓口の 料金ページ でも確認してください。(9月21日追記: 公開時は報道ベースの元建て価格を載せていましたが、QwenCloud公式ページの価格に差し替えました)
試すなら、手元にある1時間程度の会議録画を1本だけ投げて、同じ処理をいま使っているモデルと並べてみるのが早いと思います。見るべきは要約の質よりも、消費トークン数と、日本語の固有名詞(社名・製品名・人名)がどれだけ正しく起こせているかです。113言語対応という表記は、日本語の一般会話が通ることは示しても、専門用語の精度までは保証しません。
注意しておきたいところ
オープンウェイトが公開されていないため、オンプレミスや自社クラウドでの実行はできません。長期運用を前提にするなら、提供停止や価格改定のリスクをベンダー1社に預ける形になります。また出力がテキストのみなので、音声を返す必要がある用途では別のモデルと組み合わせる設計が要ります。
ベンチマークの数字が自社計測であることも、繰り返しになりますが押さえておきたい点です。特にGemini 3.8 Flashとの比較は、評価条件が公開されていない以上、自分のデータで測り直すまでは判断材料になりません。


