Google、Qwen 3.5 397BをIronwood TPUで高速化——プリフィル最大4.7倍、デコード最大3.1倍
Google Developers Blogが、Qwen 3.5-397B MoEをTPU v7xで配信するためのJAX/Pallas最適化手法を公開した。
オープンウェイト系モデルの実用性は、モデル性能だけでなく推論コストと遅延をどこまで下げられるかで決まる。
ニュースをやさしく解説
結論から言うと、巨大なオープンウェイト系モデルをクラウドTPUで速く出すための実践知が公開された。Google Developers Blogは2026年7月14日、Qwen 3.5-397B MoEをIronwood(TPU v7x)で最適化した技術レポートを出した。
何が起きたかというと、3970億パラメータ級だが1トークンあたり170億だけを動かすQwen 3.5を、JAX/Pallasの再利用可能なカーネル群で配信しやすくした。
具体的には、8台論理デバイスでのAttention Data ParallelismとExpert Parallelism、Ragged Page Attention、SparseCoreを使うMoE処理、Gated DeltaNetの融合カーネルなどを組み合わせた。
4月から6月の間に、512同時実行のプリフィル重視ワークロードで約4.7倍、デコード重視で約3.1倍の性能向上を報告している。開発者にとっては、Qwenのような大規模・疎なモデルを安く速く動かすヒントになる。注意点は、これはGoogleの測定環境での技術報告で、手元PCで同じ速度が出る話ではない。実運用ではハード、同時実行数、モデル版で結果が変わる。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon機器評価順で探す ↗Amazon|ローカルLLM用ミニPC・メモリ・SSDを評価順で探すOllamaやLM Studioを自分のPCで快適に動かしたい人向けミニPC、メモリ、SSDなどをレビュー評価順で確認できます。対応メモリ規格と必要性能は公式要件と照らしてください。
- Amazon評価順で探す ↗Amazon|Python×AIプログラミング入門書を評価順で探すAIを使ったコード生成・自動化・ローカルLLM活用へ進みたい人向けPython、AI開発、Copilot/Cursor活用の周辺教材をレビュー評価順で確認できます。環境構築の難易度も見て選べます。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。