
画像: Pixabay
VRAM 12GBでQwen 35Bを動かす — エキスパートをGPUに載せないほど速くなった話
ニュース概要(出典記事の要点)
3か月前、私は同じRTX 4070でこんな検証記事を書きました。結論は「35BのMoEモデルは、待てるなら動く」。測ったのは10.6 tok/s。動くには動くが、チャットで使うには指が止まる速度です。 先週、同じGPU・同じモデルで測り直したら34.6 tok/sが出ました...
※ 上記は出典記事の要約です。本サイト独自の分析・背景解説は下記をご覧ください。
解説
皆さんは「生成AI」と聞くと、GoogleやOpenAIのような巨大企業が作る大規模なAIを想像するかもしれません。しかし、最近では、個人のパソコンでも動かせるような、少し小さめのAIモデルもたくさん登場しています。今回注目するのは、そうした「自宅で動かせるAI」の進化に関する驚きのニュースです。
記事の筆者の方は、グラフィックボード(GPU)という、AIの計算に欠かせない部品を使って、自分でAIモデルを動かす実験をされています。3ヶ月前、彼は「RTX 4070」という、ゲーミングPCによく使われるGPUで「Qwen 35B」というAIモデルを動かしてみたそうです。その時の感想は、「動くことは動くけど、ちょっと遅いかな」というものでした。具体的には、1秒間に10.6個の単語(トークン)を生成する速さでした。これは、チャットでAIと会話するには、少し待たされる感覚があったことでしょう。
ところが、たった3ヶ月後に同じGPU、同じAIモデルで再挑戦したところ、なんとその速度が3倍以上に向上し、1秒間に34.6トークンも生成できるようになったというのです。これは、まるで昔のインターネットがダイヤルアップ接続だった頃から、光ファイバーに変わったくらいの衝撃的な変化と言えるかもしれません。3ヶ月前には「待てるなら使える」レベルだったものが、今や「快適に使える」レベルになったわけです。
なぜこれほど劇的に速くなったのでしょうか?その秘密は、AIモデルの「賢さ」を保ちつつ、GPUに載せるデータの量を減らす技術が進化したことにあります。AIモデルは、たくさんの「エキスパート」と呼ばれる小さなAIの塊でできています。以前は、これらのエキスパートをすべてGPUに載せて計算していましたが、新しい技術では、必要なエキスパートだけを賢く選んでGPUに載せることで、VRAMというGPUの記憶領域の負担を減らし、処理速度を大幅に向上させることができたのです。これは、まるで大きな図書館の本を全て机に広げるのではなく、必要な本だけをサッと取り出して読むようなイメージです。AIを動かすためのソフトウェア(フレームワーク)の進化も大きな要因でしょう。
この技術の進歩は、私たち一般のユーザーにとって非常に大きな意味を持ちます。これまで高性能なAIは、専門のデータセンターや非常に高価なGPUでしか動かせませんでしたが、今回の進化によって、比較的手に入りやすいGPUでも、かなり実用的な速度で動かせるようになってきました。これは、AIがより身近になり、様々な個人開発や、企業の小規模なプロジェクトでも活用されやすくなる未来を示唆しています。例えば、自分のパソコンで動くAIアシスタントや、プライベートな情報を外部に送らずに処理できるAIツールなどが、より現実的になるかもしれません。
関連データ
ニュースタイムライン
2026年6月16日
文春「高市陣営のAI中傷動画」に決定的な矛盾。小泉氏攻撃に使われた写真は選挙後に撮影されたもの(篠原修司) - エキスパート - Yahoo!ニュースはてなブックマーク IT
2026年6月17日
高市陣営のAI中傷動画、共同通信と文春が相次ぎ訂正。矛盾した証拠をもとに国会で議論するのは正しいのか #エキスパートトピ(篠原修司) - エキスパート - Yahoo!ニュースはてなブックマーク IT
2026年6月19日
VRAMを減らして価格を下げる。AMDの新GPU「RX 9070 GRE」が示すメモリ不足の現実GIZMODO Japan
2026年6月19日
32GBのVRAMを搭載して他のグラボより激安の「Intel Arc Pro B70」はローカルAIを実際に動かすとどれぐらいの性能とトークンのコスパを発揮するのか?はてなブックマーク IT
2026年6月28日
🚀ローカル LLM 選び、もう「VRAM に入る一番デカいやつ」で決めるの卒業しよ? - whichllm を RTX 4060 Ti 16GB で測ってみた - Qiitaはてなブックマーク IT
参考引用
“35BのMoEモデルは、待てるなら動く。
― Qiita 人気記事
“測ったのは10.6 tok/s。
― Qiita 人気記事
“同じGPU・同じモデルで測り直したら34.6 tok/sが出ました。
― Qiita 人気記事
記事AI質問チャット
PREMIUMこの記事についてAIが質問に答えます。背景・要約・影響まで深堀り。
ログインして利用関連記事

Gemini“ヘビーユーザー”が1年で10倍に 「平均年齢高い、IT本業じゃない」首都高が実践したAI活用推進ノウハウ(ITmedia NEWS)
2026/8/4

「じわじわきますね」スイカバーから出てきたワンコに12万いいね⇒「かわいい当たり」「愛嬌たっぷり」(BuzzFeed Japan)
2026/8/4
](https://news-in-focus.com/api/images/og-images/ebefcf2c43d7eb273e0e97f6b0776ac3b626c837.jpg)
Western Digital「WD Blue」の12TB HDDが54,980円、Seagate「BarraCuda」の16TB HDDが64,980円などが特売、NAS・ビジネス向けは上昇傾向 [8月前半のHDD価格](AKIBA PC Hotline!)
2026/8/4

VPS.org の one-click deployment テンプレートに複数の脆弱性(ScanNetSecurity)
こんな記事も読まれています

Gemini“ヘビーユーザー”が1年で10倍に 「平均年齢高い、IT本業じゃない」首都高が実践したAI活用推進ノウハウ(ITmedia NEWS)
2026/8/4

「じわじわきますね」スイカバーから出てきたワンコに12万いいね⇒「かわいい当たり」「愛嬌たっぷり」(BuzzFeed Japan)
2026/8/4
](https://news-in-focus.com/api/images/og-images/ebefcf2c43d7eb273e0e97f6b0776ac3b626c837.jpg)
Western Digital「WD Blue」の12TB HDDが54,980円、Seagate「BarraCuda」の16TB HDDが64,980円などが特売、NAS・ビジネス向けは上昇傾向 [8月前半のHDD価格](AKIBA PC Hotline!)
2026/8/4

VPS.org の one-click deployment テンプレートに複数の脆弱性(ScanNetSecurity)
この記事について疑問がありますか?
事実誤認や不適切な内容について通報できます (要ログイン)。
異議申し立て・通報


