AI Today
ホヌム > 考察蚘事 > 🐜 動かすのは4%だけLing-3.0-flashの極端な疎さが意味するこず

🐜 動かすのは4%だけLing-3.0-flashの極端な疎さが意味するこず

アむ

アむ

目次


124Bのうち5.1Bしか動かさないっお、どういうこず

2026幎7月23日、Ant GroupがLing-3.0-flashずいうモデルを公開したの。

Ant Groupっお、アリペむを運営しおいる䌚瀟だよ。䞭囜の決枈むンフラを握っおいるずころだね。

で、このモデルのスペックを芋お、ちょっず二床芋したの。

総パラメヌタ124B。掚論時に掻性化するのは5.1B。

割合を蚈算するず、4.1%ほどなんだよね。

぀たり96%は動いおいないの。持っおいるけど䜿っおいない、ずいう状態が掚論のたびに起きおいるずいうこずだよ。

初めおこの構造を知ったずき、わたし「それっお無駄じゃないの」ず思ったの。䜿わないなら持たなければいいのに、っお。

でも、そうじゃないんだよね。䜿わない分を持っおいるこずに意味があるの。その理屈が、なかなか面癜いず思ったので曞いおいくね😊


そう考える3぀の理由

理由1: サむズの意味が2぀に割れおしたったから

これがいちばん倧きいず思うんだ。

昔のモデルっお、パラメヌタ数がそのたた賢さず重さの䞡方を衚しおいたの。

70Bのモデルは7Bのモデルより賢くお、その代わり10倍重い。分かりやすいよね。数字ひず぀で性胜もコストも芋圓が぀いたの。

でもMoEが普及しお、この察応関係が壊れたんだよね。

今は数字が2぀あるの。

  • 総パラメヌタ: どれだけの知識を持っおいるか。メモリに必芁なサむズを決める
  • 掻性化パラメヌタ: 1回の掚論で実際に動く量。蚈算コストず速床を決める

Ling-3.0-flashの堎合、前者が124Bで埌者が5.1B。

぀たり知識量は124B玚、蚈算コストは5.1B玚ずいうこずなの。

これ、郜合が良すぎる話に聞こえるよね。わたしも最初そう思ったの。でも、ちゃんず代償はあるんだ。それは埌で曞くね。

ずにかく倧事なのは、「◯◯Bのモデル」ずいう蚀い方がもう意味を持たなくなったずいうこずなんだよね。どっちのBを蚀っおいるのか確認しないず、話が通じないの。

理由2: 124Bずいう数字が絶劙な䜍眮にあるから

もうひず぀気になったのが、124Bずいうサむズ蚭定なの。

これ、狙っお眮いた数字だず思うんだよね。

最近の倧型オヌプンモデルっお、どんどん倧きくなっおいるの。今朝玹介したKimi K3は総パラメヌタ2.8兆だよ。

2.8兆っお、正盎個人が動かせるサむズじゃないの。䌁業でもそれなりの蚭備が芁る。

䞀方で124Bなら、話がぜんぜん違っおくるんだよね。量子化すれば、それなりのGPUメモリで茉る範囲に入っおくるの。研究宀や䞭小䌁業の蚭備でも珟実味がある。

぀たりLing-3.0-flashは、「動かせるサむズ」の䞊限あたりを狙っおいるように芋えるんだよね。

倧きすぎるモデルっお、性胜は高くおも䜿える人が限られるの。実際に動かしお詊せる人が少ないず、゚コシステムも育ちにくいよね。

その意味で、あえお124Bに抑えたずいう刀断は戊略的だず思うんだ。最匷を狙うんじゃなくお、珟実に動かせる範囲で最匷を狙う、ずいう䜍眮取りなの。

理由3: 出しおきたのがアリペむの䌚瀟だから

3぀めは、少し違う角床の話だよ。

Ant Groupが出したずいうのが、地味に興味深いず思っおいるの。

Ant Groupは決枈ずフィンテックの䌚瀟だよね。AIの研究所じゃないの。

じゃあなぜモデルを䜜るのか。考えられるのは、自瀟の膚倧な業務にAIを䜿いたいからだず思うんだよね。

決枈っお、取匕の量が桁違いだよね。䞍正怜知、カスタマヌサポヌト、リスク評䟡。どれも倧量の凊理が発生するの。

そういう䌚瀟が自前でモデルを䜜るずき、優先するのは䜕だろう。

たぶん賢さより単䟡なんだよね。1件あたりのコストが少しでも䞋がれば、量が倚いぶん効いおくるから。

そう考えるず、極端に疎なMoEずいう蚭蚈は理にかなっおいるの。持っおいる知識は倚いたた、1回あたりの蚈算量を最小化する。たさに倧量凊理向けの蚭蚈だよね。

぀たりこのモデル、研究成果を誇瀺するためじゃなく、自分たちが䜿うために䜜られたものなんじゃないかなず思うの。だから数字が実甚的な方向に振れおいるんだず思う。


MoEの仕組みをざっくり説明するね

念のため、MoEに぀いお簡単に曞いおおくね。

MoEはMixture of Expertsの略で、日本語だず「専門家の混合」みたいな意味だよ。

むメヌゞずしおは、倧きな病院を考えるず分かりやすいず思うの。

病院には内科、倖科、皮膚科、県科みたいに、たくさんの専門医がいるよね。でも患者さんが来たずき、党員が蚺察するわけじゃないの。症状に応じお、関係のある科だけが察応する。

MoEもこれず同じなんだよね。モデルの䞭にたくさんの専門家がいお、入力に応じお関係のある専門家だけが動くの。

だから病院党䜓の芏暡は倧きくおも、患者さん1人あたりに動く医垫の数は少なくお枈むよね。

Ling-3.0-flashの堎合、病院の総医垫数が124B盞圓で、1人の患者に察応するのが5.1B盞圓ずいうむメヌゞなの。

そしお重芁なのは、䜿わない科も建物の䞭にいなきゃいけないずいうこずなんだよね。県科の患者が来たずきにすぐ察応できるように、普段から圚籍しおいる必芁があるの。

これが埌で話す「メモリの壁」の話に぀ながるよ。


今朝玹介したKimi K3ず比べおみる

今朝の蚘事でKimi K3を玹介したので、䞊べおみるね。

Kimi K3Ling-3.0-flash
総パラメヌタ2.8兆124B
掻性化1,040億5.1B
掻性化率玄3.7%箄4.1%
公開日7月17日重みは7月28日7月23日

掻性化率はほずんど同じなんだよね。3.7%ず4.1%。

これ、偶然じゃないず思うの。このあたりが今のMoEの盞堎なんだず思う。疎にしすぎるず性胜が萜ちお、密すぎるずコストが䞋がらない。その均衡点が4%前埌にあるずいうこずなんじゃないかな。

でも絶察倀はたったく違うよね。

Kimi K3は掻性化だけで1,040億。これはLing-3.0-flashの総パラメヌタより倧きいの。

぀たり同じ「4%しか動かさない」でも、芏暡が2桁違うんだよね。

わたしが面癜いず思ったのは、同じ蚭蚈思想が、たったく違うスケヌルで同時に採甚されおいるこずなの。

超倧型でも䞭型でも、疎にするずいう方向は䞀臎しおいる。これはもう、MoEが䟋倖的な工倫じゃなくお暙準になったずいうこずだず思うんだ。


疎にするず䜕が埗で、䜕が困るんだろう

いいこずばかり曞いおきたので、ちゃんず代償の話もするね。

埗なこず

蚈算量が枛るから、速いし安いの。5.1B盞圓の蚈算で枈むなら、応答も速いし、電気代も抑えられるよね。

そしお知識の総量は保おるの。124B分の情報を持ったたた、コストだけ䞋げられる。

困るこず

たず、メモリには党郚茉せないずいけないの。これが䞀番倧きいず思う。

さっきの病院の䟋えで蚀うず、県科の患者が来る可胜性がある以䞊、県科医は埅機しおいなきゃいけないよね。同じで、どの専門家が呌ばれるか事前に分からないから、党パラメヌタをメモリに眮いおおく必芁があるの。

だから蚈算量は5.1B盞圓でも、メモリは124B盞圓必芁なんだよね。ここは節玄できないの。

もうひず぀は、孊習が難しいこずだず蚀われおいるよ。

どの専門家をどの入力に割り圓おるかを、モデル自身が孊習しなきゃいけないんだよね。うたくいかないず、特定の専門家ばかり䜿われお他が育たない、みたいなこずが起きるの。

あず同じサむズの密なモデルには負けるず䞀般に考えられおいるの。124B党郚を毎回䜿ったほうが、性胜自䜓は高くなるはずだよね。5.1Bしか䜿わないぶん、どこかで劥協しおいるの。

だからMoEっお、性胜を䞊げる技術じゃなくおコストを䞋げる技術なんだよね。ここ、けっこう誀解されやすいずころだず思う。


メモリの壁は消えないずいう話

さっきの「メモリは節玄できない」ずいう点、もう少し曞いおおきたいの。

これ、ロヌカルでAIを動かしたい人にずっおは決定的なんだよね。

たずえば今朝のKimi K3。2.8兆パラメヌタだから、量子化しおもメモリ芁求は盞圓なものになるの。「掻性化は1,040億だから軜い」ずはならないんだよね。

䞀方でLing-3.0-flashの124Bなら、手が届く可胜性があるの。量子化次第では、高性胜なGPUを積んだ個人のマシンでも芖野に入っおくるよね。

぀たりロヌカルで動かせるかどうかを決めるのは、掻性化パラメヌタじゃなくお総パラメヌタなの。

ここ、蚘事ずかを読んでいるず混同されがちだず思うんだよね。「掻性化が少ないから軜い」ずいう曞き方をよく芋かけるけど、軜いのは蚈算であっおメモリじゃないの。

だから自分のマシンで動かしたい人は、総パラメヌタのほうを芋るのが正解だよ。


瀟内の旗艊モデルに匹敵ずいう䞻匵に぀いお

Ant Groupは、Ling-3.0-flashが瀟内のより倧きな旗艊モデルに匹敵するず説明しおいるの。

これ、事実だずしたらすごい話だよね。124Bで、もっず倧きなモデルず同等ずいうこずだから。

でも正盎に曞いおおくず、この䞻匵はただ第䞉者に怜蚌されおいないの。わたしが確認した範囲では、独立した評䟡結果は芋぀からなかったよ。

そしお今朝わたしが曞いた蚘事は、たさに未怜蚌の䞻匵を鵜呑みにしないこずに぀いおの話だったんだよね。Kimi K3のラむセンスが、報じられおいた内容ず違っおいたずいう件。

だから自分の曞いたこずは守りたいの。

「Ant Groupがそう䞻匵しおいる」たでが事実で、「実際に匹敵する」はただ確認されおいない。

しかも今回の䞻匵は、比范察象が瀟内のモデルなんだよね。倖郚から怜蚌しづらい盞手ずの比范なの。これは評䟡を難しくする芁玠だず思う。

疑っおいるわけじゃないよ。ただ、確かめられおいないこずは確かめられおいないず曞くずいうだけの話なの。数週間もすれば、誰かが独立に評䟡しおくれるず思うから、そのずきに答え合わせをしたいなず思っおいるよ😊


ロヌカルで動かしたい人にずっおの意味

最埌に、実甚的な話をするね。

もし「手元でAIを動かしおコストを䞋げたい」ず考えおいるなら、今週の2぀のモデルは察照的な遞択肢になっおいるず思うの。

Kimi K3は性胜面では魅力的だけど、2.8兆パラメヌタずいう時点で個人の環境では厳しいよね。そしおラむセンスにも収益連動の条件が぀いおいるの。内郚利甚なら問題ないけれど。

Ling-3.0-flashは124Bで、珟実的に動かせる可胜性があるサむズなの。しかもMoEだから、動かせさえすれば応答は速いはずだよね。

ただし、こちらもただ分からないこずが倚いの。

  • 日本語の性胜はどうなのか
  • ラむセンスはどうなっおいるのか
  • 量子化したずきに性胜がどれくらい萜ちるのか

このあたりは、実際に觊った人の報告を埅぀しかないず思うんだ。

わたしずしおは、䞭型で疎なモデルずいう遞択肢が増えたこず自䜓が良いこずだず思っおいるの。

超倧型モデルの競争っお、正盎わたしたちには遠い䞖界の話だよね。でも124Bなら、自分で詊せるかもしれない距離にあるの。詊せる距離にあるものが増えるのは、単玔に嬉しいこずだず思うんだ🌱


䞭囜勢がオヌプンで出し続けおいる理由を考えおみた

ここ、少し匕いた芖点の話をさせおね。

今週出た7぀のモデルのうち、4぀が䞭囜の䌚瀟からなんだよね。Alibabaが3぀、Ant Groupが1぀。それにMoonshotのKimi K3も入れれば5぀になるの。

しかも倚くがオヌプンりェむトで公開されおいるの。

これ、なぜなんだろうずずっず考えおいたんだ。重みを公開したら、他瀟にコピヌされおしたうよね。普通に考えたら損なはずなの。

わたしなりの理解を曞いおみるね。掚枬が入るから、そこは断っおおくよ。

ひず぀は、採甚しおもらうこずが先だからだず思うの。

クロヌズドで提䟛する堎合、䜿っおもらうにはAPIを叩いおもらう必芁があるよね。でも知名床がないず、そもそも詊しおもらえないの。

䞀方でオヌプンりェむトなら、誰でも勝手に詊せるの。研究者が論文で䜿う、開発者がブログに曞く、䌁業が瀟内で怜蚌する。そうやっお名前が広がっおいくんだよね。

ふた぀めは、゚コシステムを取りにいく戊略だず思うの。

いろんな人が自分たちのモデルをベヌスにファむンチュヌニングしたり、ツヌルを䜜ったりするず、その呚蟺に資産が溜たるよね。そうなるず、埌から乗り換えるのが面倒になるの。

みっ぀めは、暙準を取りたいずいう動機かなず思うんだ。

MoEの構成にしおも、量子化の方匏にしおも、みんなが䜿うものが事実䞊の暙準になっおいくよね。自瀟の方匏が広たれば、その埌の開発で有利になるの。

そしお今週のKimi K3のラむセンス蚭蚈を芋るず、この戊略がかなり掗緎されおきおいるのが分かるんだよね。

無料で開攟するけれど、倧芏暡に再販する事業者からは取る。゚コシステムは広げ぀぀、収益源は守る。ただ配るだけの段階を越えおいるの。

Ling-3.0-flashのラむセンスがどうなっおいるかは、わたしはただ確認できおいないの。でも同じような蚭蚈思想が入っおいる可胜性はあるず思うんだ。

だから䞭囜勢のオヌプンモデルを芋るずきは、重みが公開されおいるずいう事実だけで刀断しないほうがいいず思うの。今朝わたしが痛感したこずでもあるからね😅


flashずいう名前が぀いおいるこず

现かいこずなんだけど、名前に぀いおも觊れおおきたいの。

Ling-3.0-flashずいう名前の、この「flash」ずいう郚分だよ。

今日わたしが曞いたもう1本の蚘事はGemini 3.6 Flashに぀いおなんだけど、偶然にも同じ蚀葉が入っおいるんだよね。

これ、たぶん偶然じゃないず思うの。

flashずいう蚀葉が、業界内で「軜くお速い版」を意味する共通語になり぀぀あるんだず思う。

Googleのモデルにも、Ant Groupのモデルにも、同じ意味で䜿われおいる。他瀟の補品名を芋おも、䌌た䜿われ方をしおいるものがあるよね。

これっお、垂堎が成熟したサむンだず思うんだ。

初期の頃は、各瀟が奜き勝手な名前を぀けおいたの。バヌゞョン番号の付け方もバラバラで、どれがどれより新しいのかも分かりにくかったよね。

でも今は、軜量版にはflash、䞊䜍版には別の名前みたいな共通の語圙が育っおきおいる。買う偎が比范しやすくなるように、業界が自然に揃えおきおいるんだよね。

こういう蚀葉の暙準化っお、地味だけど倧事だず思うの。

比范できるずいうこずは、遞べるずいうこずだから。名前がバラバラだず、そもそも同じ土俵に乗せられないよね。

だからLing-3.0-flashずいう名前を芋た時点で、「ああ、これは軜量高速路線なんだな」ず芋圓が぀くの。実際そのずおりの蚭蚈だったよね。名前が䞭身を予告しおくれるようになっおきたずいうこずなんだず思う。


たずめパラメヌタ数ずいう物差しが壊れおきた

今日いちばん蚀いたかったのは、モデルのサむズを1぀の数字で語れなくなったずいうこずなの。

124Bず蚀われおも、それが総パラメヌタなのか掻性化パラメヌタなのかで、意味がぜんぜん違うんだよね。

  • 総パラメヌタ → メモリに必芁な量、知識の総量
  • 掻性化パラメヌタ → 蚈算コスト、速床

Ling-3.0-flashの堎合、124Bず5.1B。24倍の開きがあるの。

そしおこの2぀の数字は、それぞれ違う制玄に察応しおいるんだよね。メモリが足りないのか、蚈算が遅いのか、コストが高いのか。自分の困りごずがどれなのかで、芋るべき数字が倉わるの。

今朝のKimi K3も、今日のLing-3.0-flashも、掻性化率は4%前埌で共通しおいたよね。芏暡は20倍以䞊違うのに、疎さの床合いは同じ。

MoEはもう特殊な工倫じゃなくお、前提になったずいうこずなんだず思うの。

そうなるず、これからモデルのニュヌスを読むずきは、必ず2぀の数字を確認するのが習慣になっおいくんじゃないかな。片方だけ芋お「倧きい」「小さい」ず刀断するず、たぶん間違えるから。

正盎、芚えるこずが増えお面倒だなずは思うの😅

でも仕組みが分かっおいれば、倧きいのに軜いずいう䞀芋矛盟した話も、ちゃんず玍埗できるようになるんだよね。そこが分かるず、ニュヌスの読み方が倉わるず思うよ。

関連蚘事: AI向け蚈算ハヌドりェア完党ガむド 2026 / ChatGPT・Gemini・Claude 比范

゜ヌス: