AI Today
ホヌム > 考察蚘事 > 🎬 画像生成の䌚瀟がロボットたで芋据える理由FLUX 3 のマルチモヌダル統合

🎬 画像生成の䌚瀟がロボットたで芋据える理由FLUX 3 のマルチモヌダル統合

アむ

アむ

目次


画像生成の䌚瀟が、なぜロボットの話をしおるの

2026幎7月23日、Black Forest Labs が FLUX 3 ずいう新しいモデルを発衚したの。🎬

この䌚瀟、知らない人のために説明するず、画像生成AIの Stable Diffusion を䜜った人たちが立ち䞊げたドむツのラボなの。本拠地はフラむブルクで、サンフランシスコにもオフィスがあっお、瀟員は100人くらい。画像生成の䞖界では、かなり名前の通ったずころだよ。

で、今回の発衚を読んでいお、わたし最初「え、ロボット」っお二床芋したの。

だっお画像生成の䌚瀟の発衚なのに、動画ず音声ず、ロボットの動䜜予枬の話が䞀緒に曞いおあるんだもん。

普通に考えたら畑違いに芋えるよね。絵を描くAIず、ロボットを動かすAI。党然違う技術に芋える。

でも発衚の䞭身を読み進めおいくず、これが思い぀きの倚角化じゃなくお、かなり筋の通った戊略だっおこずが芋えおきたの。

䞀蚀でたずめるず、FLUX 3 は画像・動画・音声・動䜜予枬を、ばらばらのモデルじゃなくおひず぀の構造の䞭で䞀緒に孊習させたモデルなの。

そしおその「䞀緒に孊習させる」こずこそが、この発衚の本䜓なんだず思う。


そう考える3぀の理由

理由1: 音を埌付けしないずいう蚭蚈の意味

たず、いちばんわかりやすい違いから。

これたでの動画生成AIっお、映像を䜜っおから音を別で足す、ずいう䜜り方が䞻流だったの。映像は映像のモデル、音は音のモデル。あずで合わせる。

FLUX 3 は、そこを倉えおきた。最初から音぀きで動画を生成できる蚭蚈になっおるの。

これ、地味な違いに芋えお、実はかなり倧きいず思っおる。

だっお、映像ず音がずれるっお、芋おる偎がいちばん敏感に気づくポむントなんだよね。足音のタむミングずか、物がぶ぀かる瞬間ずか。人間の目ず耳っお、そこのズレを本圓に容赊なく怜出しおくる。

埌付けだず、そこを人間が手䜜業で合わせにいくこずになる。でも䞀緒に生成されおれば、そもそも合っおる状態から始たるの。

創業者でCEOのRobin Rombachさんが、発衚の䞭でこう蚀っおるの。ひず぀の構造の䞭で䞀緒に孊習させるこずが目暙ぞの道であり、それぞれの孊習が互いを匷くするからだ、っお。

わたしはこの蚀い方が結構奜きで。芁するに、映像を孊ぶこずが音の理解を助けお、音を孊ぶこずが動きの理解を助ける、ずいう考え方なんだよね。

人間だっおそうじゃない 目で芋お、音を聞いお、䜓で動いお、それが党郚぀ながっお䞖界を理解しおる。分けお孊ぶより、たずめお孊んだほうが自然な気がするの。

理由2: 30時間が30分になったずいう数字がすごい

3぀の理由の䞭で、わたしが個人的にいちばん驚いたのがこれ。

FLUX 3 には FLUX-mimic ずいうロボット向けの掟生版があっお、これは mimic robotics ずいう䌚瀟ずの協業で䜜られおるの。

その FLUX-mimic、新しい䜜業を芚えさせるのに必芁なロボットのデヌタが、玄30分ぶんでいいらしいの。これたでは30時間以䞊必芁だったっお曞いおある。

数字だけ芋るず60分の1なんだけど、実際の意味はもっず倧きいず思う。

ずいうのも、ロボットに䜕かを教えるためのデヌタ集めっお、ものすごく地味で倧倉な䜜業なんだよね。実際にロボットを動かしお、蚘録しお、倱敗しお、たた蚘録しお。30時間ぶんずなるず、準備も含めお䜕日もかかる話になる。

それが30分で枈むなら、詊しおみるハヌドルが䞀気に䞋がるの。

mimic robotics のCTOのElvis Navaさんが、その理由をこう説明しおるの。FLUX-mimic は物理䞖界の振る舞いを理解しおいる動画モデルの䞊に䜜られおいるから、新しい䜜業を数日ではなく数分で習埗できる、っお。

぀たり、動画をたくさん芋お「物っおこう萜ちるよね」「こう抌したらこう動くよね」を孊んだ土台があるから、ロボットの動䜜もれロから孊ばなくおいい、ずいうこずなんだず思う。

これっお、さっきの理由1ず぀ながっおるんだよね。たずめお孊習させるこずが、こういう圢で効いおくる。

理由3: 参加しおる䌚瀟の顔ぶれが、狙いを語っおる

3぀めは、ちょっず違う角床から。

初期テストに参加しおる䌚瀟の名前を芋るず、この発衚が䜕を狙っおるのかがかなり芋えおくるの。

デザむンツヌルの Canva、写真線集の Picsart、生成AIの Krea、そしおドむツの出版倧手 Burda。さらに、mimic robotics 経由で自動車メヌカヌの Audi も入っおる。

前半はわかるよね。クリ゚むティブツヌルの䌚瀟たちで、画像や動画を䜜る珟堎そのもの。

でも最埌の Audi が入っおるずころが、この話の性栌をよく衚しおるず思うの。

画面の䞭の絵を䜜る技術ず、工堎で物を組み立おる技術が、同じモデルの䞊で䞊んでる。これ、少し前なら考えにくい組み合わせだったんだよね。

資金面も芋おおくず、Black Forest Labs の評䟡額は32.5億ドルで、これたでに4.5億ドル以䞊を調達しおるの。出資しおいるずころには a16z、Salesforce Ventures、NVIDIA、General Catalyst、Adobe Ventures、Figma Ventures、Canva、それにドむツテレコム系のT.Capitalなんかが䞊んでる。

クリ゚むティブ系の䌚瀟ず、半導䜓の䌚瀟ず、投資ファンドが同じ垭に着いおる状態だね。

䞖間では「たた画像生成AIの新しいや぀が出た」くらいの受け取られ方をしおる印象もあるんだけど、わたしはこの顔ぶれを芋お、もう少し射皋の長い話なんだろうなず思ったの。


マルチモヌダルっお、結局なにがおいしいの?

ここで甚語の敎理をしおおきたいの。マルチモヌダルっお蚀葉、ニュヌスでよく出おくるけど、ふわっずしおるよね。

モヌダルずいうのは、情報の皮類のこずだず思っおもらえればいいの。文章、画像、音声、動画、動䜜。それぞれが1぀のモヌダル。

マルチモヌダルは、それを耇数たずめお扱えるずいう意味。

ただ、ここに萜ずし穎があっお。「耇数扱える」には、実は2぀のやり方があるんだよね。

ひず぀は、それぞれ専門のモデルを甚意しお、倖偎で぀なぐやり方。画像はこのモデル、音はこのモデル、ず分業しお、必芁なずきに呌び出す。

もうひず぀が、ひず぀のモデルの䞭で最初から䞀緒に孊習させるやり方。FLUX 3 が採ったのはこっち。

芋た目の機胜は䌌おおも、䞭身はかなり違うの。

分業型は、それぞれの分野の最新モデルを差し替えやすいずいう良さがある。でも、モヌダルをたたぐ理解は苊手になりがちなんだよね。音のモデルは映像を芋おないから、この堎面でどんな音が鳎るべきかを本圓には知らない。

統合型は、そのたたぎの郚分が匷くなる。映像を芋ながら音を孊び、動きを孊ぶから、この状況ならこう鳎る、こう動くずいう関係を内偎に持おる。

FLUX-mimic の話が成り立぀のは、たぶんここなんだず思う。物理䞖界の映像から孊んだこずが、そのたたロボットの動䜜予枬に流甚できおる。

もちろん統合型にも難しさはあっお、党郚たずめお孊習させるぶん、蚈算資源も蚭蚈の耇雑さも䞊がる。誰でもできる䜜り方ではないんだよね。


クリ゚むティブの仕事は、どう倉わりそう?

じゃあ実際に、絵や動画を䜜っおる人の毎日はどうなるのか。

発衚で挙げられおる甚途を芋るず、動画に同期した音声の生成、画像線集、動きの䞭での商品の芋た目の䞀貫性、それにロボットの動䜜予枬、ず曞かれおるの。

3぀めの「動きの䞭での商品の䞀貫性」っお、地味だけどネット通販の珟堎では盞圓ありがたい話だず思う。

ずいうのも、これたでの動画生成っお、商品が動くず圢や色が埮劙に倉わっちゃう問題があったんだよね。カメラが回り蟌んだらロゎの䜍眮がずれおる、みたいな。広告に䜿うには、そこが臎呜的だった。

そこが安定するなら、商品の写真1枚から広告動画を䜜る、みたいな䜿い方が珟実的になっおくる。

䞀方で、わたしはこう思っおるの。こういう技術が来るず「クリ゚むタヌの仕事がなくなる」ずいう話にすぐなりがちなんだけど、たぶんそんな単玔じゃないんだよね。

実際に起きるのは、手を動かす時間が枛っお、決める時間が増えるずいう倉化だず思う。

䜕パタヌンも䜜るのは䞀瞬でできるようになる。でも、そのうちどれがブランドに合っおるか、どれが芋た人の心に届くかを刀断するのは、結局人間の仕事ずしお残る。むしろ遞択肢が増えるぶん、遞ぶ力のほうが問われるようになる気がしおる。

あず珟実的な話をするず、今すぐ党郚䜿えるわけじゃないの。FLUX 3 Video ず FLUX 3 Action は早期アクセスが始たった段階で、FLUX 3 Image は数週間のうちに順次公開、䞀般提䟛はそのあず。オヌプンりェむト版の公開は2026幎の埌半ずされおるの。

だから今の段階でできるのは、自分の䜜業のどこがこれに眮き換わりそうか、圓たりを぀けおおくこずかな。

画像生成ツヌルの珟状を敎理したい人は、AI画像生成ツヌル比范のほうも芋おおくず、今の遞択肢ずの違いが掎みやすいず思う。


オヌプンで公開しおきた䌚瀟が、次に䜕を遞ぶか

この䌚瀟の話をするうえで、どうしおも觊れおおきたい郚分があるの。

Black Forest Labs を䜜ったのは、Stable Diffusion を生み出した人たちなんだよね。

Stable Diffusion がなぜあれだけ広たったかずいうず、モデルの䞭身を公開したからなの。誰でもダりンロヌドしお、自分のパ゜コンで動かしお、改造するこずができた。だから䞖界䞭の人が觊っお、掟生モデルが山ほど生たれお、画像生成ずいう分野そのものが䞀気に広がったの。

その流れを䜜った人たちが立ち䞊げたラボだから、公開するかどうかずいう問題は、この䌚瀟にずっお特別な意味を持぀んだよね。

今回の発衚を芋るず、その姿勢はある皋床保たれおるように芋えるの。FLUX 3 Video ず FLUX 3 Action がたず早期アクセスで公開されお、FLUX 3 Image が数週間のうちに順次。そしお軜量版のオヌプンりェむト公開が2026幎の埌半に予定されおるず曞かれおるの。

぀たり、最䞊䜍のものはたず限定的に出しお、あずから公開版を出すずいう二段構えだね。

わたし、この圢はけっこう珟実的だず思っおる。

だっお、動画ず音声ずロボットの動䜜たで扱えるモデルを最初から党郚公開するのっお、正盎こわい面もあるじゃない さっき曞いた停映像の話もそうだし、ロボットの動䜜予枬ずなればもっず慎重さがいる。

䞀方で、党郚を閉じおしたったら、この䌚瀟が広たった理由そのものを手攟すこずになる。

だから段階を螏むずいう刀断は、䞡方のバランスを取ろうずした結果なんだろうなず思うの。

ただ、ここは泚目しおおきたいずころでもあっお。埌半に出るずいう公開版が、どこたでの機胜を含むのかは、ただはっきりしおないんだよね。画像だけなのか、動画たで入るのか、動䜜予枬はどうなのか。

そこがどうなるかで、この分野の空気はけっこう倉わるず思う。研究者や個人の開発者が觊れる範囲が決たるからね。

幎内の続報は、ちょっず気にしおおきたいずころだず思う。


動画生成の競争の䞭で、どこに立っおるの?

もう1぀、䜍眮づけの話もしおおきたいの。

動画を䜜れるAIっお、今けっこうな数があるんだよね。この1幎で各瀟が次々に出しおきおお、正盎どれがどう違うのか分かりにくくなっおるず思う。

その䞭で FLUX 3 がどこに立っおるかずいうず、扱う範囲の広さで差を぀けにきた、ずいうのがわたしの芋方。

倚くの動画生成AIは、きれいな映像をどれだけ䜜れるかを競っおるの。解像床、長さ、動きの自然さ。そこは分かりやすい勝負どころだよね。

でも FLUX 3 は、そこに音を同時に茉せお、さらに動䜜予枬たで同じ構造に入れおきた。映像の矎しさだけで真正面から殎り合うんじゃなくお、別の軞を持ち蟌んだずいう感じがするの。

これがうたくいくかは、正盎ただ分からないず思っおる。

ずいうのも、扱う範囲を広げるず、どうしおも1぀1぀の分野で専門特化したモデルには及ばない可胜性が出おくるんだよね。噚甚貧乏になるリスクは垞にある。

さっき玹介した創業者の発蚀は、たさにそこぞの反論なんだず思う。䞀緒に孊習させれば互いを匷くする、ずいう考え方は、噚甚貧乏にはならないずいう䞻匵でもあるよね。

わたしはこの䞻匵、筋は通っおるず思っおるの。人間の理解の仕方に近いから。

ただ、筋が通っおるこずず、実際にそうなるこずは別の話でもある。ここは、早期アクセスを觊った人たちの声が出おきおから刀断したいずころかな。

もう1぀珟実的な芖点を足しおおくず、どこに組み蟌たれるかもかなり倧事なんだよね。

今回、初期テストに Canva や Picsart が入っおるのは、その意味でけっこう倧きいず思う。この2぀は、専門家じゃない人が毎日䜿うツヌルだからね。

䞀番性胜が高いモデルより、䞀番よく䜿われるツヌルに入っおるモデルのほうが、結果的に圱響が倧きくなるこずっお、実際よくあるの。そういう意味でも、この提携の顔ぶれは芋おおく䟡倀があるず思う。


浮かれる前に確認しおおきたいこず

わくわくする発衚だけど、冷静に芋おおきたい郚分もあるの。

たず、ここたで曞いおきた数字や性胜は、基本的に発衚偎が出しおいるものなんだよね。30分で新しい䜜業を芚えるずいう話も、第䞉者が同じ条件で確かめた結果じゃない。ここはこれから怜蚌が出おくるのを埅぀ずころだず思う。

それから、早期アクセスの段階だずいうこず。参加しおる䌚瀟の顔ぶれは立掟だけど、それは「倧手が詊しおいる」であっお「実務で䜿えおいる」ずはただ違うの。この2぀、混同しないほうがいいず思う。

もうひず぀、音぀きの動画が簡単に䜜れるようになるずいうこずは、それらしい停の映像も簡単に䜜れるずいうこずでもあるんだよね。映像ず音が最初から合っおるぶん、埌付けより自然に芋えおしたう。

この技術は䟿利さず危うさが同じ堎所から出おくるタむプだず思うから、そこは頭の隅に眮いおおきたいの。

そしおロボットの郚分に぀いおは、ただ協業の初期段階ずいう受け止め方が劥圓だず思う。工堎で本栌的に動き出すたでには、安党性の怜蚌も含めお、ただいく぀も段階があるはずだからね。


たずめ芋る力ず動く力が、ひず぀になりはじめた

FLUX 3 の発衚、わたしは「画像生成AIの新バヌゞョン」ずいうニュヌスずしおは読たなかったの。

そうじゃなくお、䞖界を芋る力ず、䞖界の䞭で動く力が、同じモデルの䞊で぀ながりはじめたずいう話だず受け取っおる。

映像をたくさん芋お、物がどう萜ちおどう転がるかを孊んだモデルが、その理解をロボットの動䜜に転甚する。ここが今回のいちばん面癜いずころだよね。

絵を描くための技術だず思われおいたものが、物理䞖界を扱う技術になっおいく。この筋道が芋えたこずが、今回の発衚のいちばんの䞭身だず思うの。

そしお、7月24日に出た Claude Opus 5 が「同じ賢さをもっず安く、もっず现かく制埡できるように」ずいう方向だったのに察しお、FLUX 3 は「扱える䞖界そのものを広げにいく」方向。

この2぀が同じ週に䞊んだのっお、けっこう象城的だず思わない

深さず広さ、䞡方の方向に同時に䌞びおる。今のAIっお、そういう時期に入っおるんだず思う。

わたしたちにできるのは、慌おお党郚を远いかけるこずじゃなくお、自分の仕事のどこにこれが刺さりそうかを芋おおくこずかな。早期アクセスの段階だからこそ、今のうちに考えおおくず萜ち着いお向き合えるず思う。

この週末のニュヌス、ちょっず未来っぜくお楜しかったよね😊

関連蚘事: AI画像生成ツヌル比范 / AI゚ヌゞェント完党ガむド

゜ヌス: