2026年9月号
世界のVCが狙うフィジカルAI:勝敗を分ける「学習速度」

Anthropic, OpenAIなど生成AIへの巨大な投資が続くなか、米国を中心とするベンチャー投資家の関心は、次なるフロンティア「Physical AI(フィジカルAI)」へ急速にシフトしている。2026年を「Physical AIにおけるChatGPTモーメント(決定的な転換点)」と位置付けるシリコンバレーのベンチャーキャピタルも現れている。
Physical AIとは、AIが文章や画像を生成するのと違い、現実世界を認識し、判断し、行動する技術である。例えば、倉庫で初めて見る商品をつかむロボット、状況に応じて作業方法を変更する工場ロボット、農地を自律走行する農業機械などである。
メディアでは走ったり、洗濯物を畳んだりといった人型ロボットの映像に注目が集まるが、Physical AIの競争は「より高性能なロボット(ハードウェア)をつくる競争」だけではなくなりつつある。また、単なる「現場データの保有」でもない。
現在の競争の中核は、現実世界と仮想空間を架橋する継続的な学習サイクルの構築にある。モデル強化(現場データを取り込み、AIモデルおよびワールドモデルを高度化)、シミュレーション(仮想空間での動作パターンを検証・学習)、実機展開とフィードバック(実際のロボットに実装し、新たな現場データを再収集)というサイクルをどれだけ速く、低コストで、そして安全に回し続けられるか。
それが、Physical AI時代における企業の真の競争力を決定づける。
急増する資金調達とメガディール
「データの好循環」が鍵
これまで、AIの大きな進歩は主にデジタル空間で起きてきたが、現在、そのAIが現実世界へ拡張している。ソフトウェアが情報を処理していた世界から、AIがリアルの物理的な世界を理解し、動かす世界(ロボットが工場で部品を組み立てる、ドローンがインフラを点検する、など)への移行が始まりつつある。そして、これは生成AIの次の巨大市場になる可能性があるようだ。
ロボット、ドローン、その構成要素のモーターやアクチュエーターなどのハードウェアも投資を集めているが、特に投資業界で注目されているのがデータである。生成AIが急速に進歩できた大きな理由の一つは、インターネットという巨大なデータ資源が存在したためである。
文章、Webページ、画像、動画、プログラムコードなど、人類が何十年もかけて蓄積してきた膨大なデジタル情報を生成AIの学習に利用できた。一方、ロボットには同じようなデータ資源が存在しない。
ロボットが必要とするデータは、単なる映像だけではなく、「何を見たのか」、「どのような状態だったのか」、「どの行動を取ったのか」、「その結果、何が起きたのか」、「成功したのか、失敗したのか」といった、行動と結果が結びついたデータである。
Bessemer Venture Partnersが2026年4月に発表したPhysical AIに関するレポート[iii]では、世界のrobot manipulation data(ロボットによる物体操作データ)は約30万時間にとどまり、インターネット上の動画(約10億時間)やテキスト(約300兆トークン)と比べ、桁違いに少ない。業界全体がデータ生成に今後2年間で負担するコストは30億ドルを超えると試算され、Physical AIにおいてデータは最大のボトルネックとなっている。
では、データを持つ会社/国が勝つのか?そう考えるのは単純すぎるようで、重要なのはデータの保有量でない。
真の優位性は、データを継続的に生み出し学習へ還元する仕組みにある。例えば、ある倉庫ロボット企業が数百台のロボットを顧客の現場に導入したとする。
すると毎日実運用し、成功・失敗データを収集、データに使ってモデル改善、性能が向上、さらに多くの顧客へ導入、さらに多くのデータ収集、という循環が生まれる。Bessemerも、現在のPhysical AI企業の競争優位は、独自データのパイプライン、ドメインの専門知識、導入・運用インフラ、そして顧客との信頼関係といった要素によって形成されていると指摘している。
つまり、本当の競争力は「データベース」ではなく、データの好循環にある。
[iii] https://www.bvp.com/atlas/bessemer-predicts-robotics-and-physical-ai
「ワールドモデル」の台頭と「Sim-to-Real」の課題
Physical AIのデータ不足を補う技術として、大きな注目を集めているのが「World Model(ワールドモデル)」である。World Modelについてはまだ完全に統一された定義はないが、簡単に言えば、「ある行動を取ったら、世界が次にどう変化するか」を予測するAIである。
2026年8月のWorld Economic Forum(WEF)の解説[iv]では、World Modelは、画像、動画、センサーデータ、行動と結果のデータなどから環境の変化を学び、「ある行動を取った場合に環境がどのように変化するか」を予測するモデルとして説明されている。例えば倉庫ロボットが商品をつかもうとしているとする。
ロボットには、左側からつかむ、右側からつかむ、上からつかむ、商品を少し動かしてからつかむ、といった複数の選択肢がある。World Modelは、それぞれの行動を実際に行う前に、「左から行くと隣の商品に当たりそうだ」、「上からなら成功しそうだ」、「強くつかむと商品が変形するかもしれない」といった未来の状態を予測する。
そして、それらの予測結果を比較して行動を決定する。つまり、World Modelはロボットにとっての「頭の中のシミュレーター」に近い存在である。
World Modelはまだ発展途上だが、進歩は加速している。その代表例が、Metaが2025年に発表した「V-JEPA 2」である[v]。
大量の動画から物理世界の構造を事前に学習したのち、わずか62時間のロボットデータで、新しい物体、新しい環境におけるピック・アンド・プレース(把持・配置)で65〜80%の成功率を達成した。大量の実機データを最初から集めなくても、動画から得た世界理解をロボット制御へ転用できる可能性を示した。
Google DeepMindは「Genie 3/Gemini Robotics 1.5」を発表した。Genie 3はテキストからインタラクティブな仮想世界を即座に生成し、Vision-Language-Action(VLA)モデルによって行動命令まで統合した。
NVIDIAも2026年に「Cosmos 3」を発表し、視覚的推論、マルチモーダル生成、行動予測を統合する世界基盤モデル(World Foundation Model)をフィジカルAIの中核と位置づけている。
ワールドモデルはシミュレーション上での膨大な試行錯誤を可能にし、実機データの必要量を激減させる。しかし、現状では実機データを完全に不要にはできない。
World Modelが進化すれば、AIは「この動作をすると、次に何が起きるか」を仮想空間の中で予測できるようになる。そのため、ロボットを実際に何度も動かしてデータを集めなくても、シミュレーション上で大量の経験を積ませることが可能になる。
ロボットの歩行や走行などのlocomotion(移動)では、シミュレーションで学習した動きを実機に移す「sim-to-real」の技術がかなり進歩している。しかし、ロボットが物をつかんだり、動かしたりするmanipulation(物体操作)では「sim-to-real」が難しい。
たとえば、柔らかい物体や布、液体、ケーブル、不定形な物体を扱う場合、物体がどのように変形するか、どこで滑るか、指先がどの程度接触しているかといった細かな物理現象が結果を大きく左右する。こうした摩擦、接触、変形といった現実世界の細かな物理現象を、シミュレーション上で正確に再現することは依然として難しい。
[iv] https://www.weforum.org/publications/top-10-emerging-technologies-of-2026/
[v] https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
Physical AI時代の真の競争軸と日本の立ち位置
Waymoが2026年2月に発表した「Waymo World Model」によると、Waymo Driverは現実世界ですでに約2億マイルを完全自動運転で走行しているが、その裏では仮想世界で数十億マイル規模の走行を行っている。World Modelを使えば、逆走車、特殊な道路状況、珍しい事故につながる状況など、現実では何度も再現することが難しいケースを大量に生成できる。
これはPhysical AI全体が向かう方向を示している。仮想シミュレーションと現実世界を相互に行き来させる「クローズド・ループ(閉環構造)」の構築がPhysical AIの核心である。
この潮流を踏まえると、企業の競争軸は「どのハードウェアを買うか」という議論から、「自社の現場からいかに学習サイクルを高速で回すか」へと移行する。Bessemerが2026年をロボティクスの「GPT-2.5モーメント」と形容するように、価値の源泉はロボット本体から、データパイプライン、シミュレーション基盤、評価系といった「Physical AI インフラストラクチャ」へも広がっている。
日本にはPhysical AIで大きな資産がある。IFR(国際ロボット連盟)の2026年4月の報告によると[vi]、日本では2024年に約4万4,500台の産業用ロボットが新たに導入され、稼働中の産業用ロボットは約45万500台に達している。
製造業従事者1万人当たりのロボット密度は446台で、世界でもトップクラスである。工場、倉庫、建設現場、農地、医療・介護施設といった豊富な「現実世界の現場」は、単なるAI導入の場ではなく、「リアルタイムでデータを生み出す高価値な学習装置」へと変貌しうる。
Physical AIへの対応は「ヒューマノイドを導入すべきか」という話だけではない。Physical AIにおける真の競争とは「学習速度の競争」に他ならない。
現実世界からデータを抽出し、ワールドモデルとシミュレーションで未来を予測・学習し、実機で検証して再び現場へ還元する。この一連のループを誰よりも速く、低コストで、かつ安全に回し続けられる仕組みを構築した企業および国こそが、Physical AI時代の持続的な覇権を握ることになるだろう。
[vi] https://www.businesswire.com/news/home/20260408531951/en/Robot-Density-Surges-in-Europe-Asia-and-Americas-IFR-reports
(以上)
著者
川口 洋二氏
Delta Pacific Partners CEO。米国ベンチャーキャピタルの共同創業者兼ジェネラル・パートナー、日本と米国のクロスボーダーの事業開発を支援する会社の共同創業兼CEOなど、24年に渡るシリコンバレーでの経歴。NTT入社。スタンフォード大学ビジネススクールMBA。





Crunchbaseの2026年8月のレポートによると[i]、Physical AI関連企業への世界のベンチャー投資額は、2026年上期だけで474億ドル(521件)に達した。これは2025年上期の264億ドルから約80%増、2025年下期の120億ドルと比べると約4倍にのぼる。
2022年から2024年までの3年間にPhysical AI企業へ投じられたベンチャー資金の合計が419億ドルだったのに対し、2026年はわずか半年でそれを上回った。この数字にはロボティクスだけでなく、自動運転、航空宇宙、ドローン、産業オートメーション、センサーなども含まれており、Waymoの160億ドル、Andurilの50億ドルといった巨大ラウンドが押し上げた側面もあるが、ロボティクスだけを見ても2026年6月時点で188億ドルに達し、過去最高だった2021年通年(141億ドル)を突破している。
Pitchbookの今月(2026年9月)のレポート「Robotics & Physical AI Report: The Money Is in the Motion」でも[ii]、2026年第2四半期のロボティクスおよびフィジカルAI関連のスタートアップの調達額が過去最高の186億ドル(約2兆8千億円)を記録した。投資件数が前四半期比14.1%減となった一方で、調達総額は同25.3%増となった。
上位の大型案件を除外しても前四半期の水準を上回っており、資金供給はメガディールにとどまらず広範に拡大している。AIがリアルの物理世界を直接動かす時代へのシフトが加速している。
[i] https://news.crunchbase.com/venture/physical-ai-funding-startups-robotics-aerospace-h1-2026/
[ii] https://pitchbook.com/news/reports/q2-2026-robotics-physical-ai-report-the-money-is-in-the-motion