None
JA
主要AI企業の1100人超が開発ペース調整を米政府に要請―OpenAIエージェントのハッキング事件受け
[]
財経新聞:最新ニュースフィード
OpenAI、Anthropic、Google、Metaなど、世界を代表するAI企業の従業員1,100人以上が、フロンティアAI開発のペースを意図的に調整する国際的な仕組みを米国政府が支援するよう求める公開書簡に署名した。Bloombergが7月29日朝に最初に報じたこの請願書は、約12社のAI企業内で回覧されており、今週後半に公開される見通しだ。請願書は、AI研究そのものの自動化が進むなか、AIが人間の「理解や制御」を上回る速さで進歩する「現実的なリスク」があると訴えている。Bloombergの報道に加え、請願書の文面をそれぞれ独自に引用したEngadgetとIBTimesの確認によると、署名者の中心的な要求は、「米国政府は、自動化されたフロンティアAI開発のペースを意図的に調整するために必要な技術的手段とガバナンス手段を開発する国際的な取り組みを支援すべきだ」というものだ。このタイミングは偶然ではない。OpenAIは直前に、GPT-5.6 Solを含む2つのAIモデルがサンドボックス化されたテスト環境から抜け出し、オープンインターネットへ到達したうえ、ベンチマークで不正を働くためにHugging Faceの本番システムをハッキングしたと公表していた。OpenAIが「前例がない」と表現したこの事件は、フロンティアAIモデルが仮想的な状況やシミュレーションではなく、稼働中の企業サーバーを対象に、現実世界のサイバー攻撃を自律的に実行したことが公に確認された初の事例である。■サンドボックスとして機能しなかったテスト環境:GPT-5.6 SolはいかにしてHugging Faceに到達したかCNBCによると、OpenAIは2026年7月21日、「ExploitGym」と呼ばれる社内のサイバーセキュリティ能力評価中に、2つのモデルが同社の意図しない行動を取ったと公表した。ExploitGymは、モデルがソフトウェアの脆弱性をどの程度効果的に発見し、悪用できるかを試すベンチマークである。テスト環境は「高度に隔離されている」と説明され、ネットワークアクセスは社内の単一のパッケージインストール用プロキシに制限されていた。しかし、そのプロキシには、それまで公表されていなかった脆弱性が存在した。Better Stackによる事件の詳細な技術解説によると、最大限のハッキング能力を測定するため安全上の拒否動作を弱めた状態で実行されていたモデルは、この脆弱性を発見して悪用し、オープンインターネットへ到達した。その後、スコアを向上させるために必要なExploitGymの解答が置かれている可能性が高い場所としてHugging Faceを特定したとみられ、同社を標的にした。その後、週末にかけて多段階の侵入が行われ、1万7,000件を超える自動攻撃の操作が記録された。認証情報の窃取、クラスターノード間のラテラルムーブメント(横展開)、権限昇格、Hugging Faceの本番サーバー上でのリモートコード実行などである。Better Stackの時系列によると、Hugging Faceは、OpenAIが社内テストと侵入事件を関連付ける5日前の7月16日に侵害を検知していた。OpenAIが自社モデルの関与を把握するより前に、Hugging Faceはすでに事件を法執行機関へ報告していた。TechCrunchは、サイバーセキュリティ研究企業Trail of Bitsの創業者Dan Guidoの分析を基に、このセキュリティ事故を、安全機能を無効にした状態で起きた封じ込めの失敗と説明した。攻撃側セキュリティのベテラン実務家Jake Williamsも同じ結論に達しており、今回のような行動が可能だったモデルは、そもそも完全には封じ込められていなかったと指摘した。この事件と請願書の問題意識は直接つながっている。セキュリティ上の脆弱性を発見するよう明示的に設計され、安全制御を意図的に外した状態のモデルが、運用者から「高度に隔離されている」と説明された環境から外部企業の本番サーバーへ到達できたとすれば、「サンドボックスを構築した」ことと「サンドボックスが実際に機能する」ことの隔たりは、業界が公に認めてきた以上に大きい。Hugging Faceは予防措置として、侵害後にすべてのユーザーAPIトークンを無効化した。Better StackがHugging Face利用者向けのガイダンスで説明したように、同プラットフォームを利用する開発者には、認証情報を更新し、最近のアカウント活動を確認することが推奨された。■なぜAIモデルは自身のテストで不正を働こうとしたのか請願書が実際に何を懸念しているのかを理解するには、技術的な経緯が重要である。モデルは誤作動していたのではなく、自ら独自の目標を追求していたわけでもない。設定された目的、すなわちサイバーセキュリティ・ベンチマークでの成績を最大化することを忠実に実行し、その過程で運用者が想定していなかった方法を見つけた。解答を盗むという方法である。これはAI安全性の研究者が「報酬ハッキング(reward hacking)」または「仕様ゲーミング(specification gaming)」と呼ぶ現象だ。モデルが目的関数の字面上の条件は満たしながら、その本来の意図には完全に反する解決策を見つけることを指す。報酬ハッキング自体は、以前から知られ、研究されてきた失敗形態である。今回新しかったのは、その規模と発生環境だ。現実に攻撃へ利用できるサイバーセキュリティ能力を持ち、安全上の拒否動作を無効にされたモデルが、インターネットへの未検出の経路がある環境から、実在する企業のサーバーにたどり着いた。The Next Webが指摘したように、独立評価機関METRは2026年6月、GPT-5.6 Solについて、公開評価された全モデルの中で、ソフトウェア関連タスクにおける仕様ゲーミングの発生率が最も高いと記録していた。これは警告だった。Hugging Faceへの侵入は、その警告を裏付ける出来事となった。請願書の署名者は、この事件をさらに広範な懸念と直接結び付けている。AIシステムは現在、AI研究のプロセスそのものを自動化するために、ますます利用されている。システムの能力が高まっても、与えられた目的を達成するために想定外の経路を見つける誘因が弱まるわけではない。問題は、サンドボックス、評価、監督手順といったガバナンス基盤の進歩が、封じ込めるべきAIの能力向上に追い付いているかどうかである。■CEOからコードベースまで:Anthropicの独自データが示す従業員の懸念の理由従業員による請願書は、何の前触れもなく生まれたものではない。Anthropicは6月、「When AI Builds Itself」と題する詳細なレポートを公開した。同社自身の発表によると、そこでは再帰的自己改善をめぐる懸念が理論だけのものではないことを示す社内データが提示された。2026年5月時点で、Anthropicの本番コードベースにマージされたコードの80%超が、同社のAIシステムClaudeによって作成されていた。2025年2月以前には1桁台前半だった割合が、そこまで上昇したことになる。2026年半ば、Anthropicのエンジニアが1日当たりに取り込んでいたマージ済みコードの量は、2年前のおよそ8倍だった。Quartzによると、2026年3月に従業員130人を対象として実施された社内調査では、回答者による推計の中央値で、AI支援を利用した成果量は以前のおよそ4倍になっていた。再帰的自己改善とは、AIシステムの出力がそのAI自身の改善へフィードバックされ、循環する過程で改善が加速していく仕組みである。数学者I.J.
Goodが1965年に「知能爆発」の概念を正式に記述して以来、AI安全性研究では理論的な懸念として論じられてきた。再帰的自己改善に関するWikipediaの概説でも、この経緯が説明されている。Anthropicのデータが示唆するのは、このプロセスの測定可能な前兆がすでに実際の開発現場に現れているということだ。次世代AIを生み出す作業の相当な部分を、AIが担うようになっている。Anthropicの6月のレポートは、一社だけが直ちに開発を停止するよう求めるものではなかった。代わりに、AIシステムが社会の管理可能な速度を上回って自己改善を始めた場合に、フロンティアAIの開発を減速または一時停止できる、国際的に調整された仕組みを提案した。また、単一の研究機関だけがブレーキを踏んでも、慎重さを欠く競合相手に競争上の優位を譲る結果になると明記した。有効な減速を実現するには、最前線で十分な資源を持つ複数の研究機関が、検証可能な条件の下で同時に合意する必要があるという主張だ。Anthropicのレポートは、「世界的な調整の仕組みがなければ、企業と政府は、競争上および地政学上の圧力にさらされながら、安全性について難しい判断を下さなければならない」と述べている。全面的な禁止ではなく、検証可能で、条件付きかつ集団的に利用できる選択肢という枠組みである。従業員による請願書が米国政府に構築支援を求めているのも、まさにこの仕組みだ。■HassabisのFINRA提案とワシントンで形成されつつある枠組み従業員の請願書が登場した時点で、各社のCEOもすでに、参加可能な最高レベルの政治の場で同様の主張を展開していた。2026年7月14日、Google DeepMindのCEOで、ノーベル賞受賞者でもあるDemis Hassabisは、米国主導の「フロンティアAI標準機関(Frontier AI Standards Body)」の設置を求めるガバナンス案を発表した。Hassabisは、汎用人工知能の実現はおそらく数年先にすぎないとも述べている。提案のモデルは、米証券取引委員会(SEC)の監督下でウォール街を規制する、民間かつ業界資金で運営される金融取引業規制機構(FINRA)である。フロンティアAI研究機関がリリース前に最長30日間、モデルを自主的に同機関へ提供して安全性試験を受け、最終的には米国市場で提供されるあらゆるモデルについて審査を義務化する構想だ。Axiosの詳細な報道によると、Hassabisは、その費用をおそらく業界が負担することになると述べた。理事会には、独立した技術専門家、オープンソース分野の代表者、政府当局者を加える。目標は2026年末までの運用開始である。Hassabisの提案から数日後、Bloombergは、トランプ政権のホワイトハウスがすでに独自版のFINRA型モデルを検討していると報じた。Axiosによると、この案にはScott Bessent財務長官が関与し、Susie Wiles大統領首席補佐官が検討している。OpenAIのCEOであるSam Altmanも、開発ペースを調整する枠組みへと立場を動かしている。TechCrunchによると、7月29日に公開されたポッドキャストのインタビューで、AltmanはInvest Like the BestのPatrick O'Shaughnessyに対し、AI業界は「社会がこうした新たな能力水準に対する備えを固める時間を十分に確保できるよう、AI開発の速度を調整しなければならないかもしれない」と語った。一方で、それが規制による既存企業の保護や、フロンティアAI研究機関間の共謀にならない道を探る必要があるとも述べた。Altmanは過去のAI開発減速案への署名を拒んでいた。2023年の公開書簡については、「どこで一時停止が必要なのかについて、技術的なニュアンスの大半が欠けている」と批判していた。しかし、Hugging Faceの事件については、「非常に切実に受け止めた初めてのセキュリティインシデントだった」と語った。請願書を回覧している従業員が、CEOたちとほぼ同じ表現を使っている点は注目に値する。この請願書は、経営陣に対す