AI Library
自律的科学発見の時代
キム・ギョンジン, 弁護士
AI科学者とセルフドライビング・ラボ
AI科学者とセルフドライビング・ラボが、科学研究における主張の生成と検証をどのように変えつつあるのかを追います。文献に基づく発見、自然言語プロトコルからロボット命令への変換、マルチエージェント研究システム、閉ループ実験室、材料探索、検証ギャップ、証拠の連鎖、研究ハーネス、学術誌倫理、法的責任までを扱います。
AIライブラリ
デジタル主権の二重構造
欧州の脱パランティアとアメリカン・ビッグテックの鎖
金景珍(キム・ギョンジン), 弁護士
欧州の情報機関と国防省が米パランティアの分析ツールを排除し始めた2026年の記録です。フランス国内治安総局とドイツ連邦憲法擁護庁、オランダ国防省の置き換え決定、米国の輸出規制が同盟国の人工知能アクセスをわずか3日で遮断した事件、CLOUD ActとFISA 702条がもたらした域外管轄の実態を扱っています。欧州連合のクラウド・AI開発法(CADA)が定めた4段階の主権保証レベルと主権理由による契約解除権、ユーロスタック構想と3,000億ユーロの投資障壁に至るまで、全5章15節と結論2節で整理しました。
[AI書房] 第23章 Geminiと次世代モデル
デミス・ハサビス、Google人工知能の父
第8部 Google DeepMindのCEO
第23章 Geminiと次世代モデル
金京鎮
ロンドンに位置するGoogle DeepMindの本社は、消えることのない明かりで満たされていました。普段は囲碁の盤面やタンパク質の構造が映し出されていたモニターは、今や巨大な言語モデルのパラメータで埋め尽くされていました。デミス・ハサビスは、窓の外に広がるロンドンの夜景を見下ろしながら、深い思索にふけっていました。
彼は生涯を科学的な難問の解決に捧げてきましたが、今彼が直面していたのは科学の問題ではなく、生存の問題でした。ChatGPTの登場が告げた「コード・レッド(Code Red)」は、Googleという巨大な巨船全体を揺るがし、純粋な研究を志向していたDeepMindでさえも、製品開発という最前線へと押し出される状況にありました。ハサビスはこの危機をチャンスに変えなければなりませんでした。
単にチャットボットを作るのではなく、彼が夢見ていた汎用人工知能(AGI)へと続く踏み石を築かなければなりませんでした。その成果こそが、まさに「Gemini(ジェミニ)」でした。Geminiの誕生は、Google内部の政治的、技術的な障壁を打ち破ることから始まりました。
長きにわたりライバル関係にあったGoogle BrainチームとDeepMindチームが一つになったことは、類を見ない出来事でした。ジェフ・ディーンとデミス・ハサビス、この二人の巨人が手を組んだことは、単に人員を統合することを超え、異なる研究文化を融合させる実験でもありました。ハサビスはこれを振り返り、「私たちはそれぞれの強みを結集させ、かつて存在しなかった新しい種(species)を誕生させたのです」と語っています。
プロジェクト名である「Gemini」は、ふたご座という意味の通り、二つの組織の結合を象徴すると同時に、NASAが月を目指すために遂行したジェミニ計画の大胆な挑戦精神を継承するという意味が込められていました。Gemini 1.0のリリースは、GoogleがAI競争のリングに上がったことを告げる号砲でした。しかし、ハサビスが真に示そうとしていたのは、単なるテキスト生成能力ではありませんでした。それは、人間が世界を認識する方法、すなわちテキストだけでなく、画像、オーディ
ビデオを同時に理解し処理する「ネイティブ・マルチモーダル(Native Multimodal)」能力が強調されました。従来のモデルが、テキストのみを学んだ生徒に無理やり絵を教え込むような方式だったのに対し、Geminiは生まれながらにして目と耳と口をすべて備えた子供のように学習されました。この違いは決定的なものでした。
Geminiは、微妙なニュアンスが含まれるビデオを見てその中の感情を読み取ったり、複雑な物理学論文のグラフを解釈して新しい数式を導き出したりすることにおいて、卓越した能力を示しました。技術的な進化は目まぐるしく続きました。Gemini 1.5 Proの登場は、「ロングコンテキスト(Long Context)」の革命をもたらしました。
100万トークン、さらには200万トークンを一度に処理できるということは、AIに象のような記憶力を与えたことと同義でした。これは、分厚い専門書を数百冊一瞬で読み解き、その中から特定の情報を探し出したり、1時間の映画を見てその内容を完璧に要約したりできることを意味していました。ハサビスはこの技術について、「今やAIは情報の断片を見るのではなく、巨大な情報の文脈全体を俯瞰できるようになりました」と語りました。
これは、弁護士が数万ページに及ぶ訴訟記録を検討したり、科学者が数十年分の研究データを分析したりする方法を根本的に変えました。Gemini 3.0は、ハサビスが切望していた「推論(Reasoning)」と「計画(Planning)」の能力において、飛躍的な飛躍を遂げました。単に次に続く単語を確率的に予測する「確率的なオウム」を超え、自ら考え、論理的なステップを経て答えを見つけ出すシステムへと進化したのです。Gemini 3は、数学的な難問を解くために自ら検証プロセスを経て、コードを記述中にエラーが発生すれば自らデバッグして修正する姿を見せました。
これは、DeepMindがAlphaGoを開発した際に用いた強化学習技術と、大規模言語モデルが組み合わさることで生み出されたシナジーでした。ハサビスはこれを見て、「私たちはようやく、考える機械の入り口に立ったのだ」と静かに自評しました。こうした技術的成果は、市場の反応へとつながっていきました。
Geminiアプリとウェブサイトの月間アクティブユーザー数(MAU)が6億5千万人を突破したという数値は、単なる統計以上の意味を持っています。これは、世界中の多くの人々が、Googleの検索窓の代わりにGeminiに問いを投げかけていることを示す指標です。学生は課題のために、プログラマーはコーディングのために、そして作家はインスピレーションを得るために、Geminiを起動しています。
Googleのエコシステムにおいて、GeminiはGmail、Googleドキュメント、Driveと有機的に連携し、ユーザーのデータを分析して業務を自動化するパーソナルアシスタントとしての地位を確立しました。これは、OpenAIのChatGPTが先占していた市場に対し、Googleが強力なインフラとエコシステムを武器に、見事に反撃に成功したことを示唆しています。しかし、このプロセスがすべて順調だったわけではありません。OpenAIとの競争は、ハサビスに絶え間ない緊張を強いることとなりました。
サム・アルトマンがGPT-4oを発表し、音声アシスタント市場を攻略しようとした際、Google DeepMindは、それよりも自然で遅延のないリアルタイム対話モデルを提示しなければならないという圧力にさらされました。時には「Googleは動きが遅すぎる」あるいは「過去の栄光に浸っている」といった批判も浴びせられました。また、画像生成機能で発生した歴史的な誤謬をめぐる論争は、ハサビスとGoogleにとって痛恨の教訓となりました。
これは技術的な完璧さだけでなく、AIがいかにして社会的文脈や倫理を理解すべきかという、深い哲学的な問いを突きつける出来事でもありました。ハサビスはこれについて弁明するのではなく、「私たちは学んでいる最中であり、より責任あるAIを構築するために、絶えず修正を続けていく」と謙虚に認めました。Geminiシリーズは、「知能を理解する」というミッションが、抽象的な研究室の枠を超え、世界80億人の手のひらの上で展開される現実へと変わっていく過程そのものでした。
彼は夜明けに起き、世界中から送られてくるGeminiの使用ログを確認します。そこには、自らが作り上げた知能が誰かのコーディングを助け、誰かの詩作に寄り添い、誰かの孤独を癒やしている姿があります。それは、彼が幼い頃にチェス盤の上で夢見た、人間の知性を拡張する道具としてのAIが実現された瞬間でもありました。Geminiは、人類がより賢くなるために作られた、そしてハサビスが40年をかけて準備してきた、最も巨大で複雑な道具なのです。
Gemma(ジェマ):オープンソースの軽量モデル。デミス・ハサビスのオフィスの片隅には、古いApple IIのコンピュータの写真が置かれています。彼が初めてプログラミングを独学し、デジタル世界の創造主へと歩み始めた時代のマシンです。ハサビスはしばしば当時を回想し、もしあの頃の技術が一部の企業や研究所だけに独占されていたとしたら、自分のような少年は決してDeepMindを作ることはできなかっただろうと考えています。
こうした経験は、Google内部で激しく繰り広げられた「オープンソース論争」において、彼が重要な決断を下す際の決定的な影響を与えました。「私たちの最先端技術を世界と共有しなければなりません。
そうすることで、第2、第3のデミス・ハサビスが、ガレージや寮の自室から現れることができるのです」。そうして誕生したのが、オープンソースモデルである「Gemma」でした。
「Gemma」という名前は、宝石を意味するラテン語の「Gemma」に由来しています。そこには、価値あるものを世界に送り出すという意味が込められています。しかし、Google内部では懸念の声も上がっていました。
「数十億ドルを投じて開発した核心技術を、なぜ無料で公開しなければならないのか。競合他社を利するだけではないか」という反論がありました。しかし、ハサビスはより大きな未来を見据えていました。MetaがLlamaシリーズを通じてオープンソースのエコシステムを掌握していく中で、Googleが閉鎖的な戦略に固執し続ければ、最終的には開発者たちの支持を失うことになるという戦略的な判断があったのです。また、彼は「科学的な発見は共有されることで、その価値が指数関数的に増大する」という、学者としての信念を曲げませんでした。
Gemma 3のリリースは、こうしたハサエビスのビジョンが技術的に結実した瞬間でした。Gemma 3は、単にGeminiの性能を縮小したモデルではありません。DeepMindのエンジニアたちは、巨大なモデルが持つ知能の精髄を「蒸留(distillation)」し、小さな器に詰め込むという魔法を成し遂げたのです。
Gemma 3は、高価なサーバー用GPUではなく、一般的なノートPCや、さらにはモバイルデバイスのシングルGPU上でも動作するという事実がありました。これにより、AIの研究と活用のハードルは劇的に低下しました。アフリカのスタートアップ開発者、インドの大学生、韓国の中小企業の研究所員が、インターネット接続がない環境でも、自身のローカルデバイスでAIを動かせるようになったのです。さらに、Gemma 3はマルチモーダルな能力までも備えていました。
テキストだけでなく、画像を認識・分析し、簡単な音声コマンドを処理できる能力は、エッジデバイス(Edge Device)におけるAI革命を予感させました。インターネットが繋がらない僻地で医療ボランティアを行う医師が、Gemmaを搭載したタブレットで患部の写真を撮影し、その場で診断の補助を受けるといったシナリオが現実のものとなったのです。ハサビスはGemmaのリリースイベントにおいて、「真の技術の民主化とは、誰もが、いつでも、どこでも、制約なく最高のツールを使用できる状態において実現されるのです」と力説しました。
これは、彼がDeepMindを設立した際に掲げた「AI for Science, AI for Everyone」というモットーと、まさに一致するものでした。エコシステムの反応は爆発的なものでした。世界中の1,300万人を超える開発者がGemmaをダウンロードし、独自のアプリケーションの開発を開始したのです。
GitHubやHugging Faceには、Gemmaをチューニングして特定の言語に特化させたり、法律、
医学、コーディングなどの専門分野に合わせて改良した派生モデルが、次々と登場しました。Google DeepMindの研究者たちは、自分たちが想像もしなかったような創造的な方法でGemmaが活用されているのを目の当たりにし、驚嘆の念を抱きました。ある人は視覚障害者のための画面解説ツールを作り、ある人は絶滅の危機に瀕した言語を保存するための翻訳機を作りました。
ハサビス氏は、この現象を見て「私たちが火種を投げ入れたところ、世界中で巨大な花火が始まった」と表現しました。注目すべきは、「Search AI Overviews」技術の普及でした。Googleの検索エンジンに適用されたこの技術は、Gemmaの軽量化技術を基盤として、検索結果を迅速に要約・整理する機能です。
この技術がオープンソースとして公開されたことで、数多くの企業やウェブサイトが、自社のサービス内にインテリジェントな検索機能を容易に実装できるようになりました。その結果、ウェブエコシステム全体のユーザーエクスペリエンスが一段上のレベルへと引き上げられました。ユーザーはもはや、膨大なリンクをクリックして情報を探し回る必要はなく、AIが整理した核心的な情報を即座に得ることができるようになったのです。
Gemmaは、巨大プラットフォーム企業による独占物となり得たAI検索技術を、普遍的なウェブ標準のようなものへと変貌させました。しかし、オープンソース戦略にはリスクも伴いました。悪意のあるユーザーがモデルを改変し、ハッキングツールを作成したり、偽ニュースを生成したりするのではないかという懸念です。
これに対し、ハサビス氏とDeepMindのチームは、Gemmaとともに「責任あるAI(Responsible AI)」ツールキットを配布しました。これらは、モデルが有害なコンテンツを生成しないよう安全装置を設け、開発者が倫理的なガイドラインの範囲内でモデルを活用できるよう支援するためのツールでした。ハサエビス氏は、技術的な統制よりも、コミュニティの自浄能力と集団知性を信じる道を選んだのです。
彼は、「閉ざしておく方が安全に見えるかもしれないが、透明性を持って公開し、共に監視することこそが、長期的にはより安全で強力なシステムを構築する」というリーナス・トーバルズ(Linus Torvalds)の哲学を、AI時代に合わせて再解釈しました。Gemmaプロジェクトを通じて、ハサビス氏は単なる研究者や起業家を超え、技術エコシステムの設計者としての側面を見せました。AIが少数の独占物となり権力が集中するディストピア的な未来ではなく、誰もが自分なりのGemmaをポケットに入れて持ち歩き、自らの知的能力を拡張させる「根本的な豊かさ」の未来を選択したのです。
1,300万人の開発者が生み出す1,300万通りの可能性、それこそがハサビス氏が「知能を解き放つ」ことで作りたかった世界の景色でした。Gemmaは、小さくとも堅牢な宝石のように、巨大モデルの競争の中で輝く、もう一つの勝利の形でした。
Project AstraとProject Mariner。2024年5月、カリフォルニア州マウンテンビューのショアライン・アマフィシアター。Google I/Oの基調講演のステージスクリーンに一本の映像が流れると、数千人の観衆は息を呑みました。映像の中のユーザーは、スマートフォンのカメラを起動してオフィス内を歩き回りながら、AIと会話をしています。「このスピーカーの音が出る部分はどこ?」と尋ねると、AIは正確にツイッターの部分を指し示します。窓の外を見せて「あれは何の街?」と問うと、AIは位置情報を認識して「ロンドンのキングスクロスです」と答えます。さらに、ユーザーが眼鏡をどこに置いたか思い出せなくなると、AIは「さっきあちらの机の上、赤いリンゴの隣に置きましたよ」と教えてくれます。これはSF映画『Her』の一場面ではありませんでした。デミス・ハサビス率いるディープマインドが用意した野心作、「プロジェクト・アストラ(Project Astra)」のデモンストレーションだったのです。
プロジェクト・アストラは、ハサビスが長年夢見てきた「汎用AIアシスタント」の青写真でした。彼は、AIが単にチャットウィンドウの中に閉じ込められたテキスト生成器であってはならないと信じていました。AIは人間と同じように、世界を見て、聞き、記憶すべきなのです。
アストラは、ビデオストリームをリアルタイムで理解し、処理する能力を備えていました。これは、膨大な技術的難題を突破した結果でした。視覚情報を言語情報へと変換する過程の遅延(レイテンシ)を、ほぼゼロにまで抑えなければならなかったからです。
ハサビスは、脳科学者としての背景を最大限に活用しました。人間の脳が視覚情報を処理し、反応する速度をベンチマークとし、アストラが人間と会話するように自然な「ピンポン(ping-pong)」形式の対話ができるよう設計したのです。アストラの核心は、「記憶(Memory)」と「文脈(Context)」にありました。
Astraは単に目の前にあるものを見ているだけではありません。少し前に見たものや、ユーザーと交わした会話の文脈をすべて記憶しています。これは、AIに時間の概念を与えたことと同義です。ハサビスは「真の秘書とは、主人が毎回すべてを説明しなくても、自ら察して動いてくれる存在です」と説明しました。
「Astraは、あなたの視線が向けられた場所や、あなたが見落としたものを代わりに記憶してくれる、第二の脳となるでしょう」と彼は語りました。これは、AIが単なるツール(Tool)を超え、パートナー(Partner)へと進化する重要な転換点でした。一方で、Astraが物理的な世界を理解しようとする試みであるならば、「プロジェクト・マリナー(Project Mariner)」はデジタル世界を征服しようとする試みでした。
ハサビスは、私たちが一日の大半を過ごすウェブブラウザこそが、AIが最も活躍すべき舞台であると判断しました。マリナーは、Chromeブラウザ上で動作する自律型エージェントです。「来週の東京出張の、
航空券とホテルを予約して、おすすめのレストランリストをまとめてカレンダーに入れておいて」という命令一つで、マリナーは自ら旅行サイトにアクセスして価格を比較し、予約を進め、地図を検索して移動ルートを組み立てます。この過程において、人間はただ結果を承認するだけでよいのです。マリナーの登場は、ヒューマン・コンピュータ・インタラクション(HCI)の歴史を塗り替える出来事です。これまで私たちは、マウスやキーボードを使って直接ボタンを押し、タイピングをしなければなりませんでした。
しかし、マリナーはAIが直接マウスを動かし、キーボードを入力する「実行可能なAI(Actionable AI)」なのです。DeepMindのチームは、これを実現するために数百万時間ものウェブブラウジングデータを学習させました。AIは、ショッピングサイトの複雑な決済プロセスや、官公庁サイトの難解なフォーム入力などを、人間のように、あるいは人間よりも速く正確に遂行する方法を学んだのです。
ハサビスはこれを、「インターネットという巨大な情報の海を航海する、有能な航海士(Mariner)をすべての人にプレゼントすること」と例えました。このような技術的ビジョンは、予期せぬ巨大なパートナーシップへとつながりました。それは、Appleとの協力でした。
世界は、GoogleのGeminiがiPhoneのSiriの背後で動作するというニュースに熱狂しました。これは、シリコンバレーの長年の競争構造を超えた、実用的な連合でした。AppleはオンデバイスAIの限界を克服するために強力なクラウドベースのモデルを必要としており、GoogleはGeminiを世界20億人のiPhoneユーザーに届けるための経路を必要としていたのです。
ハサビスにとって、このパートナーシップはAGI技術を普及させるための決定的な布石でした。今や人々は、iPhoneを手に、Astraの目を通じて世界を見、Marinerの手によってウェブを旅することになるでしょう。ハサスビスは、プロジェクトAstraとMarinerを通じて、AIの未来が「アンビエント・プレゼンス(Ambient Presence:気配を感じさせない存在)」になると予見しています。
映画『アイアンマン』のジャービスのように、普段は見えないものの、必要な時にはいつでもどこでも現れて問題を解決してくれる存在。それは、技術が高度に発達し、魔法と区別がつかない段階です。彼はDeepMindのエンジニアたちに常に強調しています。「私たちは製品を作っているのではありません。私たちは未来のライフスタイルを設計しているのです」と。AstraとMarinerは、その未来へと向かうタイムマシンなのです。
Gemini 2.0














