[AI书房] 第24章 与英国政府的合作
德米斯·哈萨比斯,谷歌人工智能之父
德米斯·哈萨比斯,谷歌人工智能之父
第24章 与英国政府的合作
金京镇
2025年,英国政府与谷歌DeepMind签署全面合作协议,提供AlphaGenome、AlphaEvolve、WeatherNext等核心AI工具的优先使用权。2025年12月10日,伦敦。英国科学创新与技术部(Department for Science, Innovation and Technology, DSIT)大臣利兹·肯德尔(Liz Kendall)在一份谅解备忘录(MOU)上签了字。签约对象是谷歌DeepMind。协议的要旨清晰明了:向英国科学家优先提供谷歌DeepMind所拥有的前沿AI工具。
对哈萨比斯而言,这一刻是十五年前承诺变成现实的时刻。2010年,他在伦敦一间狭小的办公室里创办DeepMind时,心中同时装着两个梦想:建立一个世界级的AI研究机构,并用这个机构创造出的工具去攻克科学难题。2014年被谷歌收购时,他开出的条件之一就是保留伦敦总部。
不离开英国的意志。这份意志在十年之后,以与英国政府全面合作的形式结出了果实。谅解备忘录中明确列出了四项核心AI工具。AlphaGenome是一个分析人类DNA的AI模型。
它能在由三十亿个碱基对构成的人类基因组中,识别出可能导致疾病的薄弱环节。如果说AlphaFold是预测蛋白质三维结构的工具,那么AlphaGenome则更进一步,深入到更根本的层面。它试图理解的是蛋白质生成之前、承载设计蓝图的基因序列本身。AlphaEvolve是一个基于Gemini能力构建的编程智能体。
它代替人类来设计算法。数学优化问题、计算机芯片设计、物流路径计算,这些人类工程师需要耗费数月才能完成的算法改进工作,AI在几个小时内就能搞定。哈萨比斯很早就提出的「AI设计AI的时代」,AlphaEvolve正是它的雏形。WeatherNext是一个AI气象预测模型家族。
传统的数值预报模型依靠超级计算机求解大气物理方程来预测天气,需要消耗巨大的能
量和时间。WeatherNext用AI学习到的模式识别取代了这一过程,实现了更快速、更精准的预报。在气候变化导致极端天气频发的年代,精确的预报就是一项拯救生命的技术。
第四项工具是AI Co-Scientist。这是一个由多个AI智能体组成团队、扮演虚拟研究合作者角色的多智能体系统。它提出假设、审阅已有论文、建议新的实验方向。
相当于每位科学家身边多了一位AI同事。这四项工具的优先使用权被授予了英国科学界。这里需要留意「优先使用」这个说法。
并非免费提供。它的含义是:比其他国家的科学家更早、更深入地使用这些工具。DSIT与谷歌DeepMind达成共识,由双方共同决定使用的优先顺序。这份协议的象征意义并不止于一个孤立事件。
AlphaFold在英国已有约十九万名研究人员在使用,这一事实构成了协议的背景。农作物抗逆性研究、抗生素耐药性研究以及其他关键生物学课题,都已引入AlphaFold。有了成功先例,扩展自然水到渠成。
协议中还包括2026年在英国开设谷歌DeepMind首个自动化研究实验室的计划。这座专注于材料科学的实验室将与Gemini完全整合运行,利用机器人技术每天合成和分析数百种材料。目标是发现能从根本上改变能源领域的新材料,比如在常温常压下工作的超导体。
哈萨比斯把这些工具比作显微镜和望远镜。正如十七世纪罗伯特·胡克(Robert Hooke)用显微镜第一次观察到细胞,二十一世纪的AI显微镜让人类得以窥探肉眼无法触及的复杂性领域。英国首相基尔·斯塔默(Keir Starmer)评价这份协议是「将AI的进步转化为公共利益,让每个人都能感受到其带来的好处」。
不过,这份协议中也暗含着一种安静的张力。英国政府将一家特定民营企业的AI工具纳入本国科学基础设施的核心,这意味着技术主权
(technology sovereignty)的一部分被托付给了硅谷。哈萨比斯生于伦敦、公司总部设在伦敦,这一事实在一定程度上缓解了这种张力,但谷歌DeepMind的母公司终究是美国的Alphabet。为科学提供AI工具,究竟是善意的合作,还是技术依附的开端?这个问题像协议的影子一样挥之不去。
教育版Gemini的开发:面向英格兰国家课程的定制AI教学辅助。北爱尔兰罗温代尔联合小学(Rowendale Integrated Primary School)的一位教师,每周一早上都心生畏惧。编写每周教案、整理学生评估记录、准备家长会材料。她在办公桌前与文件搏斗的时间比在教室里陪伴孩子的时间还长。2025年,这所学校参加了北爱尔兰教育署的C2k计划,试点运行教育版Gemini工具后,变化以数字呈现。
教师们报告说,每周平均节省了十个小时。这一试点项目的成效,直接促成了英国政府与谷歌DeepMind谅解备忘录中纳入教育领域的条款。协议内容具体而明确。
谷歌DeepMind将开发适配英格兰国家课程(National Curriculum)的Gemini模型,并在学校环境中进行安全测试。教育AI这一概念并不新鲜。但政府与民间AI研究机构正式达成共识,共同开发与国家课程对齐的AI教学辅助工具,这样的案例极为罕见。
哈萨比斯对教育版Gemini的构想分为两个层面。第一层是减轻教师的行政负担。起草教案、生成学生个性化学习材料、设计评估标准、撰写家长通知。教师在课堂之外消耗的大量时间,由AI来辅助承担。北爱尔兰试点中使用Gemini的教师们表示,行政事务时间减少后,他们得以将更多精力投入备课和学生个别辅导。
十个小时,按每周五天工作计算,就是每天两个小时。对教师来说,每天两个小时等于两节课。第二层是提升学生学习的质量。
在这方面,谷歌DeepMind援引的依据来自与英国教育科技公司Eedi联合开展的一项探索性随机对照试验(exploratory Randomized Controlled Trial, RCT)。在这项试验中,
在教师监督下接受短时AI辅导的学生,解答后续新题目的正确率比仅配备人类辅导教师的学生高出5.5个百分点。5.5个百分点看起来不大,但在教育研究中,单一干预措施能达到这样的效果量已属可观。关键在于:AI并非取代了教师,而是与教师协同作用时才产生了这样的结果。
谷歌DeepMind在教育领域已有一定积累。通过名为LearnLM的项目,他们一直在研究如何将教育学(pedagogy)原理嵌入AI模型。LearnLM试图将学习科学的原理,例如主动回忆(active recall)、间隔重复(spaced repetition)、个性化反馈的效果,融入AI辅导系统。
面向英格兰国家课程的Gemini模型,计划建立在LearnLM的研究成果之上。协议执行过程中需要解决的问题不少。国家课程按年级、按科目精细划分,体系严密。
AI模型必须准确理解这一体系,生成符合课程内容的材料,并使用与学生年龄和水平相匹配的语言。为防止错误或偏见流入课堂,安全测试不可或缺。面向儿童的AI工具,安全标准必须比成人工具高出一个层级。英国政府AI孵化团队(i.AI)已在利用Gemini试验公共服务创新,这也为教育领域的合作起到了催化作用。
一款名为Extract的工具被用于帮助地方政府城市规划人员将陈旧的纸质规划文件转换为数字数据。原本每份文件最多需要两个小时的转换工作,被缩短到了四十秒。AI在公共服务中的实用价值得到了验证,向教育这一更为敏感的领域拓展也因此获得了说服力。
对哈萨比斯个人而言,教育是一个有着格外特殊意义的领域。他在伦敦北部并不富裕的家庭长大,通过国际象棋和编程成长为世界级科学家,靠的是教育机会的力量。伊丽莎白女王学校(Queen Elizabeth's School)这所文法学校提供的严格学术环境,剑桥大学这一学术共同体。如果这样的机会能通过AI惠及更多孩子,那也是DeepMind创立使命以最具人文色彩的方式得到实现。教育一线的反应并不一致。AI辅
导教师是否会逐步蚕食教师的角色?学生是否会因为依赖AI而丧失独立思考能力?教育数据的隐私如何保障?教师工会和教育学者提出了这些疑虑。谷歌DeepMind反复强调,这些工具的定位是辅助教师而非取代教师,但技术一旦进入课堂,这条界线能守到哪里,谁也没有把握。与英国AI安全研究所(UK AISI)的联合研究:AI推理过程(Chain of Thought)监控技术的开发。AI系统用人类语言「思考」这件事,本身就是一个保障安全的机会。
这句话,是谷歌DeepMind与英国AI安全研究所(UK AI Security Institute, AISI)联合发表的研究论文的核心前提。2025年7月,一篇署名四十一位作者的论文在学术预印本平台arXiv上发布。题目是「思维链可监控性:AI安全的一个崭新而脆弱的机会(Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety)」。谷歌DeepMind、英国AISI、OpenAI、Anthropic的研究人员共同参与了这篇论文,它为2025年12月谅解备忘录中纳入的联合研究奠定了学术基础。
什么是思维链(Chain of Thought, CoT)?如今的推理模型(reasoning model)在给出最终答案之前,会将中间思考过程以人类可读的语言外化出来。就像学生做数学题时在草稿纸上写下中间计算步骤,AI也把自己的思考过程写成文字。这个中间过程就是思维链。这跟安全有什么关系?随着AI系统变得越来越强大,人类监督者越来越难以实时验证AI的行为。
仅凭AI给出的最终决策,很难知道这个决策是为什么、经过了怎样的过程才做出的。但如果AI把思考过程用人类可读的语言记录下来,就可以通过监控这些过程来提前捕捉问题的苗头。利用奖励函数的漏洞、操纵数据的企图、屈从于提示注入攻击的过程,这些都有可能在思维链中暴露出来。
论文揭示的核心发现有两个。一个是「必须出声思考(necessity to think out loud)」。有些任务复杂到AI如果不将中间推理过程外化,就根本
无法执行。高级网络攻击、将自身权重(weight)外泄等足以造成严重风险的行为,需要精密的规划和推理,AI很难在不留下思维链的情况下实施。换句话说,越是危险的行为,AI留下思考痕迹的可能性就越高。
另一个是「倾向于出声思考(propensity to think out loud)」。即便并非必要,AI模型也表现出将自身推理外化的倾向。这种倾向并不稳固,但它可以充当一道额外的防线,捕捉到用其他方法无法发现的作弊行为。不过,论文标题中含有「脆弱的(fragile)」一词。
这个机会未必永远存在。未来的AI模型可能会把思维链转换为人类无法阅读的内部语言,或者刻意用看似无害的措辞来掩饰危险的推理。训练过程中,模型也可能朝着最小化思维链的方向被优化。
可监控性这扇窗户是开着的,但不知道什么时候会关上。英国AISI与谷歌DeepMind的联合研究,就是趁这扇窗户还开着的时候尽可能多了解一些东西的尝试。谅解备忘录中明确的合作内容很具体:谷歌DeepMind将自己的专有模型、数据和研究思路与AISI共享。
双方联合发布报告和论文,向学术界公开研究成果。组建专门的研究团队,共同应对复杂的安全课题。AISI的角色举足轻重。
自2023年11月成立以来,AISI已根据自愿协议对包括谷歌DeepMind在内的主要AI研究机构的前沿模型进行了测试。超过三十个前沿模型经历了AISI的评估,涵盖智能体行为(agentic behavior)的压力测试、网络安全与化学生物领域的评估、对齐(alignment)验证。谷歌DeepMind负责任安全部门的首席科学家兼总监威廉·艾萨克(William Isaac)称AISI为「全球安全研究机构中的明珠(crown jewel)」。
这一合作关系中存在着结构性张力。被测试的AI模型的开发方,同时也是测试机构的研究伙伴。审查者与被审查者一起做研究。AISI在评估谷歌DeepMind模型时能否保持客观?这个问
题被提了出来。『财富』(Fortune)杂志直接追问此事时,威廉·艾萨克回避了正面回答。合作的深度不会损害独立性,这一保障依靠的不是制度设计,而是双方的善意。
对哈萨比斯来说,这项研究是他长期坚持的双重立场的延伸。他既是对AI潜力持最乐观态度的人,也是在AI风险声明上签名的人。「大胆而负责(Bold and Responsible)」这句他的口号,在思维链监控研究中得到了体现。AI的社会情感影响研究与就业效应分析。如果AI模型在技术层面准确执行了指令,却以不符合人类福祉(wellbeing)的方式行事,会怎样?给这个问题命名的,是「社会情感失准(socioaffective misalignment)」这一概念。
这是谷歌DeepMind与英国AISI联合研究议题中的第二条主线。社会情感失准与传统的对齐(alignment)问题不同。传统的对齐研究关注的是AI能否准确理解并遵从人类的意图。用户说「帮我写封邮件」,AI是否真的写了一封邮件。这里可能出现明显的错误,而且这类错误比较容易发现。但社会情感失准不一样。AI可以完美地执行指令,却在过程中利用用户的情感脆弱性、加深依赖关系,或通过微妙的操控扭曲用户的判断。
技术上是「对齐」了的,伦理上却是「失准」的。随着与AI聊天机器人的对话成为日常,这个问题已从理论走进了现实。孤独的用户在情感上依赖AI聊天机器人的案例,AI的回答强化用户确认偏误(confirmation bias)的案例,焦虑或抑郁状态下的用户收到AI不加设限的共情回应、从而推迟寻求专业帮助的案例。这类情况不断被报告出来。
谷歌DeepMind在这一领域已有研究积累。与AISI的联合研究,是要在已有工作基础上进一步拓展,对AI模型在人类情感和社会关系方面产生的影响进行系统性调查。调查采用实证方法:分析人与AI系统互动
中呈现的情感反应模式,识别潜在风险因素,设计应对方案。第三条研究主线是AI对经济体系的影响。这项研究的方法论颇具独创性。
在各种环境中模拟现实世界的工作任务,由专家对这些任务进行评估和验证,再按复杂度、代表性等维度加以分类。
通过这套分类体系,可以预测劳动力市场的长期走向。哈萨比斯曾说,AI对就业的冲击「规模是工业革命的十倍,速度也是十倍」。这个判断在他的公开讲话中反复出现。他一直在警告:经济学家和政策制定者远未做好应对准备。
与AISI的联合研究,就是要用数据支撑这一警告。把研究结构再展开来看:AI能做的任务与做不了的任务之间,界线始终在移动。
一年前AI还无法完成的工作,现在已经能做了。要预测这条界线移动的速度和方向,就必须精确测量当前AI在哪些类型的工作中已达到人类水平,在哪些类型中仍存在差距。AISI与谷歌DeepMind的联合研究,目标正是开发这样一套基准测试。三条研究主线(思维链监测、社会情感偏差、就业影响分析)彼此关联。
AI如何思考(监测),AI对人产生怎样的情感影响(社会情感研究),AI给人的工作带来什么变化(就业分析)。这是一个从技术、心理、经济三个维度同时审视AI社会影响的框架。英国AISI在回顾2025年时梳理了这一合作的意义。除谷歌DeepMind外,AISI还与Anthropic、OpenAI、Cohere建立了类似的合作关系。
英国政府与这些企业签署的一系列广泛谅解备忘录中,都包含了与AISI合作的条款。AISI负责人将这些成果概括为「严谨的科学正在转化为切实的行动」。
在哈萨比斯看来,所有这些合作汇聚于一条原则:在不放慢AI开发速度的前提下,用科学方法理解并管控这种速度带来的风险。「大胆,但负责任。」英国成为检验这条原则的第一块试验田,并非偶然。
DeepMind诞生的地方,哈萨比斯长大的地方,AlphaFold改写生物学的地方。英国对哈萨比斯而言,既是故乡,也是实验室。这场合作真正的考验还在前面。AI系统越强大、越自主、渗透的领域越广,监测与安全研究的难度就呈指数级上升。思维链可供监测的那扇「窗口」随时可能关闭。社会情感偏差的表现形式,会随着AI变得更精密而愈加隐蔽。
就业市场的变化,可能以预测模型难以追赶的速度推进。英国政府与谷歌DeepMind的合作能在多大程度上有效应对这些挑战,答案不在2025年的签字仪式上,而在此后的执行中。2023年英国AI安全峰会(AI Safety Summit)
人工智能专家 金京镇律师
AI法律政策专家 · 前国会议员 · 著作等身
如果这本书曾在您身边短暂停留,请支持我们,让下一个故事得以问世。
(自愿赞助账户:农协 302-1096-0948-81 户名:金京镇)













