[AI书房] 第5章 剑桥大学与Lionhead工作室
德米斯·哈萨比斯,谷歌人工智能之父
德米斯·哈萨比斯,谷歌人工智能之父
第5章 剑桥大学与Lionhead工作室
金京镇
出战(1995~1997)与半蓝荣誉(Half Blue)的获得 1995年3月4日,星期六,伦敦帕尔摩尔街(Pall Mall)上的皇家汽车俱乐部。一百多年来,牛津与剑桥最顶尖的头脑在这栋建筑的对弈厅里隔着棋盘交锋,此刻厅内笼罩着一层冰冷的寂静。第113届校际对抗赛(Varsity Match)拉开了帷幕。红色地毯上,观众们屏住呼吸,目光追随着每一步棋的走向。
身穿剑桥代表队队服的十九岁少年德米斯·哈萨比斯,正安静地凝视着对面落座的牛津选手沙希·贾亚库马尔(Shashi Jayakumar)。哈萨比斯少年时代便已跻身世界14岁以下国际象棋排名第二。他当过英格兰青少年代表队队长,13岁时达到了大师等级(Elo 2300)。
经历过数百场锦标赛的淬炼,他早已习惯了胜负的压力,但代表大学出战,这个位置承载着另一种分量。牛津剑桥校际对抗赛不是一场普通的国际象棋比赛。自1873年创办以来,它关乎英国学术界的尊严,是两校智识传统的年度象征仪式。
哈萨比斯凭借敏锐的判断力和深厚的局面理解向贾亚库马尔步步施压,最终取得胜利,为剑桥6比2的大胜贡献了关键一分。剑桥大学有一项传统:向在体育运动中代表学校取得杰出成绩的学生授予「蓝色荣誉(Blue)」称号。赛艇、橄榄球、板球等主要项目授予「全蓝(Full Blue)」,国际象棋、击剑等项目则授予「半蓝(Half Blue)」。哈萨比斯凭借在校际对抗赛中的出色表现获得了半蓝荣誉。
从入学第一年的1995年到毕业年的1997年,他连续三年出战这项赛事,成为剑桥国际象棋队的核心选手。
哈萨比斯在校际对抗赛中交手过的牛津队选手中,有一位名叫达尚·库马兰(Dharshan Kumaran)。当时两人在棋盘上是对手。十多年后,库马兰加入了哈萨比斯创立的DeepMind,成为核心研究员。
曾在棋盘上互相角力的两个人,后来成了携手破解人类智能之谜的同事。这件事折射出哈萨比斯人生中那些不期而至的联结种子。国际象棋对哈萨比斯而言远不止一场游戏。他在对弈过程中不断观察自己的大脑如何运转:预判下一步棋时直觉率先启动的瞬间,逻辑计算随后加以验证的瞬间,试图揣摩对手心理时情感判断被触发的瞬间。比起输赢本身,他着迷的是这个过程。
校际对抗赛这样的大舞台,留给他的不是胜利的快感,而是一个更深的问题:「关于思考方式的思考」。棋盘上人类展现出的直觉与计算能力,怎样才能移植到机器身上?这个追问与他在剑桥课堂里学到的计算机科学理论不断交汇,逐渐勾勒出一个项目的轮廓。在皇家汽车俱乐部那间安静的对弈厅里推演数百种走法的那个青年,已经在塑造未来科学家和CEO的自我了。
他预感到,在国际象棋这个封闭系统(Closed System)中锤炼出的取胜法则,终有一天会成为解决现实世界开放问题(Open Problem)的钥匙。16岁完成A-level后进入剑桥的背景 德米斯·哈萨比斯完成英国大学入学考试A-level全部课程时,只有十六岁。他先后就读于北伦敦的伊丽莎白女王学校(Queen Elizabeth's School)和芬奇利基督学院(Christ's College Finchley),很早就意识到常规教育课程无法满足自己的求知欲。
他自学超前完成了数学和科学科目,同学们尚未开始的内容他往往早已学完。他比普通学生提前整整两年为高中阶段画上了句号。剑桥大学王后学院向这个十六岁的少年发出了录取通知。
但校方提出了一个条件:年纪太小。大学建议他
休学一年,也就是所谓的间隔年(Gap Year)。换作一般学生,大概会用这段时间去旅行或者做志愿者。对哈萨比斯来说,这一年的含义截然不同。
他一头扎进了从小就梦想的游戏开发世界。传奇游戏设计师彼得·莫利纽(Peter Molyneux)领导的牛蛙制作公司(Bullfrog Productions)接纳了他。17岁。在这个年纪,哈萨比斯以首席程序员兼联合设计师的身份参与了全球大热作品「主题公园(Theme Park)」的开发。
在游乐园模拟这一概念下,玩家设计过山车、雇佣员工、管理游客满意度,这款游戏在全球售出了数百万份。一个不到二十岁的少年同时收获了商业成功和业界认可。成功带来了诱惑。
彼得·莫利纽对哈萨比斯的能力深感叹服,抛出了一个破格的提议:「别去上大学了。留下来跟我们干,给你一百万英镑。」1990年代初期,对于一个在经济并不宽裕的多元文化家庭长大的十几岁少年来说,一百万英镑是超乎想象的数字。
父亲科斯塔斯经营着一家玩具店,还写歌;母亲安杰拉靠精打细算撑起这个家。这笔巨款足以改变全家人的生活。哈萨比斯犹豫了。
想必不是一个短暂的过程。但他的结论很明确:拒绝。他想要的不是眼前的回报,而是为破解「智能的秘密」打下学术根基。
在游戏开发现场他已经触碰到了智能的可能性,但他凭直觉感到,光靠编程技术解决不了这个问题。他需要理解计算机科学的数学原理,需要用系统的方法去研究人类大脑的运作机制。能奠定这些基础的地方不是游戏工作室,而是大学。
1994年秋天,哈萨比斯进入了王后学院。据说当时他开着用游戏销售收入买的保时捷出现在剑桥校园里。一个刚入学的十八岁学生开跑车来上课,这件事着实让同学们吃了一惊。但那不是虚荣,那是证明。证明这个学生已经在现实世界中验证过自己的能力。
哈萨比斯选择的专业是计算机科学荣誉学位课程(Computer Science Tripos)。剑桥的计算机科学课程根植于阿兰·图灵(Alan Turing)奠定的智识基础之上。研究出世界上第一台可编程电子计算机的莫里斯·威尔克斯(Maurice Wilkes)也出自这个学系。
哈萨比斯在这段历史之上搭建自己的知识体系。他不是那种只为绩点读书的学生。他拼命寻找的是理论武器,用来解决在牛蛙时遇到的那些问题:要让游戏里的NPC表现得更聪明,需要什么算法?要高效处理模拟世界的复杂性,需要什么样的数学结构?
1997年,哈萨比斯以「双一等(Double First)」最优成绩从计算机科学专业毕业,名列第一。双一等是指在剑桥荣誉学位考试(Tripos)的Part I和Part II中均获得一等荣誉(First Class Honours),全系仅有极少数学生能够达到。16岁考完A-level,拒绝一百万英镑的诱惑,选择知识而非保时捷,他的判断没有错。在剑桥的三年是哈萨比斯攀登人工智能这座大山的大本营。
他在那个大本营里已经在脑海中勾画出通往顶峰的路线。在Lionhead工作室为「Black & White」编写AI程序 与彼得·莫利纽的重逢及上帝游戏(God Game)的AI设计 1997年夏天,以第一名成绩从剑桥毕业的哈萨比斯再次走向了游戏行业。这一次,地形变了。他不再是度过间隔年的学生,也不再是受雇的普通程序员。
他加入的是自己的导师兼同事彼得·莫利纽新创立的Lionhead工作室(Lionhead Studios)。这家公司从萨里郡吉尔福德(Guildford)的一间小办公室起步,当时正承载着游戏业界最大的期待。因为莫利纽这个名字本身就是创新的担保。
莫利纽凭借「上帝也疯狂(Populous)」开创了「God Game」这一游戏类型。玩家以神的视角俯瞰世界,操控地形,引领民众,左右文明的兴衰。这个类型为游戏史带来了前所未有的体验。莫利纽正在构思一部要将这一类型推向巅峰的野心之作。
「黑与白(Black & White)」。玩家扮演神明,养育一个巨大的生物,治理村民,并且必须做出选择:是做仁慈的神,还是毁灭性的神。
莫利纽选中的、将这一愿景的核心付诸实现的人,正是哈萨比斯。哈萨比斯获得了首席AI程序员(Lead AI Programmer)的头衔。
这个头衔的含义再清楚不过:「黑与白」的灵魂,也就是让游戏世界活过来、有呼吸感的所有智能系统的设计与实现,全部由他负责。那个时期大多数游戏AI按的是预先编写好的规则运行。
敌人出现就攻击,血量低了就逃跑,不过是一套条件判断语句(if-then)。但哈萨比斯要设计的系统和那些完全不在一个量级。在「黑与白」里,玩家的道德选择必须实时反映到整个游戏世界中。
施以仁慈,天空就放晴,鲜花盛开。残暴行事,乌云压顶,大地开裂。设计一套逻辑结构将所有这些变化自然地串联起来,就是哈萨比斯的课题。
他和莫利纽通宵达旦地讨论。莫利纽问:「如果玩家把村民扔进大海会怎样?」哈萨比斯就要计算这个行为如何影响游戏世界的道德数值,对周围村民的行为产生什么连锁反应,最终又将怎样改变整个世界的视觉氛围。哈萨比斯坚持认为,人工智能不应该止步于执行玩家的指令。它应该能理解玩家的意图,并据此形成自己的性格。
以当时的技术水平来说,这是一个大胆的设想。但他有在剑桥三年积累下来的理论功底。他把在计算机科学中学到的搜索算法、概率论以及早期机器学习的概念,投入到游戏这个实验室中。
理论与实战的结合。这正是他在剑桥追求的,也是他在Lionhead开始实现的。Lionhead初创团队只有八个人。哈萨比斯是其中年纪最小的之一,但在AI这个领域,他拥有比任何人都强的话语权。莫利纽抛出创意灵感,哈萨比斯就把它翻译成逻辑系统。
两人的关系近似于一位怀揣愿景的建筑师与一位将愿景化为实体结构的工程师之间的协作。这段时期,哈萨比斯并不把游戏视为娱乐。他坚信游戏是将现实世界的复杂问题压缩后进行实验的最佳试验台。
God Game这一类型是理想的环境,让智能学习处理海量数据、制定长期计划、与人类互动。日后成为DeepMind核心的「强化学习(Reinforcement Learning)」的早期构想,正是在这段时期,在吉尔福德那间狭小的办公室里开始萌芽。从玩家行为中学习的生物(Creature)AI的创新 「黑与白」的核心是游戏中出现的「生物(Creature)」。
猴子、狮子、牛、老虎,玩家从中选一个,那个生命体就成为玩家的化身和弟子。生物会根据玩家的教导方式成长为完全不同的存在。接受仁慈教育的生物会成为守护村民的卫士;遭受暴力训练的生物则变成践踏村庄的怪物。
哈萨比斯作为首席AI程序员植入这个生物体内的学习系统,被公认为游戏史上最精密的人工智能之一。生物的大脑由多层学习机制构成。最基础的层面是欲求系统(Desire System)。
饥饿、疲劳、好奇、恐惧。生物以数值形式持有这些内部状态,并搜索能满足这些数值的最佳行为。肚子饿了就去树上摘果子吃,好奇心上升了就去探索陌生区域。到这里为止,之前的游戏AI也有过类似尝试。让哈萨比斯的系统产生根本性差异的,是他在上面叠加的观察学习(Observational Learning)和强化学习结构。生物会不断观察玩家的行为。
当玩家给村民分发食物时,生物目睹了这个举动,会在内部记录下「这是好的行为」这一信号。关键在于反馈系统。玩家可以用手形光标抚摸或拍打生物。当生物帮助了村民,玩家抚摸它,这就构成正向奖励;
当生物拔起大树乱扔,玩家拍打它,这就构成负向信号。哈萨比斯将这套奖惩机制与早期形态的神经网络(Neural Networks)结合起来,使生物随着时间推移形成自己独有的行为模式。此前的游戏角色只会对开发者预先输入的脚本做出反应。
哈萨比斯的生物不一样。意料之外的行为出现了。有些生物不光帮助村民,还自己开始种地。
有些生物为了吸引玩家的注意,捡起石头扔着玩。被残酷对待长大的生物会攻击其他村庄的生物;被温柔养育的生物则会走到受伤的村民面前递上食物。这种「不可预测的智能行为」同时给玩家带来了惊叹与沉浸感。
哈萨比斯在设计生物的学习过程时,参考了人类婴儿的发育过程。孩子从白板状态(Tabula Rasa)出发,模仿父母的行为,通过奖惩学会社会规范。他相信,人工智能正是以这种方式学习时才能实现最强大的智能。这个想法后来在DeepMind的AlphaGo Zero身上得到了戏剧性的验证。
只告诉它围棋规则,让它通过数百万局自我对弈独自攀升到超人水平,那个系统的智识根源就在这里,在Lionhead的生物身上。技术水平有差距,但「通过经验获取智能」这一核心思想是一脉相承的。玩家们惊讶地发现,自己养育的生物越来越像自己。
攻击性强的玩家养出的生物变得好斗,和平主义的玩家养出的生物则温驯起来。
这一现象给哈萨比斯留下了极深的印象。人工智能就是一面镜子。创造者的价值观原封不动地映射到被造物身上,这个事实揭示了一个真相:技术本身或许是中立的,但用来训练它的数据和环境绝不中立。
日后哈萨比斯反复强调「价值对齐(Alignment)」的重要性,并认真投入AI安全研究,背后正是这段游戏开发现场的经历在起作用。2001年『黑与白』问世时,全球评论界对这款游戏的人工智能给予了高度赞誉。哈萨比斯作为游戏开发者,站上了顶峰。
但他没有止步于此。虚拟世界中的角色既然能表现出如此智能的行为,那么真正的人类智能究竟依靠怎样的机制运作?这个问题把他重新引向了学术世界,引向了直接研究人脑的神经科学之路。开发Creature AI的经历,在哈萨比斯心中种下了一个决定性的信念。
那就是:理解智能最有力的工具不是编程技术,而是「学习」这一原理本身。剑桥大学皇后学院(Queens' College)
人工智能专家 金京镇律师
AI法律政策专家 · 前国会议员 · 著作等身
如果这本书曾在您身边短暂停留,请支持我们,让下一个故事也能与世界见面。
(自愿赞助账户:韩国农协银行 302-1096-0948-81 户名:金京镇)













