[AI书房] 第7章 Heron Systems的旋风:以强化学习武装的AI
人工智能战斗机,人工智能空军
第二部 AlphaDogfight:空战的图灵测试
第7章 Heron Systems的旋风:以强化学习武装的AI
金京镇
大赛最有力的夺冠热门,毫无疑问是洛克希德·马丁。他们造出了F-22猛禽、F-35闪电II等当今最强战斗机,对战斗机的物理特性和空战战术的理解无人能出其右。数十年积累的空气动力学经验、数千名工程师、天文数字般的研发预算。怎么看,优势都在他们那边。
Heron Systems则是一家员工不过三十来人的小型软件公司。他们既没造过战斗机,也没驾驶过。这家总部位于马里兰州的小公司,居然能和军工巨头并肩站在同一赛场上,本身就显得不可思议。但他们手中握着一件秘密武器,那就是对深度强化学习近乎疯狂的执着与投入。
强化学习的原理并不复杂。选择一个动作,观察结果,获得奖励或惩罚,下一次做出更好的选择。然后以惊人的速度不断重复这个过程。这和小孩学走路差不多。摔倒,爬起来,再摔倒,再爬起来。但AI和小孩不同。它不会疲倦,不会沮丧,一天之内可以摔倒再站起来数百万次。
Heron Systems的方法与传统军工企业截然不同。
洛克希德·马丁和Aurora等团队试图把战斗机飞行员的知识灌输给AI。咬住敌机尾巴、保存能量之类的规则,他们想逐条教会AI。这种方式叫做专家系统。Heron走了另一条路。他们什么都不教AI,而是把它扔进虚拟环境里,让它在无数次生死搏杀中自己摸索。
Heron的AI智能体被命名为「Falco」,取自猎鹰(Falcon)一词。Falco通过在虚拟空间中不断与自己对战的自我博弈方式成长起来。为了打败昨天的自己,今天的自己开发出新战术;明天的自己又把这套战术破解掉。这个过程无限循环。
据Heron的机器学习工程师Ben Bell介绍,Falco在大约五周的时间里,与由102个不同AI智能体组成的联赛进行了数十亿次格斗对抗,经历了超过40亿个仿真步骤。折算成人类飞行时间,相当于积累了约30年以上的飞行经验。考虑到真实飞行员终其一生也很难超过两三千小时的飞行时长,这是一场超越物理时间限制的压缩时间的胜利。
在这个过程中出现了一个耐人寻味的现象。
学习初期,AI努力模仿人类教官传授的标准机动:管理能量、维持转弯率,都是教科书式的动作。但随着训练的深入,AI开始抛弃人类的作战教条,转而在仿真引擎物理法则允许的范围内,追求极致的效率。
人类飞行员为了不丢失目标,倾向于平滑地控制飞机。Heron的AI不一样。它以细微而急促的方式不停修正操纵面,每秒进行数十次修正操纵。这种动作人手根本做不到。凭借这种方式,它创造出了难以置信的精准射击角度。
Heron Systems成功的背后有两项精妙的技术:奖励塑形和课程学习。奖励塑形是一种更频繁地向AI提供反馈的方法。不只在击落敌机时给予奖励,占据有利位置时、接近敌机尾部时也给予小额奖励。这样AI就能更快地朝正确方向学习。
课程学习则是从简单的开始教起。一开始让AI和只会直线飞行的敌机对战,然后逐步提升对手的智能水平。就像从小学升到初中、再到高中一样。Heron把这两项技术与「竞技场」自我对战系统结合在一起,锻造出了强悍的性能。
APL开发的敌方AI智能体在复杂度和能力上呈现出宽广的谱系。最简单的「Zombie」以直线水平飞行模拟巡航导弹。基础智能体「Logy」执行基于时间的微小高度和速度变化。脚本智能体「BUD FSM」能够感知交战状态并执行预设反应。最高级别的强化学习智能体「AlphaMav0」是完全没有人类输入、仅靠自我对战训练而成的智能体,用于模拟专家级飞行员。
大赛第三天,半决赛和决赛相继展开,Heron Systems的AI亮出了一招令人震惊的战术:正面攻击,即迎头机炮射击(Head-on Gun Shot)。这是一种与敌机面对面高速对冲、同时开火射击的战术。人类飞行员因为碰撞风险,在训练规程中将这种机动视为禁忌。通常在135度以上的交汇角就不会开火。双方相撞的风险太大,被击毁敌机的碎片还可能被吸入自己的发动机。
但对于没有死亡恐惧的AI来说,这恰恰是胜率最高的制胜公式。半决赛遭遇Aurora团队时,Heron的AI一开战就以惊人的速度直扑敌机正面。担任解说的Glock目瞪口呆:「Heron毫不犹豫。开战信号一响,它就露出杀意,直取对方的鼻尖。」
Heron的AI在与洛克希德·马丁的决赛中,将这一战术发挥得淋漓尽致。
洛克希德·马丁的AI遵循人类作战教条,注重能量管理和抢占位置。动作优雅,打法正统。但Heron的AI拒绝这种绅士式的交锋。它像疯犬一样猛扑上去,撕咬对手的每一个破绽。
Heron以惊人的精度瞄准机炮。炮口像被磁铁吸住一样紧紧锁定敌机。一旦咬住目标,绝不松口。在双方擦身而过的瞬间,就给敌机造成致命打击。人眼判断在那个角度根本无法开火的情况下,AI的计算中却是命中概率超过90%的机会。
大卫最终击败了歌利亚。Heron Systems在决赛中以16胜4负的压倒性比分击败洛克希德·马丁,登上冠军宝座。一个30人的小团队,打败了拥有数万名工程师的军工巨头。这件事说明,数据学习能力有时比领域知识更为关键。比起制造战斗机的经验,训练AI的方法论才是决定性因素。
Heron Systems掀起的这场旋风证明了一件事:AI不再停留在模仿人类的阶段,它能够通过数据和仿真,创造出人类从未发现的全新制胜法则。而此刻,等在他们面前的,是压轴对手,,人类飞行员。


