[AI书房] 第3章 读取脑信号的工具
读脑者:Neuralink与人类最后的革命
第3章 读取脑信号的工具
金京镇
一、EEG、ECoG、fMRI、fNIRS:各测量方式的优劣比较
观察大脑的方法不止一种。天文学家用可见光、红外线、射电望远镜看到的是不同面貌的宇宙,神经科学家同样通过多种「窗口」观察大脑。有的窗口快但模糊,有的窗口清晰但慢。有的从颅骨外面往里看,有的直接深入脑内。要理解BCI,先得了解这些窗口各自的特性。
EEG,也叫脑电图,是在头皮上贴电极来测量大脑电活动的方法。它捕捉的是数百万个神经元同时放电时产生的电位差。EEG的强项在时间分辨率。大脑的电变化以毫秒为单位发生,EEG能实时捕捉这些快速变化。设备相对便宜,便于携带,不需要手术。从游戏头戴设备到医疗级仪器,EEG是使用范围最广的BCI工具。
但EEG有一个致命弱点:空间分辨率低。大脑发出的电信号穿过颅骨和头皮后大幅衰减,多个区域的信号混在一起。科学家把这比作「在足球场外面听呐喊声」。观众齐声喊「哦!」的时候,你能判断有人进球了。可你绝对听不到某两个观众之间的对话,因为隔着混凝土墙。同样道理,EEG能感知大脑的整体状态变化,却很难解读「弯曲右手食指」这样精细的指令。眨眼或咬牙时产生的肌电信号会制造强烈噪音,足以把脑电波淹没。
ECoG,即皮层脑电图,正是为了突破这一限制而出现的。它需要打开颅骨,将电极网格直接贴在包裹大脑的膜上方或下方。如果说EEG是在球场外面,ECoG就像坐在球场内的VIP席位观赛。颅骨这道屏障消失了,信号清晰得多。空间分辨率提升到毫米级,还能测量高频段信号,在解读手指运动或说话意图等具体信息方面优势明显。2024年发表的一项研究报告称,通过ECoG对一名ALS患者的高伽马信号进行了36个月的稳定记录,平均准确率保持在91%。
ECoG的代价很明确:需要开颅手术。存在感染风险,给患者带来手术负担。它过去主要用于癫痫术前检查和科研,对普通人来说,进入门槛依然很高。
fMRI,即功能性磁共振成像,看的不是电,而是血流。大脑某个区域活跃时,携带氧气的血液会涌向那里,fMRI利用磁场把这种变化拍成三维影像。
fMRI的强项在空间分辨率。它能以毫米精度绘制大脑深处的地图,在判断情感、记忆等复杂功能发生在大脑哪个位置方面,无出其右。
但从BCI的角度看,fMRI有一个致命缺陷:时间延迟。神经元放电以毫秒为单位,血液涌到相应区域却需要几秒钟。用户想了「向右走」之后,要过2到3秒fMRI才能检测到。这对需要实时控制的BCI来说不可接受。设备庞大到能占满整间房,造价动辄数十亿韩元。被试必须一动不动地躺在狭窄嘈杂的隧道里。
fNIRS,即功能性近红外光谱技术,被称为fMRI的便携版。它利用近红外光能穿透颅骨这一特性,从戴在头上的带状装置发射光线,再分析反射回来的光,测量脑血流中的氧浓度。fNIRS比fMRI便宜得多,也轻得多。坐着、站着,甚至走路时都能测量。它适合在日常生活中监测脑活动,近年来已广泛应用于驾驶员瞌睡检测、学生注意力评估、中风康复治疗等场景。
不过fNIRS也有局限。光能到达的深度仅限于皮层表面,空间分辨率停留在厘米级。血流反应的延迟使它和fMRI一样不适合快速控制。头发浓密的人信号采集困难,这也是一个现实问题。
完美的工具并不存在。EEG快但模糊,fMRI精准但慢,ECoG清晰但需要手术。2024年以来,研究者尝试将多种方式结合的混合方案来克服这些限制。同时使用EEG和fNIRS、将快速电信号与血流变化一起观察的研究越来越多。2024年的一项研究报告称,EEG-fNIRS集成系统在运动想象任务中达到了95.86%的分类准确率,远高于单独使用EEG的水平。
设计BCI时,研究者面对的归根结底是选择问题。精度与便利性之间的平衡,侵入与非侵入之间的平衡。想测量什么?需要多快的响应?患者能承受多大的风险?对这些问题的回答决定了工具的选择。
二、微电极阵列与柔性电极的生物相容性挑战
2012年的某一天,布朗大学John Donoghue教授的实验室里,一位女性用机械臂喝了一口咖啡。Cathy Hutchinson,58岁,15年前因中风导致四肢瘫痪。她的大脑里植入了一块叫做Utah Array的小芯片。指甲盖大小的硅片上竖着96根细针。这些针从她的运动皮层读取神经元信号,计算机解读信号后向机械臂发出指令。她仅凭意念拿起杯子送到嘴边。这是14年来的第一次。
这一幕向全世界展示了侵入式BCI的可能性。然而研究者在欢呼声中也感到不安。Utah Array能工作多久?大脑真的会接纳这些金属针吗?
侵入式BCI的核心是电极。与其在头皮外面隐约地听,不如贴近大脑去听个清楚,这就是侵入式的理念。Utah Array这样的微电极阵列直接插入皮层,记录单个神经元的放电。一次可以从数百个通道获取信号,信号清晰度远非EEG可比。
问题在于,大脑并不欢迎这些入侵者。脑组织像豆腐或布丁一样非常柔软,而传统电极由硅或金属制成,相对坚硬。这种机械性能的不匹配引发了严重问题。大脑并非静止不动。每次心跳,血流都会让它微微膨胀和收缩;每次转头,它都在颅腔里轻微晃动。坚硬的针扎在柔软且不断运动的大脑里,会持续损伤周围组织。就像刀切果冻一样。
由此引发大脑的免疫反应。小胶质细胞和星形胶质细胞涌向电极周围,引起炎症。最终用坚硬的瘢痕组织把电极包裹起来。这层瘢痕起到绝缘体的作用,随着时间推移,电极越来越听不到神经元的信号。这是限制Utah Array寿命的最大因素。植入几个月后信号质量开始下降,几年后大量通道丧失功能。
为了解决这个问题,研究者把目光投向了柔性电极。如果用与脑组织机械特性相似的材料制作电极会怎样?Neuralink开发的电极丝就是典型例子。在仅有头发直径二十分之一厚的聚酰亚胺薄膜上蒸镀金电极,能随大脑的运动一起波浪般摆动。理论上可以大幅减少因机械不匹配造成的损伤和免疫反应。
但柔性电极的问题不是「软就好」这么简单。太柔软就很难插入大脑。穿透大脑保护膜需要一定的刚度,可柔性电极会弯折。
为此,人们尝试了多种工程方案。Neuralink开发了一款借鉴缝纫机原理的手术机器人:一根坚硬的钨针夹住柔性电极丝推入大脑,然后针退出,只留下电极。机器人通过计算机视觉实时识别脑表面的血管并绕开它们来插入电极。
另一种思路是可溶解涂层。用糖或可生物降解聚合物给柔性电极涂上一层外壳,插入时保持刚硬,植入后体内水分将涂层溶解,电极恢复柔软。哈佛大学Charles Lieber团队展示了一种通过注射器将网状电极注入大脑的技术。据报告,这种网状结构在脑组织间展开,与神经细胞自然交织,能最大限度减少免疫反应。
2024年发表在Nature Communications上的一项研究介绍了通过血管植入超柔性电极的方法。无需开颅,从颈静脉将电极推送到大脑附近的血管,再穿过血管壁将电极安置在脑组织中。在羊身上的实验中,该方法成功记录到了单神经元水平的信号。2025年,一种1024通道超薄电极阵列无需开颅、仅在颅骨上开一个小缝即可植入的技术,在猪模型和人体手术环境中得到了验证。
材料科学的进展同样值得关注。基于纳米多孔石墨烯的柔性电极,即使电极直径只有25微米,也实现了低阻抗和高电荷注入能力。据报告,在啮齿动物脑内慢性植入12周、在外周神经植入8周后,生物相容性仍然保持良好。用导电聚合物或水凝胶涂覆电极表面以柔化与脑组织的界面,或用抗炎药物涂层抑制早期免疫反应的研究也在进行中。
终极目标是能够数年乃至数十年保持性能不衰减的慢性BCI。为此,不仅需要机械柔性,电极材料还必须耐受体液腐蚀,无线传输产生的热量也不能损伤脑组织,热管理设计不可或缺。但截至2025年,大多数慢性植入柔性电极的最长寿命约为一年。人类大脑与机器要共处数十年,路还很长。
生物相容性归根结底不只是材料问题。植入瞬间的损伤、微运动造成的反复损伤、免疫反应的累积、电化学劣化、长期维护的不可行性,这些因素叠加在一起毁掉信号。真正的标准不是「一开始效果好」,而是「6个月、1年、数年后仍然保持同样的质量」。让大脑这种柔软而敏感的组织,与机器这种坚硬而异质的物体和解,这是侵入式BCI必须跨越的最根本障碍。
三、信号带宽与准确率:「可用BCI」的条件
2021年,斯坦福大学一名男子仅凭意念写出了文字。他是一位四肢瘫痪患者,想象自己在写字,植入大脑的电极读取了他运动皮层的信号。计算机解读信号后将字母显示在屏幕上。每分钟90个字符,远超普通人用智能手机打字每分钟40到50个字符的速度。研究团队将这一成果发表在Nature上,证明BCI有可能成为实用的沟通工具。
BCI的演示视频总是令人印象深刻。仅凭意念操控机械臂、驾驶轮椅、玩游戏。可一旦用户每天使用,炫酷就毫无意义了。在实验室里可行的事,和日常中真正好用的事,完全是两码事。「可用BCI」的条件不是靠感觉,而是用数字来定义:带宽、准确率、延迟时间。这三项是关键。
带宽衡量的是一次能传输多少信息。Elon Musk把BCI的核心问题定义为「带宽瓶颈」。我们用手指触摸智能手机屏幕时,每秒输入数十比特的信息。但早期基于EEG的BCI每分钟只有几比特。用户只能选择「是」或「否」,或极其缓慢地移动光标。这种速度令人抓狂,根本无法用于实际生活。
BCI领域用信息传输率这一概念来综合评估速度和准确率。在从若干选项中判别用户意图的分类任务中,将正确率、选项数量和尝试次数合并换算为每分钟比特数。截至2024年,非侵入式EEG打字系统的信息传输率停留在每分钟5到10比特。侵入式ECoG系统则达到了每分钟数十甚至数百比特。斯坦福那项手写想象研究记录的每分钟90个字符,正是这种带宽差距的标志性案例。
准确率指的是「我想A的时候,计算机识别为A的概率」。90%的准确率看起来不错,但如果每10次就有1次打错字或点错位置,用户很快就会疲惫。因为纠正错误指令的成本很高。准确率还不只是一个数字,错误的形态同样重要。光标移动BCI即使有90%的准确率,如果错误表现为「偶尔朝反方向猛冲」,用户每次操作都得提心吊胆。如果错误只是「移动幅度稍小」,还可以修正。
脑信号随时间变化。早晨和傍晚的脑状态不同,疲倦或情绪波动时,即使想同样的事,信号模式也会改变。电极发生微小位移,信号特征也会变。这叫做非平稳性。过去的BCI每天使用前需要花30分钟做校准,严重影响实用性。「可用BCI」要么一次学习就能长期保持性能,要么在使用过程中算法自行适应以维持性能。Neuralink的首位患者Noland Arbaugh就是一个案例:植入后部分电极从大脑中脱出导致信号减弱,但团队通过修改解码算法重新提升了准确率。
据报告,即便出现电极脱落,经过算法调整后准确率得以恢复。
延迟时间是用户体验的关键。想了之后机器立刻响应,人才会觉得它是自己身体的一部分。如果想了之后过1秒光标才动,我们就无法把这个工具当成自己的肢体。研究表明,从产生意念到机器响应的延迟必须控制在100到200毫秒以内,用户才能感受到「这是我做的」这种主体感。这就要求读取脑信号、无线传输、外部计算机解读并下达指令的整个链条都极其迅速。近来已有研究引入边缘计算,让植入芯片本身完成初步的数据压缩或尖峰检测,以缩短传输延迟。
测量方式不同,这些条件的结构性上限也不同。非侵入式EEG和fNIRS安全且易于使用,但信噪比低,难以实现高速高精度控制。ECoG虽有手术负担,但信号质量好,有利于高性能解码。完全侵入式微电极阵列有获取最高质量信号的潜力,但前面讨论过的长期稳定性和生物相容性问题拖了后腿。
「可用BCI」的标准在临床和消费市场上有不同的定义。对重度瘫痪患者来说,哪怕慢一些、不太方便,关键在于能否自主表达意愿。而消费级BCI中,
速度和准确率之外,佩戴舒适度、电池续航、外观设计等用户体验因素反而成为更重要的采用标准。说到底,「可用BCI」意味着一种快到让用户忘记自己在操控机器、准到仿佛它能读懂心思的界面。但目前的技术尚未达到这一水平。
四、深度学习解码:机器学习如何解读脑电波
2016年,Meta(当时叫Facebook)的研究团队启动了一个雄心勃勃的项目:目标是每分钟100个单词的脑-文字接口。不动手指,光靠想就能写字。问题在于,从大脑采集到的电信号本身看起来就像毫无意义的噪音,全是嘶嘶作响的波形。怎么从中读出「你好」的意图?答案在人工智能。
脑信号解码的核心是模式识别。找出用户怀有特定意图时大脑呈现的信号模式,当新信号进来时判断它对应哪种意图。过去靠人工制定规则。比如定义「8到12赫兹之间的alpha波减弱就代表运动意图」,只提取这一特征送入分类器。线性判别分析、支持向量机等传统机器学习方法就是这样使用的。
这种方式的局限很明显。脑信号极其复杂,人为定义的简单特征无法涵盖大量信息。每个人的大脑结构和信号模式各不相同,同一个人在不同状态下信号也会变化。深度学习革新了这一过程。核心思想是:不再由人来挑选特征,而是让模型直接从数据中学习。
卷积神经网络(CNN)原本在图像处理中表现突出,后来也被应用于脑电数据。把EEG信号看作时间和通道(电极位置)的二维数据,让模型自行学习空间和时间维度上的复杂模式。它能发现人类未曾教过的细微神经放电规律。2018年发表的EEGNet是一种专为EEG信号处理优化的小型卷积神经网络架构,以少量数据就能达到较高分类准确率,成为该领域的代表性模型。
循环神经网络(RNN)和长短期记忆网络(LSTM)擅长处理随时间推移的数据。「刚才出现了这样的信号,所以现在这个信号大概是那个意思」,这种捕捉上下文关系的能力正是它们的强项。在解读伸手动作的轨迹、说话过程等前一状态影响当前状态的连续信号时,这类模型得到了广泛应用。
近年来最受关注的是Transformer架构。作为ChatGPT等大语言模型核心技术的Transformer,正被引入BCI领域。Transformer的注意力机制会对数据各部分赋予不同权重,从而把握整体上下文。它把脑信号当作一种语言来处理:将脑电信号像词语一样切分后输入Transformer,模型便能根据前后脑电的上下文,判断该脑电模式对应何种意图。
2024年发表的多项研究显示,基于Transformer的解码器大幅超越了此前的方法。一项研究中,卷积Transformer网络在运动想象分类任务上,被试内评估达到82.52%的准确率,跨被试评估达到58.64%。在内隐语言识别研究中,
频谱-时间Transformer的准确率明显高于传统EEGNet方法。原因在于Transformer能够同时学习长程时间依赖性和频率依赖性。
在侵入式BCI中,深度学习的效果更为显著。ECoG和微电极阵列获取的信号远比EEG清晰。信号质量越高,深度学习的表现越强,因为模型可以更直接地学习到与意图相关的有效模式。近年来已有研究将高密度ECoG与深度学习结合,目标是实现每分钟数十个单词的高速沟通。解码器的发展方向也不再局限于分类,而是融合语言模型、序列解码和纠错机制。
最前沿的趋势是基础模型(Foundation Model)。其思路是用数万人的脑电数据预先训练一个大规模脑电专用AI。就像一个已经学会英语的人能很快掌握新的医学术语一样,这种大模型在遇到新用户时,只需极少量数据就能迅速理解其脑信号。这就是迁移学习。它有望从根本上缩短BCI长期存在的训练时间问题,成为推动大众化的关键。
不过深度学习也面临挑战。头一个是黑箱问题:很难解释深度学习模型为何做出某个判断。在医疗领域,判断依据是否可解释至关重要。目前已有研究尝试将可解释AI技术应用于脑电解码,分析模型究竟关注了哪些时间段、哪些通道、哪些频率特征。
还有跨会话漂移问题。昨天的大脑和今天的大脑并不相同。EEG电极的位置和阻抗会变化,侵入式电极则因长期生物反应导致信号分布改变。模型昨天学到的模式,今天可能失效。个体差异同样棘手:每个人的颅骨厚度、皮层结构、生理噪声都不一样。通用模型是理想,但通常仍需经过个性化适配。
深度学习不会一劳永逸地解决BCI的所有问题。但信号越好、数据越多、运行越精细,它就越能大幅提升性能,扮演放大器的角色。硬件提供更优质的信号,软件更准确地解读信号,形成良性循环。归根结底,深度学习是一位翻译者,将混杂着噪声的电信号转化为意义和沟通。它站在大脑与机器之间,为双方互译彼此的语言。


