[AI书房] 第1章 什么是脑机接口?
读脑者:Neuralink与人类最后的革命
第1章 什么是脑机接口?
金京镇
第一部 大脑与机器的对话
一、1.5公斤的宇宙:神经元、突触与电脉冲的电信号语言
1889年,西班牙马德里的一间实验室里,一位名叫圣地亚哥·拉蒙-卡哈尔的年轻解剖学家坐在显微镜前。他面前摆着一片切成薄片的脑组织标本。当时的科学家普遍认为,大脑是一整块如渔网般相连的组织。
卡哈尔不这么看。他在显微镜前埋头数月,发现了一个惊人的事实:大脑并非一个整体。
无数独立的细胞彼此接触,互相传递信号。他亲手将这些细胞画了下来,,像树枝一样伸展的树突,像长尾巴一样延伸的轴突。卡哈尔凭直觉意识到,这些微小的细胞正是人类一切思想、情感和记忆的源头。
他的这一发现后来被称为「神经元学说」,成为脑科学的起点。
人的大脑重量大约在1.3公斤到1.5公斤之间。质地像豆腐一样柔软,呈灰粉色。这一小团组织里,大约藏着860亿个神经细胞,也就是神经元。光看数字可能没什么概念。我们银河系中恒星的
数量估计在1000亿到4000亿之间。换句话说,你脑子里塞满了和银河系恒星数量相当的细胞。
每一个神经元都有复杂的结构。以细胞体为中心,伸出像树枝一样的树突。树突的作用像天线,负责接收来自其他神经元的信号。从细胞体延伸出去的是轴突。轴突有时能延伸一米以上。沿脊髓向下、将信号传递到脚趾肌肉的运动神经元就是这种情况。轴突末端有突触终端,负责把信号传递给下一个神经元。
突触。这才是大脑真正的秘密。突触是神经元与神经元相遇的接合点。但神经元之间并不直接接触。它们之间有一条不到50纳米的极微小缝隙,大概是头发丝直径的万分之一。神经元通过这条窄缝释放化学物质,把信息传递给下一个神经元。这些化学物质叫做神经递质。谷氨酸、多巴胺、血清素,,这些名字你可能听过。人脑中大约有100万亿个突触。860亿个神经元,每一个都通过数千个突触与其他神经元握手相连。
那么,神经元是怎样产生信号的?这里就要说到「脉冲」的概念了。神经元细胞膜内外存在电压差。平时,细胞内部比外部低大约70毫伏。这叫静息膜电位。当一个神经元从其他神经元那里接收到足够的刺激时,细胞膜上的离子通道就会打开。钠离子涌入细胞内
部。电压在瞬间翻转,从负电荷变为正电荷。这种剧烈的电压变化沿着轴突像波浪一样传播开来。这就是动作电位,也叫脉冲。
一次脉冲发生在1到2毫秒之间,非常短暂。但大脑的全部信息都承载在这短暂的电脉冲里。你正在阅读这些文字这件事,昨晚吃的那顿饭的味道,对明天待办事项的担忧,,所有这一切,都是数百万、数千万个神经元同时放电所激起的电风暴的产物。
脑科学家说,神经元的语言由两种编码构成。一种是放电频率编码。神经元发射脉冲的频率不同,携带的信息就不同。轻轻按压手掌和用力按压时,感觉神经元的放电频率是不一样的。另一种是时间编码。多个神经元何时同步放电、以什么模式放电,这本身就承载着信息。闻气味时,嗅球的神经元会以特定的时间模式放电,正是这种模式让我们区分玫瑰和茉莉。
这里有一个悖论。单个神经元的放电速度很慢,每秒最多不过几百次。而现代计算机的处理器每秒能执行数十亿次运算。单比速度,大脑根本不是计算机的对手。可大脑却能轻松完成计算机束手无策的事情,,读懂微妙的情绪,在从未遇到过的情境中即兴应对。
秘诀在于并行处理。860亿个神经元同时运作。每一个都很慢,但所有神经元一起计算,就能完成惊人的任务。而且只消耗大约20瓦的电力,比点亮一支日光灯管还少。
BCI技术要做的,正是读懂这种电信号语言。大脑发给身体的指令,大脑从感觉器官接收到的信息,大脑内部思维的流动,,一切都用脉冲的语言写成。科学家正在编纂这门语言的词典。目前还处于初级阶段,就像刚到一个陌生国家的旅人,只能听懂几个单词。但词典的页数正在快速增加。
二、BCI的定义与核心工作原理
2006年7月,美国马萨诸塞州一家医院里,一个名叫马修·内格尔的25岁年轻人坐在电脑屏幕前。四年前,他在一次暴力袭击中脊髓受损,颈部以下完全无法活动。但那一天,他移动了屏幕上的光标,打开了一封电子邮件。手指一根都没动。全凭意念。
内格尔的大脑中植入了96根微电极。那是一种叫做犹他阵列的装置,看起来像火柴头上扎着的细刺。这些电极探测他运动皮层产生的脉冲信号,将其传送到计算机。计算机分析信号后,把它转化为「光标向左移动」「点击」这样的指令。这就是脑机接口(BCI)的核心。
BCI的定义其实比想象中简单:测量大脑的活动,并将其实时转化为有意义的输出的系统。BCI学会是这样定义的:「绕过大脑的自然输出通路,即不经过外周神经和肌肉,在大脑与外部设备之间建立直接通信通道的技术。」
为什么「绕过」这么重要?健康人的大脑发出指令后,信号沿脊髓下行,通过神经传递到肌肉。这是自然通路。但如果脊髓损伤,或者像渐冻症那样运动神经退化,这条通路就断了。大脑仍然在发出「动手」的指令,指令却到不了目的地。BCI就是替代那座断掉的桥。它在中途截获大脑的指令,直接传递给计算机或机械臂。
BCI系统的工作原理可以分为五个步骤。
第一步是信号采集。用传感器捕捉大脑产生的电信号。传感器可以贴在头皮上,可以打开颅骨放在大脑表面,也可以直接插入脑组织内部。传感器位置越深,信号越清晰,但风险也越大。这一点后面会详细讨论。
第二步是预处理。大脑发出的原始信号充满噪声,,眨眼时产生的肌电信号、周围电子设备的电磁干扰、心跳的影响。这些噪声必须过滤掉。就像在嘈杂的街头,只挑出朋友说话的声音一样。
第三步是特征提取。从过滤后的信号中寻找有意义的模式。当你试图移动右手时,大脑左侧运动皮层会出现特定频段信号的减弱,这叫做事件相关去同步化。特征提取这一步,就是用数学方法定义并提取这类模式。
第四步是解码,或者说转换。把提取出的特征转化为实际指令。「出现这种脑电模式时,就把光标向右移动。」算法学习并执行这类规则。过去用的是简单的线性模型,近年来则由基于深度学习的复杂人工智能来承担这个角色。2025年发表的研究显示,基于Transformer的模型在运动想象任务中达到了超过86%的准确率。
第五步是输出与反馈。解码后的指令变成实际动作:屏幕上的光标移动了,机械臂抓起了物体,轮椅转了方向,语音合成器开口说话了。使用者用眼睛确认结果,这就是反馈。反馈不只是展示结果那么简单,它是使用者大脑进行学习所必需的信息。
这里出现了一个重要概念:共适应。在BCI系统中,不只是机器在学习,使用者的大脑也在学习。一开始,把光标移到想要的方向很困难。但通过反复尝试和反馈,大脑会逐渐产生越来越清晰的信号。与此同时,算法也在根据该使用者的脑信号模式进行调整。人与机器相互适应,性能随之提升。
BCI大致可以朝两个方向工作。读取型BCI读取大脑信号并向外传送。瘫痪患者用意念操控电脑就属于这一类。写入型BCI则相反,把外部信息输入大脑。人工耳蜗是典型的例子。它把声音转换成电信号
传递给听觉神经。为视觉障碍者将摄像头画面直接传输到视觉皮层的研究也在进行中。
截至2025年,BCI技术已经走出实验室,开始应用于真正的患者。Neuralink已为5名重度瘫痪患者植入了芯片。Synchron采用不开颅、通过血管插入电极的方式,让患者能够操作iPad。哥伦比亚大学研究团队开发出拥有65,536个电极的超微型芯片,成功实现了脑信号的实时传输。BCI不再是科幻小说。此时此刻,就有人正在用意念打字。
三、侵入式、半侵入式与非侵入式BCI的分类与比较
1998年,一位名叫菲利普·肯尼迪的神经科学家陷入了绝境。他花了二十多年研究如何用脑信号解码语言。但美国监管部门叫停了他的人体实验。没有受试者了。于是他做了一个决定。
他要把电极植入自己的大脑。美国没有任何医院愿意做这台手术。他找到了南美洲的一家医院。经过十一个半小时的手术,电极被植入了他的大脑。术后并发症一度让他丧失了语言能力,但他坚持继续研究。
当他在口中无声地默念单词时,植入大脑的电极记录下了运动皮层65个神经元发出的信号。信号模式与实际说话时一致。这就是仅凭意念即可解码语言的证据。
肯尼迪的故事揭示了BCI研究的核心两难:要多靠近大脑?越靠近,信号越清晰,但风险也越大。
BCI按传感器的放置位置分为三类。
非侵入式BCI在头皮表面测量信号。戴上一个像泳帽一样的装置就行了。不需要手术,没有感染风险,费用也相对便宜。脑电图(EEG)是最典型的代表。大脑的电活动穿过颅骨和皮肤后会减弱、扩散,但仍然携带着一定的信息。非侵入式的优势在于易用性,,任何人都能使用。可以在玩游戏时测量注意力,可以在冥想时监测大脑状态,也可以用来防止疲劳驾驶。Emotiv和Neurable等公司已经在销售消费级EEG头戴设备。
但局限性也很明显。颅骨是5到10毫米厚的坚硬骨头。脑信号穿过这层骨头后严重衰减,高频成分几乎消失殆尽。空间分辨率也很低,必须数千个神经元同时活动才能在头皮上被探测到。读取单个神经元的信号根本不可能。打个比方,就像在足球场外面的停车场听观众的欢呼声,,你知道场内发生了什么事,但听不清谁说了什么。
侵入式BCI处于光谱的另一端。打开颅骨,将电极直接插入脑组织。Neuralink的Telepathy芯片就属于这一类。比头发丝还细的电极线穿入运动皮层内部,1,024个微电极直接探测单个神经元的脉冲信号。
侵入式的优势在于信号质量。它能读取单个神经元级别的活动,时间分辨率和空间分辨率都是最高水平。只有达到这种精度,才能控制复杂动作,,用机械臂拿起杯子喝水,或者以每分钟60个单词以上的速度打字,都需要侵入式BCI。
代价是开颅手术。有感染的风险,可能出血。长期来看还有另一个问题:人体的免疫系统会攻击异物。电极周围会形成瘢痕组织,神经胶质细胞开始包裹电极。随着时间推移,信号会变弱。Neuralink第一位受试者体内出现部分电极从脑组织中脱出的现象,根源就在这里。
两者之间是半侵入式BCI。它进入颅骨内部,但不刺穿脑组织。皮层脑电图(ECoG)是典型代表,,将电极铺设在大脑表面。这项技术长期用于定位癫痫患者的发作源。
Synchron的Stentrode采用了更独特的方式。就像植入心脏支架一样,通过颈部静脉将网状电极推送到脑血管内。不直接刺入大脑,不做开颅手术,甚至可以当天出院。电极通过血管壁感知大脑表面的信号。
半侵入式是一种折中方案。信号比非侵入式清晰,风险比侵入式低。但精确控制程度不及侵入式。Synchron的患者可以操作iPad、发送短信,却很难像Neuralink患者那样高速进行复杂的游戏操作。
哪种方式才是正确答案?这取决于目的。如果只是想提升专注力或辅助冥想,非侵入式就够了。全身瘫痪的患者要自如地控制机械臂,就需要侵入式。对手术心存顾虑、但希望实现基本沟通的患者,半侵入式可能是不错的选择。
2025年12月,哥伦比亚大学研究团队打开了新的可能。这款名为BISC的装置是一枚拥有65,536个电极的超微型芯片,体积仅为现有植入物的千分之一,能够顺应脑表面的曲率弯曲。它同时追求侵入式的性能和半侵入式的安全性。BCI技术并没有向单一路径收敛,而是沿着多条路线同步演化。
四、为什么是现在:AI与Transformer模型如何革新了脑电波解码
2017年6月,Google研究团队发表了一篇论文,题为「Attention Is All You Need」。只需要注意力就够了。这八位研究者为自然语言处理提出了一种全新的人工智能架构,被称为Transformer。它后来成为GPT、BERT以及ChatGPT的基础。可是,语言模型和脑电波解码有什么关系?
脑信号与语言在结构上高度相似。两者都是沿时间轴展开的连续数据。句子中前面的词决定后面词的含义,脑信号中先出现的模式同样影响后续模式的解读。语言有语法,脑信号也有规则。计划运动时、执行运动时、接收反馈时,大脑活动的模式按顺序依次变化。
过去的BCI依赖手工操作。研究人员亲自定义脑电波的特征,再设计提取这些特征的算法。「8赫兹到12赫兹之间的α波功率下降,就判定为运动想象。」这类规则全靠人来制定。问题在于,脑信号太复杂、太善变。同一个人想象同一个动作,每次产生的信号都不一样。疲劳、情绪、专注度都会改变模式。每个人的脑结构不同,适用于一个人的规则到了另一个人身上就失灵。这被称为「BCI文盲现象」,指某些用户无论怎么练习都无法正常使用BCI。
深度学习改变了局面。2010年代中期开始,卷积神经网络和循环神经网络被引入脑电波分析。这些人工智能不依赖人为定义的规则,直接从原始数据中学习模式。性能提升了,但瓶颈仍在。循环神经网络处理长序列时力不从心,卷积神经网络擅长捕捉局部模式,却难以把握相距较远的信息之间的关联。
Transformer的核心是「自注意力」机制。输入数据的每一部分都能与其他所有部分直接关联。就像句子中很靠前的词可以决定很靠后的词的含义一样,脑信号中一秒前的模式也可能影响当前模式的解读。Transformer在捕捉这种长距离依赖关系方面表现出色。
2024年和2025年发表的研究把这种可能变成了现实。在运动想象任务中,基于Transformer的模型达到了86%以上的分类准确率,超过了EEGNet等既有模型。语言恢复领域同样取得了跨越式进展。一项利用ECoG解码瘫痪患者脑信号中词语的研究表明,Transformer模型以每分钟62个词以上的速度生成文本,已接近日常对话的语速。更值得关注的是「基础模型」的出现。正如ChatGPT通过学习互联网上的海量文本掌握了语言结构,用大规模脑电波数据训练的通用模型也在诞生。EEGPT、LaBraM、BIOT,这些就是它们的名字。这些模型从数千小时的脑电波数据中学习「脑信号的语法」,然后针对具体任务进行微调。优势在于数据效率:适应新用户或新任务所需的数据量减少了,个性化校准时间也随之缩短。
算力的进步同样不可忽视。Transformer是计算量很大的模型,训练数百万参数需要高性能GPU。2010年代初期,这样的计算根本做不到。如今,云计算和专用AI芯片的发展使得实验室级别也能训练大规模模型。硬件为软件的进步提供了支撑。
与生成式AI的结合也打开了新空间。从脑信号中解码出的文本,由大语言模型进行润色。混入噪声、解码不完整的句子,被根据上下文加以修正。即使只清晰读取到「I want to eat a...」而后面模糊不清,语言模型也能计算出「apple」或「sandwich」出现的概率,填补空白。再与语音合成AI结合,就能用患者本人的声音说话。系统学习过去录制的语音数据,重现自然的语调。
为什么是现在?答案是两场革命的交汇。更清晰地读取脑信号的硬件进步,与更准确地解读信号的软件进步同时发生了。电极更小了,数量更多了。算法更聪明了,速度更快了。两项技术在互相拉升。硬件提供更多数据,算法就更精准;算法更精准,又能弥补硬件的不足。Neuralink首位患者的电极脱出时,团队没有更换硬件,而是修改算法恢复了性能。这就是一个好例子。
我们正站在解码大脑语言的起点。眼下只能勉强辨认几个词、几句话。但这本词典正在飞速变厚。终有一天,大脑和机器会用同一种语言对话。那一天何时到来,没人知道。但此刻,我们正朝着那个方向走着,这一点毫无疑问。













