H10 · Dynamic tracking of objects in the macaque dorsomedial frontal cortex
Rishi Rajalingham, Hansem Sohn & Mehrdad Jazayeri (2025) Nature Communications, 16, 346. doi:10.1038/s41467-024-54688-y
H07 的神经版续集:同一批"预注册"的 RNN 摆上牌桌,这次赌注不是行为指纹,而是猕猴 DMFC 群体动力学的几何。结果干净利落——被约束为显式追踪球位置的网络,其状态空间的成对距离结构与 DMFC 最为相似,顺带还挖出一个 RNN 都不具备的"快速离线预测"信号。mental simulation 从行为假说正式升格为神经动力学命题。
核对版本:Zotero motor_control_interception_64 集合本地全文(PDF 全文提取,图注与正文互相校订,2026-09-18;图注所标页码均为 PDF 文件页序,非期刊印刷页码);Zotero 条目。
背景
"大脑为物理世界建模,并靠运行这个模型做推断"——mental simulation 假说的行为证据不可谓不多:人类的物理判断与带噪声的随机模拟(物理引擎式程序)高度吻合。但争论同样古老:model-free 的启发式映射同样能解释不少行为,近期实验甚至显示人类在部分物理任务里依赖高效但僵硬的感觉运动映射。行为读数维度太低,裁决不了"大脑是否逐时刻递归更新物体的内部状态"这个定义性特征。
神经层面,证据一直停在两处短板上。fMRI 有分辨率天花板,最多把"心理模拟"归因到某些脑区的活动升高;动物电生理虽有单神经元级别的零散发现——FEF、PPC、MST、腹侧前运动皮层里对不可见运动方向、速度敏感的神经元——但单神经元敏感性只能充当心理追踪的"原料清单",无法回答群体活动是否直接对应物体的逐时刻状态。更棘手的是,以往范式多需上万次重复的过度训练、且严格控制眼手运动,这可能逼出与自然推断完全不同的策略。
H07 已经搭好了舞台:M-Pong 任务里,猴子快速学会、即刻泛化、误差模式与人几乎相同(猴-人一致性 0.89);数百个 RNN 中,唯有被约束为动态追踪球位置的网络在行为上最像灵长类。剩下的致命一问只能靠电极回答:大脑自己的群体动力学,究竟像哪一类网络?作者选择了背内侧额叶皮层(DMFC)——这个以时间计算与动态感觉运动加工著称的区域(Sohn、Wang、Remington 等的系列工作都在此),并用 H07 那批在神经数据采集之前就已公开的 RNN 做"预注册"对照,从机制上规避了事后拟合的循环论证。
研究思路
设计遵循两条原则。第一,任务要"天然":沿用 M-Pong,猴子自由动眼、自由操作摇杆,参数跨 trial 大幅变化(初始位置、速度、方向、反弹与否),杜绝固定输入输出映射的解题空间;从 H07 的 200 个条件中抽取 79 个(含 26 个反弹条件)做电生理。第二,检验要"两面":既看单神经元如何 multiplex 球、眼、手变量,又看群体潜变量动力学是否携带一个跨条件、跨时间、跨可见/遮挡两期稳定的球位置线性读出——后者是 mental simulation 的最强形式(linearly decodable state),弱形式(解码权重随时间/时期重配的 nonlinearly decodable state)则作为备选。
分析的因果链环环相扣。先以 GLM 加 variance partitioning(commonality analysis)把球相关信息从眼、手协变量中剥离——因为动物在看球、在动手,任何"球信号"都可能只是运动信号的影子。再用 factor analysis 降维,以单个固定线性解码器读出时变球位置,检验跨反弹条件与跨时期的泛化,并用偏相关控制眼手运动学。最后进入判决环节:四类 RNN(RNNIntercept、RNNVis、RNNVis&Occ、RNNVis+Occ,约束依次增强)与 DMFC 的比较。相似度度量叫 neural consistency score——对"所有到访状态的成对距离矩阵"做噪声校正相关,比较的是状态空间的几何骨架而非逐点活动;与 H07 的 ISDP 一脉相承,这里升级为 simulation index(SI),对全部网络统一度量遮挡期球位置的可线性读出程度。
方法
两只猕猴(P 雌、M 雄)头固定操作 M-Pong:注视中央 200 ms 启动 trial,自由观看;300 ms 静息帧后球以随机初速出发,可见期与遮挡期各持续 624.9–1874.7 ms,球至多反弹一次;挡板初为透明小方块,首次操作后展开,恒速 0.01 deg/ms;trial 末遮挡板消失给出反馈,命中给果汁。眼动 1 ms 采样(Eyelink 1000),摇杆电压三态控制。
记录靶区为弓状沟 genu 前方、弓状沟上肢内侧的左半球皮层(保守地统称 DMFC,可能含 SEF、SMA、pre-SMA);猴 P 用 64 通道 Plexon V-probe 在 8×3 mm 网格 24 个位点各记 2 个 session,猴 M 用 Neuropixels 在 8×1 mm 网格 6 个位点各记 1 个 session——不按任务调制有无挑选位点,系统性采样。KiloSort 3.0 全自动排序,split-half 可靠性筛选后共 1889 个神经元(P 1552、M 337)。按 79 条件×时长构建 trial 平均的伪群体矩阵,50 ms 分箱、不做时间平滑,缺失条件以均值补缺(补缺数据点不足 1%)。
编码分析对每个神经元拟合 GLM:6 个球变量(位置与速度的直角/极坐标形式)、6 个眼变量、2 个手变量(挡板位置、摇杆电压)加反弹指示变量;时间抖动 ±300 ms 取最优,10 折交叉验证;以嵌套模型做方差分解,剥出各变量的 unique 与 common 方差。解码用静态线性读出:把条件×时间维展平后训练回归,条件间分组切分训练/测试;以偏相关控制眼手运动学与 trial 时间。RNN-DMFC 比较以遮挡期到访状态的成对距离矩阵为对象,做与 H07 相同的噪声校正相关(全 trial 结果类似)。
主要结果
行为层面是 H07 结论的重申与延伸:引入遮挡首日即达标、新条件首 trial 即泛化;眼-球追踪误差随 trial 推进缩小并在遮挡期保持低位( gaze 逼近内部估计的球位),挡板则以滞后的时间历程凑向拦截点——先眼看、后手动,且 gaze 并非连续追踪,仍有零星扫视瞄向挡板等处。
单神经元层面,DMFC 的答卷是"multiplex 但以球为主"。神经元对 trial 起始、遮挡开始等显著事件给出瞬态响应,或呈现持续的时间调制;空间上对水平位置(与经过时间强相关)的选择性强于竖直位置。GLM 拟合良好,而方差分解给出关键数字:球变量的 unique 方差在可见期与遮挡期都是所有变量类中最高的(分别为 p<10^-10 与 p<10^-54,与次高变量相比)——即使扣除眼、手的共变,DMFC 仍携带强而私有的球位置与速度信息。
群体层面是全文的支柱。factor analysis 显示 DMFC 动力学低维;潜变量上训练的单一固定线性解码器,能以 r=0.97(球 x)与 r=0.83(球 y)的精度读出瞬时球位置(p<10^-100),跨有无反弹条件泛化,且在可见期与遮挡期之间、整段 trial 之内读出精度无显著差异——这正是"linearly decodable state"的强形式:存在一组跨条件、跨时间稳定的活动模式持续对应球的物理状态,无论球看得见看不见。偏相关控制眼、手运动学与 trial 时间后,球位置解码仍显著(r>0.6)。坐标系的补充检验显示自我中心与他我中心框架各有贡献、他我中心在遮挡期略占优,DMFC 对两者兼收并蓄。
判决环节的三段论干净利落。其一,按类比较:RNNVis&Occ 与 RNNVis+Occ(被约束在遮挡期也显式编码球位置的两类)的 neural consistency score 显著高于 RNNVis 与 RNNIntercept(p<10^-10)。其二,统一度量:SI 与一致性在全部网络间强相关(R²=0.52,p<10^-32),且各类内部同样成立(R²=0.31–0.65)——DMFC 动力学最像那些遮挡期带线性可读球位置的网络。其三,排除成绩中介:成绩更好的 RNNIntercept/RNNVis 反而离动物行为成绩更近(表 1 中动物 MAE 为 1.02/0.84°,RNNIntercept 1.72、RNNVis 1.88,而 RNNVis&Occ 2.25、RNNVis+Occ 2.02),一致性也与成绩只有中等相关(R²=0.24);偏 R² 分解中 SI 独占 0.48 [0.42, 0.56],成绩只剩 0.19 [0.11, 0.28]。DMFC 像的不是"打得好的网络",而是"心里有球的网络"。尤其要强调:这批 RNN 在神经数据采集前即已定型并发表——模型比较是预注册的。
然后是意外之喜。作者检查"快速离线预测"策略(用早期视觉线索一步算出终点)时发现:trial 开始仅约 250 ms 后(球尚在可见期起点附近),DMFC 群体活动就能稳定读出球的最终拦截点,且该读出持续整个 trial;而四类 RNN 全都只能给出逐步爬升的终点预测——没有一个网络具备这种快速而持续的终点表征。行为相关性佐证其功能意义:早期 DMFC 终点估计的误差与动物的行为误差跨条件相关(自约 250 ms 起显著),且对"遮挡开始时刻的球位置"没有这种相关,说明特异性指向终点预测。但作者同样谨慎:两阶段解码显示"位置+速度"中介的间接路径已能解释大部分快速读出(位置单变量不行),与直接解码仍存在小差值——快速预测的强解释需要因果实验背书,本文只把它作为 DMFC 与现有 RNN 之间的明确缺口。
逐图解读
原文 Fig. 1 · PDF 第 3 页
图 1 · 任务与行为 A 图 M-Pong 一图流:摇杆控挡板、球先可见后遮挡、自由眼动。B 图泛化测试(改编自 H07):遮挡首日即达标,新条件(实心圆)与暴露条件成绩相当。C 图三个示例条件的眼位(时间着色的圆点)与挡板轨迹(品红):眼-球误差连线越来越短,遮挡期保持低位;挡板则滞后地凑向拦截点。眼先于手、眼追随"心中的球"——行为层面已经为 mental simulation 埋下伏笔。
原文 Fig. 2 · PDF 第 4 页
图 2 · 单神经元:multiplex 而以球为重 A/B 图记录位点与 79 条件的球轨迹(按终点 y 着色)。C 图四个示例神经元:瞬态事件响应与持续时间调制并存,空间调谐弱而时间调制强——DMFC 的经典气质。D/E 图 GLM 编码模型(球、眼、手变量)拟合良好。F 图方差分解的 Venn 图与结果:球变量的 unique 方差在可见、遮挡两期均为各类之最(p<10^-10 / p<10^-54)——把眼、手的共变剥干净之后,球信号依然独立在场。
原文 Fig. 3 · PDF 第 5 页
图 3 · 群体动力学的核心证据 A 图 1889 个神经元浓缩为 10 个 factor,携带丰富的时空球信息。B 图 scree plot 确认低维。C/D 图判决性演示:潜变量上的单一固定线性解码器读出时变球位置,x 方向 r=0.97、y 方向 r=0.83。E/F 图读出精度跨可见/遮挡两期、跨整段 trial 稳定(两期无显著差异)——这就是 linearly decodable state。G/H 图眼手运动学与 trial 时间同样可解码,但偏相关控制后球位置读出依然坚挺(r>0.6)。看不见的球,在 DMFC 的状态空间里一直被牵着走。
原文 Fig. 4 · PDF 第 6 页
图 4 · 预注册 RNN 的对局 A 图四类网络的约束层级与解空间:从 RNNIntercept(只要拦截)到 RNNVis&Occ(全程同子空间追踪球),约束逐级收紧。B 图行为层面的旧战果(H07):追踪遮挡期球位置的网络行为最像灵长类。C/D 图本篇的新战场——neural consistency score(状态成对距离矩阵的噪声校正相关):Vis&Occ 与 +Occ 两类显著胜出(p<10^-10)。E/F/G 图三段论收尾:SI 与一致性强相关(R²=0.52),成绩只解释 R²=0.24,偏 R² 中 SI 以 0.48 对 0.19 完胜。DMFC 的动力学骨架,长得最像"必须心里有球"的网络。
原文 Fig. 5 · PDF 第 8 页
图 5 · 快速离线预测:DMFC 对 RNN 的领先与缺口 A 图概念对照:自上而下的"快速离线预测"(早期活动直读终点)对阵自下而上的"在线模拟"(逐时刻表征)。B 图终点解码的时间过程:DMFC(绿)自约 250 ms 起即快速且持续地读出终点,所有 RNN 都只能缓慢爬升——脑有而模型无的能力。C 图该早期估计的误差与动物行为误差跨条件相关(t=400 ms 的散点可见明显斜率),且对遮挡点位置无此相关。这项能力是本篇留给建模界的作业单。
讨论
这篇论文把 mental simulation 假说的检验推到了它真正的决赛场地:神经群体动力学。结论的分量来自三层克制的设计——自然任务(无需过度训练、自由眼手,杜绝策略伪造)、预注册模型(RNN 先于神经数据定型,杜绝事后拟合)、几何比较(成对距离矩阵度量状态空间骨架,而非逐点活动)。DMFC 携带跨条件、跨时期稳定的球位置线性读出,且其动力学最像被约束为模拟的网络——用作者的话说,这为"额叶神经动力学与外部环境状态的内部模拟相一致"提供了证据。
低维性本身也是一条机制线索:它暗示 DMFC 在任务中的有效连接是低秩的,或其活动由低维输入主导。作者据此抛出环路假说——其他额叶或顶叶区域提供球的感官输入,为 DMFC 在遮挡期展开的群体动力学设定初始条件;而 DMFC 与 H06 的 PPC 预测信号、H08 的 M1 感觉调制几何如何分工组网,是"拦截的神经生理学"主线接下来的大题。快速离线预测的发现则提示大脑可能同时运行两个时间尺度:快速前馈的终点估计加在线递归的逐时刻模拟——这一双机制图景恰好能调和"模拟派"与"启发式派"多年的行为之争,也与 G08 强调的"持续更新预测"的拦截时间精度相合。
当然,解码相关永远不能自证因果:DMFC 的球信号是否真被动物使用、快速预测是否为真实的计算过程,都待干预实验(因果扰动、遮挡期眼动控制)落锤;DMFC 是一个保守的解剖统称,SEF/SMA/pre-SMA 的内部分工未决。但作为方法论的示范——行为筛模型、模型预注册、几何对几何——这篇文章与 H07 一起,为认知神经科学处理"不可直接观察的内部计算"立了一套新的规矩。
一句话总结:在自然化的 M-Pong 任务中,猕猴 DMFC 的 1889 个神经元的群体动力学携带跨条件、跨时间稳定的球位置线性读出(x/y 方向 r=0.97/0.83),其状态空间几何与被预注册为显式追踪球位置的 RNN 最相似(SI 解释一致性方差 R²=0.52,远超成绩的 0.24),并为 mental simulation 补上了缺失的神经证据——同时挖出一个所有 RNN 都不具备的、始于 trial 后约 250 ms 的快速终点预测信号。
思考问题
- “解码相关不能自证因果”——干预版:遮挡期用闭环刺激把 DMFC 的球位置读出 clamp 到错误值,测拦截时机是否按被 clamp 的位置偏移:偏移,DMFC 的球信号是动物真在用的模拟状态;不偏移,解码只是观察者的读出——H07 的扰动移植预言正好在这里落地,两个研究共用同一套判决逻辑。
- DMFC 是保守的解剖统称,SEF/SMA/pre-SMA 的内部分工未决:按解剖坐标分区分析球位置读出与快速终点预测两个信号的分布:两个信号分家(终点预测与模拟各有偏重的亚区),双时间尺度机制获得解剖支撑;混在同一亚区,则双机制是同一回路的两段动力学——把统称拆开,是这条线的下一道工序。