这篇研究用同一组 92 张物体图像、同一批被试同时采集脑磁图(magnetoencephalography,MEG)与功能磁共振(fMRI)数据,再用表征相似性分析(representational similarity analysis,RSA)把两类信号放到同一个表征空间里对齐,从而把人类物体识别的"何时"(MEG 毫秒级时间进程)与"何处"(fMRI 皮层定位)真正接了起来。文章刻画了从图像身份到超类类别的解码时间线、识别了瞬态与持续两类神经活动、定位了 V1 与 IT 两个源头,最后把人类 MEG 与猴 IT 单细胞数据也对接起来。这是把"时间维度"和"空间维度"拼成一张完整地图的开创性尝试,是理解腹侧视觉流加工动力学的必读文献。
研究背景
过去十年,人类物体识别的神经机制研究在跨物种、跨方法的层面互相印证:识别依赖枕叶与颞叶的层级结构,并在时间上逐步展开。但一个根本的瓶颈是,能把不同成像模态——MEG/EEG 毫秒级时间精度但空间定位模糊,fMRI 空间分辨率好但时间分辨率受血流响应限制——的定量数据有效结合起来的手段一直缺乏,"视觉物体在人脑何处、何时被加工"这个基本问题仍没有系统答案。
已有的拼图各自完好却互相对不上号:猴 IT 单细胞研究(用这同一组 92 张图)给出了稳定的类别表征结构;人类 fMRI 找到了面孔、身体等类别特异区域;MEG/EEG 研究靠 ERP 成分(如面孔的 M100 和 N170)标记加工阶段,但只能用少数几个波形标记物来推断内容信息的时间线。缺口在于缺少一个能把表征内容、皮层源头和时间进程放进同一框架的公共参照系——RSA 恰好提供了这个思路,本文是把它用于"MEG×fMRI×猴电生理"三方对接的第一批示范。
研究思路
作者的核心策略是"同一刺激、同一被试、双模态"。第一步,用多变量模式分类(multivariate pattern classification)逐时间点解码 MEG 信号,画出物体信息出现的时间线:先问单张图像何时被区分,再问三个类别层级(上位、下位、次位水平,superordinate/ordinate/subordinate)的归属何时可以判别。第二步,既然线性可分辨性与表征内容有关,就用 RSA 把各个时间点的 MEG 解码矩阵与 fMRI 测得的 V1、IT 不相似性矩阵做相关,从而推断某一时刻主导 MEG 信号的是哪个皮层源。
第三步解决"持续活动"问题:如果神经活动在时间上延续,那么在时间点 tx 训练的分类器应当能泛化到时间点 ty 的信号。作者构建了时间-时间泛化矩阵来区分瞬态与持续的表征,并再一次用 RSA 把持续活动的时相与 V1、IT 分别对应,定位活动的源头。最后一步跨越物种:对同一 92 图集,猴 IT 已有单细胞数据,把人 MEG 解码矩阵与猴 IT 表征不相似性矩阵逐时间点相关,检验表征空间是否在物种间共享。选择这个既有图集正因为它可以同时在三个类别层级上提问,并可与既往猴电生理与人类 fMRI 数据直接对比。
方法
16 名右利手健康被试(10 女,平均 25.87±5.38 岁)中 15 人完成两次 MEG 与两次 fMRI session,1 人只参加 MEG。刺激为 92 张真实物体图像(人/非人面孔与身体、自然/人造物体),中心呈现、视角约 2.9°、持续 500 ms、试次间隔 1.5–2 s;为维持注意,被试执行回形针检测任务(平均每 4 试次出现一次,回形针试次不进入分析)。MEG 用 306 通道系统(204 平面梯度计+102 磁力计)以 1 kHz 采样,提取刺激前 100 ms 至刺激后 1200 ms 信号;每条件每 session 有 20–30 个试次。fMRI 在 3T 上以 2 mm 各向同性梯度回波 EPI 采集,覆盖枕颞叶,用一般线性模型(GLM)估计每张图像的响应 t 值。
分析链条如下。MEG 多变量分析:对每个时间点,把 306 通道数据组成模式向量,用线性支持向量机(SVM)对全部图像两两分类(留一交叉验证,随机重排重复 100 次),把解码正确率(50% 为随机水平)填入 92×92 解码矩阵。fMRI 侧定义三个感兴趣区(region of interest,ROI):中心 V1(0–3° 视角,基于解剖偏心度模板)、周边 V1(3–6°,作为未受刺激的对照)、IT(双侧梭状回与下颞皮层解剖 mask,限取激活最强的 361 个体素以匹配中心 V1 的尺寸);ROI 内 92 个模式向量两两相关,取 1−R 为不相似性,构成 92×92 fMRI 不相似性矩阵。RSA:把每个时间点的 MEG 解码矩阵与 V1、IT 的 fMRI 不相似性矩阵求 Spearman 秩相关,得到两条相关时间曲线,再作差以直接比较。显著性用符号置换检验加 cluster 大小推断(50000 次置换),峰值与起始点的置信区间用 bootstrap 被试抽样给出;MDS(多维标度)用于可视化,并采用留一被试的方式避免循环分析(double dipping)。
主要结果
-
单张图像在刺激后约 50 ms 即可从 MEG 信号中判别。全图集平均解码在 48 ms(45–51)达到显著,峰值出现在 102 ms(98–107);图像集的六个子集单独看,解码在 51–61 ms 显著、峰值在 99–112 ms(图 1)。
-
类别层级的解码随层级升高而推迟。有生性(animacy)峰值 157 ms(152–302)、自然/人造峰值 122 ms(107–254)、面孔 vs 身体峰值 136 ms(131–140)、人/非人身体峰值 170 ms(104–252)、人/非人面孔呈双峰 127 与 190 ms(图 2)。bootstrap 检验显示单张图像的解码峰值显著早于各类别层级(除人/非人身体的区分外均 p<0.001);解码峰值精度还与行为层面 same-different 分类的反应时正相关(R=0.53, p=0.003)、与正确率负相关(R=−0.49, p=0.012)(补充实验)。同时各类别水平的显著起始普遍较早(48–70 ms,自然/人造为 93 ms)。补充分析还表明类别判别不是仅由低层图像属性决定的。
-
神经活动既有瞬态成分也有持续成分。时间-时间泛化矩阵显示出沿对角线的陡峭高脊(分类器只泛化到相邻时刻,即瞬态);同时可见两处持续结构:约 100 ms 训练的表征泛化到约 200–1000 ms(延续到刺激消失之后),以及约 250–500 ms 之间对角线明显加宽(图 3)。补充说明只有时间范围清楚、并延续至刺激消失后的特定结构更支持主动维持;其余广泛泛化不能排除持续感觉输入。
-
早期 MEG 信号与 V1 对应、晚期与 IT 对应。MEG 与 V1 不相似性矩阵的相关峰值在 101 ms(84–109),与 IT 的在 132 ms(129–290),峰间延迟差显著(p=0.016);两条曲线之差显示早期(约 93 ms 峰)更偏向 V1、晚期(约 284 ms 峰)更偏向 IT(图 4)。V1 相关对解剖位置敏感:只与受刺激的中心 V1 相关,与未受刺激的周边 V1(3–6°)显著更弱。
-
持续活动的源头被分别定位到 V1 与 IT。把 V1/IT 的 fMRI 矩阵与所有 (tx,ty) 组合的 MEG 解码矩阵相关:约 100 ms 与约 200–1000 ms 组合的活动与 V1 相关,约 250–500 ms 之间的活动与 IT 相关(图 5)。这直接支持"视觉系统在层级的不同水平上维持表征"的说法。
-
人类 MEG 与猴 IT 单细胞表征共享结构。对照 Kiani 等(2007)在同一 92 图集上的 674 个猴 IT 神经元数据,人类 MEG 解码矩阵与猴 IT 不相似性矩阵的相关在约 66 ms(56–71)开始显著(图注给出的起始为 54 ms,52–64,两处数字略有出入),峰值 141 ms(132–292);MDS 显示峰时刻的共享结构以人脸维度主导,且这一相关在图像集的所有子集(包括最精细的类别划分)内部都成立(图 6)。
图注解读
图 1 · 从 MEG 信号解码单张图像
原文图注:Figure 1. Decoding of images from MEG signals (a) Image set of 92 images of different categories of objects. (b) Multivariate analysis of MEG data. (c) Examples of 92 × 92 MEG decoding matrices (averaged over participants, n=16). (d) Time course of grand total decoding. was significant at 48ms (45–51ms), with a peak at 102ms (98–107ms; horizontal error bar above peak shows 95% confidence interval). (e) Time course of object decoding within subdivisions. The left panel illustrates the separately averaged sections of the MEG decoding matrix (color-coded), the right panel the corresponding decoding time courses. Peak-latencies and onsets of significance are listed in Supplementary Table 1b. Stars indicate significant time points (n=16, cluster-defining threshold p<0.001, corrected significance level p<0.05). The gray vertical line indicates onset of image presentation.
读法:a 给出 92 图集本身;b 说明逐时间点 SVM 两两分类的流程;c 是几个时刻的 92×92 解码矩阵快照,非对角线越亮表示对应两张图越可区分;d 为全矩阵平均后的总体解码时间曲线,纵轴为解码正确率(50% 之上才是信息),星号标显著时段;e 把矩阵分成六个子集(人/非人面孔与身体、自然/人造物体)分别平均,得到六条解码曲线。这张图支撑结果 1:单张图像的视觉表征最早在约 48 ms 起可以从 MEG 信号中被判别,约 100 ms 达峰。

图 2 · 三个类别层级的解码时间进程
原文图注:Figure 2. Time course of decoding category membership of individual objects. We decoded object category membership for, (a) animacy, (b) naturalness, (c) faces versus bodies, (d) human bodies versus non-human bodies and (e) human versus non-human faces. The difference of within-subdivision (dark gray, left panel) minus between-subdivision (light gray, left panel) Peaks in decoding accuracy differences indicate time points at which the ratio of dissimilarity within a subdivision to dissimilarity across subdivision is smallest. n=16, stars, vertical gray line, and error bars same as in Figure 1. Statistical details are in Supplementary……
读法:每个类别划界(a 有生性、b 自然性、c 面孔/身体、d 身体的物种、e 面孔的物种)各有两样东西:左侧把解码矩阵分成"划界之内"与"划界之间"两部分分别平均,右侧给出两者的差值时间曲线——差值峰值出现在"组内不相似性相对组间最小"的时刻,意味着大脑已把该类别界线显性地编码出来;右端还附 MDS 二维散布图,展示峰值时刻矩阵的结构。这张图支撑结果 2:单张图像早于类别层级被解码,且越细的层级(物种)峰越晚;面孔在约 127 与 190 ms 出现双峰。

图 3 · 时间-时间泛化矩阵
原文图注:Figure 3. Dynamics of visual representations across time. (a) MEG brain responses were extracted for time points tx and ty after stimulus onset. SVM was trained to distinguish between images by visual representations at time point tx, and tested on brain responses to the same images at a different time point ty. We conducted all object classifications and averaged the overall decoding accuracy. Last, the averaged decoding accuracy was stored in the element (tx,ty) of a time-time MEG decoding matrix. The process was repeated for all pairs of time points. (b,c) Time-time decoding matrix averaged across participants. The gray lines indicate onset of image presentation. The white dotted rectangle indicates classifier generalization for the time-point combination ~100ms and 200-1,000ms, the dotted ellipse indicates classifier generalization by the broadened diagonal. (d) Significance was assessed by sign-permutation tests (n=16, cluster-defining threshold p<0.0001, corrected significance level p<0.05). Dark red indicates elements within the significant cluster.
读法:矩阵的横纵轴都是刺激后时间,格子 (tx,ty) 的颜色表示"在 tx 训练的分类器在 ty 的解码正确率"的平均。沿对角线的亮脊表示表征瞬息万变(瞬态活动);白色虚线框标出 ~100 ms 训练的表征泛化到 ~200–1000 ms 的离对角块,虚线椭圆标出 ~250–500 ms 之间对角线加宽的区域——两者都是持续活动的证据。d 面板用置换检验标出显著簇。这张图支撑结果 3:物体加工中瞬态与持续活动并存,早期与晚期的表征各自保持在线。

图 4 · MEG 与 fMRI 在 V1 和 IT 上的对接
原文图注:Figure 4. Relating MEG and fMRI signals in V1 and IT. (a) We select voxels in two regions-of-interest (ROI): V1 and IT, For each condition, we extracted voxel activation values, yielding 92 pattern vectors., we calculated pairwise Pearson's correlation (R) for all combinations of experimental conditions (i,j). The dissimilarity measure 1–R was assigned to a 92 × 92 fMRI dissimilarity matrix indexed by the experimental conditions (i,j). This analysis was conducted independently for each ROI. (b) For each time point t, we correlated (Spearman's rank-order correlation) the MEG decoding matrix to the fMRI dissimilarity matrices of V1 and IT. (c) MEG signals correlated with V1 earlier than with IT. Blue and red stars indicate significant time points for V1 and IT. (d) Difference curve between the two curves as in (c). MEG correlated early more with V1 than with IT, and later more with IT than with V1. Green and red stars in the plots indicate significant time points for positive and negative clusters respectively. For details see Supplementary Table 1d. n=16, Gray line and statistical procedure same as in Fig. 1.
读法:a 演示 fMRI 侧如何从 ROI 体素活动构建 92×92 不相似性矩阵;b 说明把每个时间点的 MEG 解码矩阵与两个 fMRI 矩阵分别求 Spearman 相关;c 是两条相关时间曲线——V1 的峰(101 ms,84–109)早于 IT 的峰(132 ms,129–290),峰间延迟差显著(p=0.016);d 是两条曲线之差,早期为正(V1 占优)、晚期为负(IT 占优),显著时段由绿/红星标出。这张图支撑结果 4,是全文"空间×时间"对接的核心证据。

图 5 · 定位持续活动的皮层源头
原文图注:Figure 5. Relating MEG and fMRI signals across time. (a) 92 × 92 decoding matrices were extracted for each combination of time points (tx, ty), and were correlated (Spearman's rank-order correlation) with the fMRI dissimilarity matrices for V1 and IT. The resulting correlation was assigned to a time-time MEG-fMRI correlation matrix at tx,ty. (b,c) Top panel displays the time-time MEG and fMRI correlation matrix for V1 and IT. Bottom panel shows significant cluster results (n=16, cluster-defining threshold p<0.0001, corrected significance level p<0.05). Neural activity for the time point combinations of ~100ms and ~200–1,000ms (marked by white dotted rectangle) correlated with V1. (c) Neural activity between ~250ms and ~500ms (marked by the striped white ellipse) correlated with IT. (d) Difference between V1 and IT. Gray lines as in Figure 1.
读法:把图 3 的思路推广到模态对接:对每一对时间点 (tx,ty) 取 MEG 泛化解码矩阵,与 V1(b)或 IT(c)的 fMRI 不相似性矩阵求相关,得到两幅时间-时间相关矩阵,下排为显著簇,d 为 V1 与 IT 相关之差。关键读点在与图 3 中两个持续结构的对应关系:白色虚线框(~100 ms 与 ~200–1000 ms)的区域与 V1 相关,条纹椭圆(~250–500 ms)区域与 IT 相关。这张图支撑结果 5:瞬态旁的持续表征不是同一个源,而是 V1 与 IT 各自维持着不同层级的表征。

图 6 · 人类 MEG 与猴 IT 单细胞表征的对齐
原文图注:Figure 6. Relating human MEG and electrophysiological signals in monkey IT. (a) The MEG decoding matrix at time t was compared (Spearman's rank-order correlation R) against the monkey dissimilarity matrix in IT. The lower form of the monkey IT matrix is shown as percentiles of 1–R. (b) Representational dissimilarities in human MEG and monkey IT correlated significantly starting at 54ms (52–64ms), with a peak latency of 141ms (132–292ms). c) MDS at peak-latency. d) Results at the fine-grained level of the image set. Representational dissimilarities were similar across species and methods even for the finest categorical subdivision of the image set. n=16, stars and gray line same as in Figure 1.
读法:a 说明对照方式——每个时间点的人 MEG 解码矩阵与猴 IT(674 个神经元、71–210 ms 窗口平均放电率得来的不相似性矩阵)求 Spearman 相关;b 给出相关时间曲线,峰值约 141 ms,显著起始的数值正文(66 ms)与图注(54 ms)略有出入;c 的 MDS 峰时刻散布图显示共享结构以人脸维度主导;d 把相关分析限制在每个子集内部,证明即使在最细的类别划分上,人 MEG 与猴 IT 的表征不相似性仍然对应。这张图支撑结果 6:结果为人类与猕猴之间存在相似的物体表征几何提供了跨方法、跨物种证据。,且这种共通性可以延伸到时间域。

讨论
作者把结果组织成一个整合图景:个体图像很早(峰 102 ms)就被区分,超类与下位类别随后(122–190 ms)被显性编码;由于各类别水平的显著起始都早(48–70 ms),作者支持"所有类别层级同时开始加工、只是证据累积速率不同"的模型,而与"IT 先全局后局部"的多阶段加工观点看似冲突——不过 MEG 记录的是全脑信号,无法区分某个具体区域自身的早晚响应相位,这一点被明确承认。V1 与 IT 的对接也有着文献的一致性:V1 平均起始 50–80 ms、IT 80–200 ms,与本文 RSA 得到的时间曲线吻合。
持久活动的解释是本文最有新意的一步:作者认为约 100 ms 表征维持到数百毫秒之后、以及晚期稳定表征在线,最可能是主动控制的过程(因为时间范围明显有限,且延续超过刺激消失点),它们可能构成图像记忆的基础,只是表征格式不同——早期是低层特征,晚期是类别隶属。跨物种对接被谨慎地限定:猴 IT 矩阵来自 71–210 ms 的平均放电率,时间方差全部来自 MEG 一侧。作者最后展望:multivariate 方法之于 MEG,可能就像它当年之于 fMRI 一样改变这个领域;RSA 则把空间、时间与物种放进了一个共同框架。
一句话总结
这篇文章的方法论示范意义不亚于其结论:RSA 让 MEG 的时间轴与 fMRI 的空间轴第一次在同一组刺激上严丝合缝地对上了。我印象最深的是"持续活动各有源头"这一发现——早期视觉皮层把低层特征多维持了几百毫秒,IT 把类别表征稳定在线,两者不是同一个过程拖长的尾音。就积极的判断而言,我认为这篇笔记最值得带走的是"单图解码早于类别解码、但各类别起始都早"这个组合:结果不支持一种把各类别层级完全按起始时间依次启动的简单解释,但不足以排除IT内部或其他区域内的多阶段加工。,又不推翻层级加工,真正约束的是证据累积的方式。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[] - Fig3: 提取质量
good,对齐度full,识别面板[] - Fig4: 提取质量
good,对齐度full,识别面板[] - Fig5: 提取质量
good,对齐度full,识别面板[] - Fig6: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 审校纠偏: {'claim': '把MEG与fMRI“真正接了起来”或“严丝合缝地对上了”', 'classification': 'OVERCLAIM', 'reason': '研究建立的是表征几何之间的统计相关,而非对神经源、信息流或因果联系的直接重建。'} -> 评注:
- 审校纠偏: {'claim': 'V1与IT分别主动维持低层特征和类别表征', 'classification': 'INTERPRETATION', 'reason': '与结果相容且由作者提出,但主动控制、维持机制和具体表征内容没有被直接操纵或记录。'} -> 评注:
- 审校纠偏: {'claim': '持续活动的源头被定位到V1和IT', 'classification': 'OVERCLAIM', 'reason': '只比较了预先选择的V1和IT ROI;RSA相关不能排除其他具有相似表征结构的脑区或共同输入。'} -> 评注:
- 审校纠偏: {'claim': '结果否定简单串行模型', 'classification': 'OVERCLAIM', 'reason': '早期解码起始只约束完全按类别层级依次启动的解释,不能排除脑区内部的串行或多阶段过程。'} -> 评注:
- 审校纠偏: {'claim': '人与猴拥有共通的物体表征空间', 'classification': 'INTERPRETATION', 'reason': '更准确的事实层表述是两种数据的不相似性结构显著相关;“共通空间”是作者据此提出的概括。'} -> 评注:
- 补充要点: : 猴比较数据来自2只清醒猕猴的674个前部IT神经元;反应为刺激后71–210 ms平均放电率,因此猴侧没有时间分辨信息。 (第 页)
- 补充要点: : IT ROI的361个体素由每个参与者、每个session的前3个run中“全部刺激对基线”的独立对比选出,而92条件的模式值来自剩余run。 (第 页)
- 补充要点: : 人类IT与MEG的相关在六个刺激子集内部仍存在;使用既往独立人类IT fMRI数据也得到相近结果,峰值约158 ms。 (第 页)
- 补充要点: : 论文先在fMRI数据中复现IT的生命性表征强于V1,再开展MEG–fMRI对接。 (第 页)
- 补充要点: : MEG–fMRI分析使用跨参与者平均的fMRI不相似性矩阵与参与者特异的MEG矩阵相关;并非逐参与者一一对应后再汇总。 (第 页)