这项研究在猕猴下颞叶皮层(inferior temporal cortex, IT)单细胞记录中问了一个表示论层面的问题:物体形状空间的"神经地图"需要多少个神经维度才算忠实?答案取决于刺激的行为显著性——面孔(face)这一类行为上高显著性的刺激,在面孔选择性神经元中被压缩进一个低维地图(约 150 ms 早期出现),而同为九九结构的陌生人造物 Ziggerin 却要到更高维度、更晚(约 300 ms)才被编码。文章把"面孔神经元"的角色从"只管面孔"推进到"双工复用"(multiplexing):改为:同一群面孔选择性神经元先出现低维面孔地图,随后出现较晚的高维Ziggerin地图;作者将这种时空尺度分离解释为multiplexing。对视觉认知研究者来说,这是把经典面孔表示研究(Young & Yamane, 1992 的二维面孔空间)推进到系统维度分析的一篇。
研究背景
要理解物体识别的神经基础,关键之一是揭示形状空间的神经表示维度。已知的是:下颞叶皮层既编码简单与部分复杂形状(光栅、曲率边界等,Desimone、Tanaka、Kobatake、Brincat & Connor 等),也编码面孔、身体这类复杂类别;复杂刺激包含大量特征,忠实表示可能需要更多神经维度,而皮层加工的一个功能可能就是沿视觉层级逐级"降维"(DiCarlo & Cox, 2007)。实证上,部分复杂参数化刺激的物理相似性在 IT 神经群体反应模式中只用两个维度即被表征(Op de Beeck 等,2001;Suzuki & Tanaka, 2011;Young & Yamane, 1992 也发现面孔物理相似性被映射为二维神经空间),且有研究显示对参数化身体图像的经验与熟悉度能改善物理形状空间与其低维神经表示的匹配。另一个可能影响维度的是行为显著性(behavioral saliency):面孔这类高显著性物体也许天然就该被低维表示——腹侧通路对面孔等有生命重要物体存在特殊机制已是共识(Perrett;Kanwisher;Tsao 等)。
但作者指出一个所有上述研究共有的未决问题:增加神经空间的维度数是否会改变 IT 神经空间对视觉刺激表征地图的准确性?此前的维度比较研究都把物理空间和神经空间的维度同时降低再对齐,这隐含了对类别间差异的假设;而且面孔与非面孔物体的表示机器特性截然不同(Hanson、Kiani、Kriegeskorte 等),IT 神经维度可能取决于所用神经元亚群的类别选择性——面孔神经元或许用比其他神经元更少的维度表示面孔相似性。把这些变量拆开,就是本文的出发点。
研究思路
设计上的核心是"造一对在相似性结构上完全对等的刺激类别,再让它们在不同神经元亚群里过维度分析"。作者构造了三个自变量:(i) 神经维度的数目——对全部 90 个刺激的神经表示相异性矩阵(representational dissimilarity matrix, RDM)做系统的 d 维非经典多维降维(MDS),逐维与物理 RDM 求相关;(ii) 刺激的固有行为显著性——面孔(先天熟悉)对 Ziggerin(陌生、行为无关);(iii) 神经元的类别选择性——面孔选择性神经元、其他神经元,以及 Ziggerin 选择性神经元。关键控制是:面孔与 Ziggerin 均为"3 个子类 × 每子类 3 个极相似成员"的结构,子类内与子类间的物理及知觉相似性距离经过小波分析与人类心理物理实验的迭代匹配,从而排除"面孔图像本来就更像"的平凡解释。逻辑链于是清晰:若面孔的低维匹配只在面孔神经元出现、且与物理空间本身的维度无关,则低维表示反映的是神经机制的专门化,而非刺激的固有简单性。
方法
心理物理被试为 6 名人类受试者(延迟匹配样本任务:样本 500 ms、50 ms 掩蔽、900–1100 ms 空屏、测试 500 ms,判断两刺激相同与否;每个设计阶段约 2600 试次)。神经数据来自两只被动注视任务的猕猴(PO 与 SE,10.0–11.0 kg,8–10 岁),用钨丝单电极在颞上沟下岸均匀网格(1 mm 步距,从沟内侧唇到沟底,前后 6–19 mm 与 12–20 mm)记录;刺激 350/700 ms(PO)与 250/1000 ms(SE)呈现,各重复 10 次。刺激集为 10 类各 9 个样本共 90 张图(面孔、Ziggerin 加汽车、飞机、身体、房屋、椅子、钟表、工具、玩具 8 类),图像亮度与对比度经 SHINE 工具箱均衡;面孔用 Facegen 从一个 30 岁正面人脸种子生成,子类内以眉脊、颊高、眼径、颏宽等二维特征变化定义,并保证任一单一局部特征都无法区分子类内图像。
共 201 个单细胞(PO 129、SE 72)中,196 个对至少一个刺激有显著诱发反应(200–0 ms 基线,Wilcoxon 符号秩检验),全均值放电率 <2 Hz 者剔除;对面孔与所有其他图像反应显著不同者为面孔选择性神经元(Wilcoxon 秩和,P<0.05),选择性强度用 d′ 指数衡量。共 56/196(29%)为面孔选择性,其余 140 个称"其他神经元"。分析层面:物理相似性取 db2 小波单层二维分解(40 000 系数)系数向量间的欧氏距离;知觉相似性取把不同刺激对误判为"相同"的比例(子类内判别正确率面孔 66.8±6.4%、Ziggerin 69±5.4%,子类间均约 96–97%,均显著高于 50% 水平,说明刺激虽极相似但人类可辨别);神经相似性则把每细胞对 90 刺激的归一化平均反应排成向量、取刺激对之间的欧氏距离构成 RDM,反应窗固定为对每类/亚群最优化的 150 ms 窗。比较用 RDM 的 Spearman 相关(bootstrap 1000 次给 95% CI 与 P 值),降维用非经典 MDS(另以 PCA 佐证),并辅以类别层面(面孔 vs 非面孔)的 Kendall's tau 相关作为基线。
主要结果
- 刺激的物理空间与人类知觉空间高度对齐(Fig. 2):二维 MDS 下两类别在两个空间的排布几乎一致,凝聚聚类均按子类先行聚拢,Procrustes 拟合优度面孔 0.97、Ziggerin 0.88——这为"形状空间到神经空间的映射"提供了干净的参照系。
- 面孔神经元的面孔空间是低维的(Fig. 6A,Fig. 4):面孔物理 RDM 与神经 RDM 的相关在低维度最大(峰值维度 D=2 时 r=0.49,P=0.0085,bootstrap),随维度增加到约 10 维时降至不显著;该低维表示约解释神经 RDM 总方差的 36%(Fig. S2 碎石图)。而其他神经元对这组极相似面孔的物理相似性完全无相关(Fig. 6B)。
- Ziggerin 的模式相反且不依赖选择性(Fig. 6A、B):在面孔神经元中,Ziggerin 物理与神经 RDM 的相关随维度增加而提高,约 12 维才显著(该亚群选出的峰值维度 D=36);其他神经元编码 Ziggerin 所需维度少得多(峰值 D=16)。Ziggerin 选择性神经元同样在高维表现更明显(Fig. S4),说明"低维面孔优势"是面孔类与面孔神经元特异的。
- 低维面孔匹配不是刺激或少数细胞的伪影:面孔物理空间本身比 Ziggerin 更复杂——重建到 r≥0.9 需 38 维对 Ziggerin 的 17 维(Fig. S6A);按 d′ 分组显示高、中选择性面孔神经元贡献最大,加入最低选择性者无改善(Fig. S5),在子类内做 bootstrap 也复现主结果(Fig. S7),低维匹配需要数十个面孔神经元的群体贡献。
- 时间动力学上呈"双工"结构(Fig. 6C、D,Fig. 7):面孔神经元中对面孔的最优相关出现在刺激后约 185 ms(150 ms 滑窗、10 ms 步进),对 Ziggerin 则在约 335 ms;其他神经元对 Ziggerin 峰值约 345 ms。即面孔空间早出现、低维;非面孔形状信息晚出现、高维。早期反应段相关值普遍为负——作者解释为早期阶段群间神经距离小于群内距离,与物理空间的"子类内更近"结构相反。
图注解读
图 1 · 刺激集与任务结构
原文图注:Fig. 1. (A) Target stimulus set. The physical and perceptual similarities of stimuli were controlled within each stimulus category of face and Ziggerin. (B) Ideal stimulus distances. (C) Human psychophysics task. (D) Monkey passive fixation task. [Colour figure can be viewed at wileyonlinelibrary.com].
全景铺垫图:A 展示目标刺激集——面孔与 Ziggerin 各 9 张、内部三个子类(每子类三张极相似成员),且类内物理与知觉相似性经过控制;B 给出"理想刺激距离"的设计蓝图(子类内近、子类间远的树状结构);C 是人类延迟匹配样本任务的时间线(样本—掩蔽—延迟—测试—按键判断);D 是猕猴被动注视任务的时间线(注视点—样本 350 ms—空屏—测试)。读图要点是 B 里那张"理想距离"示意:后续所有 RDM 分析的预期结构(子类成员聚成一簇)都以此为模板。此图支撑方法一节的刺激构造与任务设计,也是理解全部结果的前提——刺激相似性结构是被人工校准过的,两类刺激处于对等起点。

图 2 · 物理空间与知觉空间的二维排布
原文图注:Fig. 2. Two-dimensional multidimensional scaling (MDS)-derived arrangement of images based on physical (A and C) and perceptual (B and D) similarities. The MDS reconstruction of the stimulus arrangement was performed in two levels of category (level 1) and subclass (level 2) separately. For level 1 (solid line), all of the nine stimuli were used and for level 2 (dashed line), only the three stimuli in each subclass were used for MDS. As the real values are in two different spaces the labeling on both axes in the graph is omitted. [Colour figure can be viewed at wileyonlinelibrary.com].
四个面板分别是面孔(A、B)与 Ziggerin(C、D)基于物理相似性(A、C)与知觉相似性(B、D)的二维 MDS 排布;实线为用全部 9 个刺激做的类级(level 1)重建,虚线为只用每个子类内 3 个刺激做的子类级(level 2)重建。读图看两点:一是每个面板里三个子类是否各自抱团(是),二是物理面板与对应知觉面板的构型是否几乎相同(是,定量上 Procrustes 拟合优度面孔 0.97、Ziggerin 0.88)。坐标轴数值被略去,因为两个空间不可比量纲。此图支撑主要结果第 1 条,作用是授权后续把"物理相似性"当知觉相似性的代理来跟神经空间对齐——若两张图分歧大,整篇文章的地基就塌了。

图 3 · 面孔选择性与非选择性神经元的群体放电直方图
原文图注:Fig. 3. Population histogram of average normalized firing rate across all face-selective (A) (n = 56) and other (B) (n = 140) neurons. The three traces correspond to average firing rate across all nine stimuli in the face category (red), nine stimuli in the Ziggerin category (green) and all of the 72 stimuli in the eight remaining categories (yellow). The plots show mean and 10th to 90th percentile of corresponding bootstrap test. [Colour figure can be viewed at wileyonlinelibrary.com].
两条群体直方图:A 为 56 个面孔选择性神经元、B 为 140 个其他神经元,横轴为刺激后时间(ms),纵轴为平均归一化放电率;红线是面孔类 9 个刺激的平均反应,绿线是 Ziggerin 类,黄线是其余 8 类共 72 个刺激。读图看点在反应窗的选择依据:面孔神经元对面孔反应强、启动早(这正是后文 150 ms 窗口和早时间峰的基础),其他神经元对面孔与 Ziggerin 的反应则平缓得多。带状区域为 bootstrap 的第 10–90 百分位。此图主要服务方法部分的细胞分类(d′ 与面孔选择性定义)与后续时间窗选择,不直接支撑某条结论,但它是 Fig. 7 中叠加直方图的数据来源。

图 4 · 面孔神经元重建的二维面孔空间
原文图注:Fig. 4. Two-dimensional multidimensional scaling of face stimuli reconstructed from response pattern of inferior temporal cortex face neurons. Numbers represent the subclasses of face stimuli.
这张图是全文"低维面孔表示"最直观的证据:用 56 个面孔选择性神经元的反应模式对 9 张面孔做二维 MDS,数字标记子类归属。读图看三个子类(每组三张)是否在神经空间里自然聚成三团、且团间相对位置与物理/知觉空间的排布对应——定量结论是二维神经排布与高维物理空间显著相关(r=0.49,P=0.0085,bootstrap)。它支撑主要结果第 2 条:面孔物理相似性只需两个神经维度就能被面孔神经元群体忠实映射,与 1992 年 Young & Yamane 的经典二维面孔空间结论形成跨范式的呼应。

图 5 · 神经 RDM 的计算与降维方法
原文图注:Fig. 5. (A) Calculation of the neural representational dissimilarity matrix (RDM). For each pair of stimuli, the associated neural activities are arranged in a vector and compared by Euclidean distance between the two vectors. These dissimilarity/similarity values for all pairs of stimuli are arranged in the multidimensional RDM. (B) Dimension reduction method. The multidimensional neural RDM of all 90 stimuli is subjected to d-dimensional non-classical multidimensional scaling (MDS). Euclidean distance between pairwise stimulus coordinates in the new d-dimensional space was measured to reconstruct the d-dimensional neural RDM. [Colour figure can be viewed at wileyonlinelibrary.com].
方法示意:A 面展示如何从"每个神经元对每个刺激的反应"(NEURON × STIMULUS 矩阵)出发,对每个刺激对取反应向量算欧氏距离,填进 90×90 的多维神经 RDM;B 面展示降维——对全 90 刺激的神经 RDM 做 d 维非经典 MDS,得到 d 维空间中每张图的坐标,再算两两欧氏距离重建出"d 维神经 RDM"。读图关键是理解"维度"在这里的操作定义:不是刺激特征数,而是重建神经 RDM 时允许 MDS 使用的坐标维数。此图不携带数据,是理解 Fig. 6 横轴的说明书。

图 6 · 维度—相关曲线与时间进程
原文图注:Fig. 6. Correlation coefficients between physical and neural representational dissimilarity matrix (RDM) for face (red circles) and Ziggerin (green circles) stimuli across different dimensions for the face (A) and other (B) neurons. Dim red and green traces in the plots represent the correlation between physical and neural RDM for face vs. non-face and Ziggerin vs. non-Ziggerin stimuli, respectively. Vertical bars show 95% confidence intervals. Correlation coefficient between physical and neuronal RDMs for the dimension with peak correlation value (see inset) of the face (C) and other neurons (D). The values are measured in 150-ms windows with 10-ms steps and plotted over time. Open circles, non-significant values; filled circles, significant values based on bootstrap test (exact P-values for each dimension are reported in Table S3). [Colour figure can be viewed at wileyonlinelibrary.com].
全文的主图,上下两层各两面板。上层(A、B)横轴为神经维度(2 到 44+),纵轴为物理—神经 RDM 的 Spearman 相关:A(面孔神经元)中红点(面孔)在低维高企、约 10 维后坠入不显著(空心点),绿点(Ziggerin)反向爬升、约 12 维后才显著;B(其他神经元)中红点全程贴地(面孔无信号),绿点随维度上升。淡色曲线是类别层面(面孔 vs 非面孔、Ziggerin vs 非面孔)的 Kendall's tau 基线,误差线为 95% CI。下层(C、D)把各自峰值维度(内嵌标注:面孔神经元面孔 D=2、Ziggerin D=36;其他神经元面孔 D=2、Ziggerin D=16)的相关值沿时间展开——150 ms 窗、10 ms 步进,横轴为窗中心时刻:面孔神经元的面孔峰约 185 ms、Ziggerin 峰约 335 ms,其他神经元 Ziggerin 峰约 345 ms。此图一并支撑主要结果第 2、3、5 条,是"低维早现的面孔地图 + 高维晚现的非面孔地图"这一双工结论的直接来源。

图 7 · 时间 × 维度的全景相关图
原文图注:Fig. 7. Correlation coefficient between physical and neural representational dissimilarity matrices in different time and dimensions for face-selective (A and C) and other (B and D) neurons. Numbers on the x-axis indicate the middle of the 150-ms time window. The overlying trace on each graph is the average response histogram of corresponding neurons to the face and Ziggerin categories, which was aligned at stimulus onset. [Colour figure can be viewed at wileyonlinelibrary.com].
把 Fig. 6 的时间分析展开为全景:A、B 面板是面孔(红系)与 Ziggerin(绿系)相关值随维度(右侧刻度 5、15、25、35、45)与时间的矩阵热图式呈现,C、D 为对应切片;横轴数字是 150 ms 窗的中心时刻,每图上叠加的曲线是相应神经元群对面孔与 Ziggerin 类的平均反应直方图(对齐刺激起始)。读图结论是全局性的:几乎所有条件下的最高相关都出现在反应后段(>150 ms),且面孔形状空间用低维即可映射、Ziggerin 需要更多维度(Table S2 给出前五个维度的平均相关)。它支撑主要结果第 5 条的"晚段承载形状信息"一面,与早期全局信息、晚期精细信息的经典时相叙事(Sugase 等,1999)相容。

讨论
作者把结果串成两条解释线。其一是"面孔神经元为何低维":更高维度的神经成分可能携带与定义本实验面孔形状空间的参数无关的信息——表情、注视、视角、熟悉度、性别乃至物种(引 Young & Yamane, 1992;Sugase 等,1999 等),把这些维度加进来反而稀释了形状相似性信号;而学习(无论演化尺度还是短期的类别学习)可以通过突出某些相关特征、压低其他特征来降低有效维度(Kourtzi & Connor, 2011;Goldstone 等,2001)——这为面孔的低维表示提供了一个不需要个体经验的通道,因为本研究猕猴对刺激集内任何图像的身份都没有事先经验,低维面孔表示仍是先天的。同等重要的是反向结论:其他神经元对这组极相似面孔的物理相似性不携带任何信息,说明辨别这些相似面孔所需的计算由面孔选择性神经元独家承担。其二是 Ziggerin 的分布式编码:面孔神经元在更高维度上确实携带 Ziggerin 形状信息,但所需维度远多于面孔,作者推测映射 Ziggerin 形状空间所需的特征信息分布在比面孔空间大得多的面孔神经元群体上;其他神经元编码 Ziggerin 则稀疏得多(少得多的维度即可)。与此前研究的对话集中在方法差异上:Lehky 等(2014)、Suzuki & Tanaka(2011)、Op de Beeck 等(2001)、Kayaert 等(2005)都是双空间同时降维再比较,而本研究固定物理空间全维度、只系统变化神经维度,避免了对类别间固有维度差异的假设——他们自己的控制分析(Fig. S6)恰恰证明面孔物理空间比 Ziggerin 更复杂,从而排除了"面孔空间本来就简单"的解释。对早期负相关,作者给了一个结构性的解释:基线与早期反应阶段群间距离小于群内距离的随机分布是预期内的,负相关意味着尚无形状信息。局限方面正文着墨不多(数据不公开、仅两只猴、被动注视范式等文中未详述),结论的推广依赖刺激集的高度人工化构造。
一句话总结
在我读来,这篇文章最漂亮的不是"面孔在低维"这个结果本身(1992 年已有二维面孔空间的先声),而是它把维度当成一个被操纵的自变量、再用选择性亚群和时间窗把它切成"谁、何时、多少维"的三维答案——面孔神经元天生双工:早而低维地画面孔,晚而高维地画非面孔。样本只有两只猴、刺激只有九九结构这点限制明显,但"面孔物理空间需要 38 维重建、神经上却 2 维即匹配"这组数字构成的悖论,为腹侧通路的先天专门化提供了一个非常干净的证据形态。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[A, B, C, D] - Fig2: 提取质量
good,对齐度full,识别面板[A, B, C, D] - Fig3: 提取质量
good,对齐度full,识别面板[A, B] - Fig4: 提取质量
good,对齐度full,识别面板[] - Fig5: 提取质量
good,对齐度full,识别面板[A, B] - Fig6: 提取质量
good,对齐度full,识别面板[A, B, C, D] - Fig7: 提取质量
good,对齐度full,识别面板[A, B, C, D]
关键事实与局限性声明
- 审校纠偏: {'classification': 'INTERPRETATION', 'claim': '面孔神经元执行multiplexing', 'assessment': '这是作者根据同一细胞群在不同时间和维度上呈现两类RDM匹配提出的功能解释,不是被直接操纵或因果证明的机制。'} -> 评注: 这是作者根据同一细胞群在不同时间和维度上呈现两类RDM匹配提出的功能解释,不是被直接操纵或因果证明的机制。
- 审校纠偏: {'classification': 'INTERPRETATION', 'claim': '高维面孔成分携带表情、注视、视角、熟悉度、性别或物种等无关信息', 'assessment': '原文使用“may carry”;本实验没有分别解码这些属性。'} -> 评注: 原文使用“may carry”;本实验没有分别解码这些属性。
- 审校纠偏: {'classification': 'INTERPRETATION', 'claim': 'Ziggerin特征分布在更大的面孔神经元群体中,而其他神经元采用稀疏编码', 'assessment': '这是从所需MDS维度数推断的编码组织,未直接测量参与细胞数量或神经稀疏度。'} -> 评注: 这是从所需MDS维度数推断的编码组织,未直接测量参与细胞数量或神经稀疏度。
- 审校纠偏: {'classification': 'OVERCLAIM', 'claim': '维度差异由行为显著性决定', 'assessment': '行为显著性没有独立操纵,且与类别、熟悉度和图像特征混杂。'} -> 评注: 行为显著性没有独立操纵,且与类别、熟悉度和图像特征混杂。
- 审校纠偏: {'classification': 'OVERCLAIM', 'claim': '低维面孔表示是先天的或证明了先天专门化', 'assessment': '没有发育经验操纵;未见过具体刺激不等于没有一般面孔经验。'} -> 评注: 没有发育经验操纵;未见过具体刺激不等于没有一般面孔经验。
- 审校纠偏: {'classification': 'OVERCLAIM', 'claim': '其他神经元不携带任何面孔信息,面孔神经元独家完成辨别计算', 'assessment': '未检出指定RDM相关不能证明信息为零,也没有因果干预支持“独家承担”。'} -> 评注: 未检出指定RDM相关不能证明信息为零,也没有因果干预支持“独家承担”。
- 审校纠偏: {'classification': 'OVERCLAIM', 'claim': '二维空间忠实或完整重建了面孔表示', 'assessment': '实际相关约0.49且解释约36%的神经RDM方差,应称为显著但部分的匹配。'} -> 评注: 实际相关约0.49且解释约36%的神经RDM方差,应称为显著但部分的匹配。
- 补充要点: : (第 页)
- 补充要点: : (第 页)
- 补充要点: : (第 页)
- 补充要点: : (第 页)
- 补充要点: : (第 页)