IT / 文献库

PAPER 058 / CLOSE READING

Comparison of neuronal responses in primate inferior-temporal cortex and feed-forward deep neural network model with regard to information processing of faces

语义审核:fail · 图表审核:pass

本文目录 (Table of Contents)
  1. 研究背景
  2. 研究思路
  3. 方法
  4. 主要结果
  5. 图注解读
    1. 图 1 · TE 群体活动的 PCA:粗类别在前、细类别随倒置消失
    2. 图 2 · AlexNet 三层 PCA 与 RDM:不对称在全连接层成形
    3. 图 3 · 层间 RDM 与 TE 时间窗的相关:fc6 是最佳对应层
  6. 讨论
  7. 一句话总结
  8. 审校与证据追溯 (Verification & Evidence)
    1. 图表审计结果
    2. 关键事实与局限性声明

这篇短文把一个经典神经心理学现象——面孔倒置效应(face inversion effect)——拆成两个层次来定位:正立与倒置面孔的分离发生在哪一层,以及"对正立面孔分辨个体比对倒置面孔更好"的不对称发生在哪里。作者用同一个 AlexNet 逐层求表征、再用表征相异性矩阵与猴 TE 区群体神经活动逐时间窗对齐,结论是:正倒分离在前馈卷积层即可完成,而正立面孔的个体分离不对称更接近全连接层、也即 TE 神经元的表征方式。对想了解"前馈网络能解释视觉皮层哪些现象、哪些必须引入反馈/循环连接"的读者,这是一个人工刺激面很小、逻辑很干净的示范研究。

研究背景

前馈深度神经网络(feed-forward deep neural network, FDNN)在物体分类上远超其他计算机视觉模型(Krizhevsky 等,2012),已被当作腹侧通路的候选模型;但它与灵长类脑存在明显差异——脑内有大量侧向与反馈连接,而 FDNN 没有(Spoerer 等,2017;Kar 等,2019)。本研究团队此前的工作给出了一个可资利用的切入点:TE 区(前下颞皮层)神经元的反应先编码粗类别(猴脸 vs 人脸 vs 形状),随后才编码细类别(人的个体、猴的表情)(Sugase 等,1999;Matsumoto 等,2005a);且当面孔倒置呈现时,细类别信息减少而粗类别信息保留(Sugase-Miyamoto 等,2014)——这提示这些神经元参与了面孔倒置效应这一知觉现象的神经基础。悬而未决的问题是机制性的:这种"倒置后细类别信息丢失"的不对称,是前馈加工本身就能产生的,还是必须依赖反馈/循环回路?

研究思路

作者的策略是"逐层比对":把同一组 56 张(28 正立 + 28 倒置)人/猴面孔刺激分别喂给 AlexNet 与猴子,在模型侧对每一层特征向量做主成分分析(principal component analysis, PCA)并计算表征相异性矩阵(representational dissimilarity matrix, RDM),在神经侧对 119 个 TE 神经元的群体活动向量做同样的 PCA;然后用 Spearman 相关逐层、逐 50 ms 时间窗地把模型层与神经表征对齐。之所以选 AlexNet,是刻意取其"纯前馈、无侧向与反馈连接"的简化属性——用它作为"前馈连接能做到什么"的下限探针:凡是 AlexNet 里就出现的现象(正倒分离、不对称),可以归因于前馈加工;凡是它不能再现的现象(如全局→细类别的时间进程),才有理由怀疑需要循环连接。选正倒面孔作刺激面,则是因为团队已有同一刺激集的完整 TE 单细胞数据可直接复用。

方法

神经数据来自两只雄性恒河猴(Monkey C,10 kg;Monkey T,9 kg)在注视任务下的单细胞记录(电极垂直插入,记录位点大致在 TEa 与 TEav 区;数据采自 Sugase-Miyamoto 等,2014 的实验)。试次流程为:握杆后出现 0.3°×0.3° 的黄色注视点,注视 200–300 ms 后目标消失 100 ms,随即呈现测试刺激 400–500 ms。刺激为彩色面孔图片(20°×20° 以内):16 张猴脸(4 个模型个体 × 4 种表情)与 12 张人脸(3 个个体 × 4 种表情),共 28 张,再各自 180° 旋转得倒置版本,合计 56 张;猴子对这些人/猴模型均不熟悉。分析对象为 119 个面孔反应神经元(C 猴 28 个、T 猴 91 个):以 50 ms 窗、1 ms 步进滑动计算 119 个神经元的平均放电率,得到 56 个群体活动向量;按前作惯例取 [115, 165] ms 窗代表粗类别编码、[140, 190] ms 窗代表细类别编码,并加测 [101, 151] ms 窗。模型侧使用 Matlab 预训练的 AlexNet(5 个卷积层 conv1–5、3 个全连接层 fc6–8,max pooling 跟随 conv1、conv2、conv5,各层单元数从 conv1 的 290,400 递减到 fc8 的 1,000;权重由 ILSVL12 图像库——ImageNet 子集,100 万张图——训练,未对面孔微调),刺激统一缩放为 227×227。统计为单侧 t 检验(配对或独立样本,文中逐处给出 df 与 p 值)。

主要结果

  1. TE 神经元复现已知的倒置效应时程:在 [115, 165] ms 窗,人脸正立与倒置向量间的欧氏距离显著大于猴脸正倒间的距离(单侧 t 检验,p=0.021,df=26),且该窗对人-猴粗类别的区分优于 [101, 151] ms 窗(正立人脸与正立猴脸的距离在 [101,151] 显著更近,配对 t 检验 df=191,p=3.4×10⁻⁷³);到 [140, 190] ms 窗,正立条件下"人的个体之间""猴的表情之间"的均值向量距离显著大于倒置条件(df=2,p=4.4×10⁻³;df=5,p=4.6×10⁻³),即倒置损害了细类别表征。PCA 空间中正立与倒置的排布相对第一主成分轴不对称(图 1)。

  2. 模型逐层 PCA 显示分工:conv1 层正立与倒置的人脸向量已分开而猴脸重叠;conv5 层正倒猴脸分开;fc6 层正立条件下人的个体与猴的表情各自分离,且正立-倒置排布相对第一主成分轴不对称——而 conv1、conv5 中近乎线对称。即"正倒分离"随卷积层推进逐步完成,"正立的个体/表情分辨"要到全连接层才出现(图 2a–c)。

  3. RDM 定量支持同一结论:以"某个体 vs 其余个体"的相异性比较正立与倒置条件,人脸 Model1 在 fc6、fc7、fc8 显著大于倒置(p=0.0038、2.7×10⁻¹²、6.3×10⁻⁷)而 conv1、conv5 不显著(p=0.30、0.67);Model2、Model3 的显著性集中在 fc7。猴表情方向相反:倒置条件下的表情间差异在 fc6–8 均显著大于正立(如 fc6 的 p 从 4.3×10⁻¹⁰ 到 8.2×10⁻⁷),conv1、conv5 无差异(p=1.0)。作者据此概括:全连接层中"正立人脸个体间(与倒置猴表情间)"的分离更大(图 2d–f)。

  4. 正倒分离的峰值在卷积层:正立与对应倒置面孔间的平均 RDM 相异性,人脸在 conv2 达最大(0.7678),猴脸在 conv1 达最大(0.6291)——说明正倒分离发生在卷积层,前馈加工即可完成(图 3a)。

  5. 模型-神经对齐:各层 RDM 与 TE 神经元 RDM 的 Spearman 相关中,fc6 在 [101, 151] ms 窗最高(0.8017);三个全连接层 fc6–8 的相关在 [101,151]、[115,165]、[140,190] 三个时间窗都显著高于五个卷积层(单侧 t 检验,df=6,p=0.012、0.023、0.014)。TE 的表征方式最像全连接层(图 3b、c)。

图注解读

图 1 · TE 群体活动的 PCA:粗类别在前、细类别随倒置消失

原文图注:Fig. 1 (a) Images of upright faces used as test stimuli in the neuronal recording and the model. Inverted images were also used. Exp: facial expression. (b), (c), (d): Two-dimensional PCA spaces obtained from TE neurons in time windows of [101, 151] ms (b), [115, 165] ms (c), and [140, 190] ms (d). The horizontal axis represents the first principal component (PC), and the vertical axis represents the second PC. The red, magenta, blue, or cyan ellipses indicate the distribution of human upright individuals, human inverted individuals, monkey upright expressions, or monkey inverted expressions, respectively

(a) 是刺激总览:3个人类个体×4种表情,以及4个猴个体×4种表情;再加各自的倒置版本。,及各自的倒置版。(b)–(d) 横轴第一主成分、纵轴第二主成分,椭圆为各条件(红=正立人类个体、品红=倒置人类个体、蓝=正立猴表情、青=倒置猴表情)的分布。读法是从 (b) 到 (d) 看椭圆群如何散开:[101,151] ms 时正立人脸与正立猴脸的椭圆还挨得较近(粗类别尚未很好分离);[115,165] ms 时正/倒、人/猴都分开了;[140,190] ms 时正立的人的个体(红椭圆之间)与正立的猴的表情(蓝椭圆之间)彼此拉开,而对应的倒置(品红、青)椭圆彼此仍较近——这就是倒置效应在群体空间的几何表现,支撑结果第 1 条,也是后文模型对齐的目标形态。

Figure 1

图 2 · AlexNet 三层 PCA 与 RDM:不对称在全连接层成形

原文图注:Fig. 2 Two-dimensional PCA space obtained from feature vectors in model layers conv1 (a), conv5 (b), and fc6 (c). The colors of the ellipses are the same as in Fig. 1(b), (c). The RDM is plotted in layers conv1 (d), conv5 (e), and fc6 (f). The order of the x-axis and y-axis is as follows: upright human individuals (Model1-3) with 4 expressions, inverted human individuals (Model1-3) with 4 expressions, upright monkey expressions (Exp1-4) with 4 individuals, inverted monkey expressions (Exp1-4) with 4 individuals

(a)–(c) 与图 1 的 PCA 同型,但来自模型层的特征向量(椭圆颜色约定同图 1)。对比可见 conv1 只有正倒人脸分开(猴脸重叠)、conv5 正倒猴脸也分开、到 fc6 才出现"正立条件下个体/表情间的分离"且正倒排布变得不对称。读 RDM 面板 (d)–(f) 时先记住轴序(正立人类个体 → 倒立人类个体 → 正立猴表情 → 倒立猴表情),红=高相异、蓝=低相异:要看的是白框标出的块——某个体/表情与其余同类之间的块——在 fc 层是否在正立半边比倒置半边更红。Model1在fc6–8的正立相异性均显著高于倒置;Model2和Model3仅在fc7显著,fc6和fc8未达到显著。,倒置猴表情间的块在 fc6–8 显著更红,原文报告的conv1和conv5对比未见显著差异;文中未提供conv2–4及所有身份、表情条件的对应统计检验。,支撑结果第 2、3 条。

Figure 2

图 3 · 层间 RDM 与 TE 时间窗的相关:fc6 是最佳对应层

原文图注:Fig. 3 (a): Average dissimilarity value of RDMs between upright and inverted faces in each model layer. (b): The Spearman correlation between each model layer and neuronal activities in a 50-ms time window. (c) RDM obtained from TE neurons in [101, 150] ms time window

(a) 横轴为八个模型层,纵轴为正立与对应倒置面孔间的平均 RDM 相异性(人脸、猴脸分列):两条曲线的峰值都在卷积段(人脸 conv2=0.7678、猴脸 conv1=0.6291),到全连接层回落——正倒分离在前馈卷积层完成,支撑结果第 4 条。(b) 横轴为 50 ms 时间窗起点(0–300 ms)、纵轴为该窗 TE RDM 与各层 RDM 的 Spearman 相关:绿色实线(fc6)最高,在约 100–150 ms 处达 0.8017;且 fc6–8 三层的相关在所有三个目标窗都显著高于 conv1–5。(c) 给出 [101,150] ms 窗的 TE RDM 本身,作为 (b) 中相关的参照物。这张图把"模型哪一层像 TE、在什么时刻像"一次给出,支撑结果第 5 条与全文的核心结论。

Figure 3

讨论

作者把自己的发现放进两个坐标系里谈。与文献的一致性:AlexNet 全连接层与 TE 表征最相似,这与 Khaligh-Razavi 与 Kriegeskorte(2014)"深度有监督(而非无监督)模型才能解释 IT 表征"的结论吻合;正倒可分辨这一点也与多个其他神经网络模型一致(Yildirim 等,2015;Tan & Poggio,2016;Farzmahdi 等,2016;Hosoya & Hyvarinen,2017)。对不对称的机制解释:全连接层单元接收前层全部输出、感受野覆盖整图,恰如 TE 神经元的大感受野(Kobatake & Tanaka,1994),两者都以不对称方式表征正倒面孔。作者也坦承两处模型与 TE 的差距及其可能原因:其一,模型中正立猴表情间的分离并不大于倒置——他们推测因为 ImageNet 里缺少含猴表情的图像,模型对猴表情的表征能力不足;其二,TE 神经元"粗类别先于细类别"的时间进程在 AlexNet 中完全缺席,作者据此提出候选机制:TE 内部的循环连接(如吸引子网络,Hopfield,1982;Matsumoto 等,2005b)可能是层级化分类时间进程所必需,FDNN 与吸引子网络的组合模型或可同时再现两个层面——这也把"何时需要反馈/循环"的问题转化为可检验的建模任务。局限还包括 AlexNet 本身只是纯前馈的近似(作者明确以此为出发点而非结论)。

一句话总结

我的理解是:这篇论文用最朴素的对齐方法回答了一个容易被大模型热潮淹没的问题——"倒置效应里哪些成分是前馈的免费赠品,哪些才是皮层的独门手艺";答案的分工很清楚,正倒分离是卷积层的产物,而"正立才好认人"的细粒度不对称则要到全连接层才与 TE 接轨,剩下那个时间进程问题则被作者诚实留给了循环连接。


审校与证据追溯 (Verification & Evidence)

图表审计结果

  • Fig1: 提取质量 good,对齐度 full,识别面板 []
  • Fig2: 提取质量 good,对齐度 full,识别面板 []
  • Fig3: 提取质量 good,对齐度 full,识别面板 []

关键事实与局限性声明

  • 审校纠偏: {'claim': 'AlexNet中正立—倒置RDM相异性的峰值位于人脸conv2和猴脸conv1。', 'classification': 'FACT', 'reason': '这是图3a直接报告的模型结果,数值分别为0.7678和0.6291;适用范围限于该AlexNet、刺激集和RDM分析。'} -> 评注:
  • 审校纠偏: {'claim': '全连接层的表征与TE神经元表征相似。', 'classification': 'INTERPRETATION', 'reason': '该推论由RDM的Spearman相关支持;fc6在[101,151] ms达到最高相关0.8017,但表征相关不等于功能同源、解剖对应或因果机制相同。'} -> 评注:
  • 审校纠偏: {'claim': '正立—倒置分离可以归因于猴视觉皮层的前馈加工。', 'classification': 'OVERCLAIM', 'reason': '单一前馈模型能够产生相似模式只支持前馈计算的可能充分性,不能确认生物视觉系统实际依赖的因果通路。'} -> 评注:
  • 审校纠偏: {'claim': 'TE的粗到细时间进程需要循环连接。', 'classification': 'OVERCLAIM', 'reason': '本文没有实现并比较循环模型,也没有操纵TE循环连接;原文只提出条件性的候选假说。'} -> 评注:
  • 审校纠偏: {'claim': '倒置使TE细类别信息消失。', 'classification': 'OVERCLAIM', 'reason': '原文数据支持细类别表征减弱,而不是完全消失。'} -> 评注:
  • 补充要点: : (第 2 页)
  • 补充要点: : (第 3 页)