这是一篇发表于皇家学会专题讨论会的综述加理论文章:Rolls 汇总了自己实验室在猕猴颞叶皮层记录的 2600 多个单神经元的证据,系统回答"面孔信息在颞叶视觉皮层如何表征"——面孔神经元分布在哪里、身份如何编码、表征具备哪些不变性、表情与身份如何分工。它之所以值得读,在于作者没有停留在数据罗列,而是进一步把这些经验性质放进竞争学习与联想记忆网络的计算框架里,提出了一整套"颞叶面孔表征如何被逐级学习出来"的机制假说,是 1990 年代面孔加工神经生理学的奠基性文本之一。
研究背景
到 1990 年代初,灵长类腹侧视觉通路的图景已经比较清楚:视觉信息从初级视皮层(V1, primary visual cortex)经多级皮层逐级上传,最终到达颞叶(temporal lobe)视觉区;在这里已经发现对面孔有选择性反应的神经元(Desimone & Gross 1979;Bruce et al. 1981;Perrett et al. 1982 等)。解剖上,下颞叶皮层按细胞构筑可分为 TEa、TEm、TE3、TE2、TE1 等区,上颞沟(superior temporal sulcus, STS)内部及周边又分出 TPO、PGa、IPa、TS、TAa 等亚区,各有不同的皮层间输入来源。但分区归分区,这些亚区各自执行什么计算、面孔神经元为何在某些亚区富集,当时并不清楚。
更深的缺口在于表征本身。单个神经元究竟以"祖母细胞"(grandmother cell,即一个细胞唯一对应一张脸)方式编码,还是以群体活动模式编码?这些表征对尺寸、对比度、空间频率、视网膜位置等变换是否不变?反应选择性是先天的还是由视觉经验塑造的?以及最根本的:多级皮层凭什么计算能造出这样的表征?Rolls 的立场是,这些问题既要在清醒猕猴上做定量单细胞记录来回答,也要放进神经网络理论里检验——数据告诉我们系统"是什么样",理论才能解释"为什么是这样"。
研究思路
作者的策略是"普查—定量—建模"三步走。第一步,在颞叶各亚区大样本筛查神经元的功能特化:用光栅、简单几何图形、三维物体和面孔等一大批刺激逐一测试,确定面孔神经元富集在哪些亚区、各亚区是单模态还是多模态、偏好静止还是运动刺激,从而把"处理面孔"这件事在解剖上落位。第二步,对已找到的面孔神经元做系统的变换实验:改变刺激大小、对比度、空间频率、视网膜位置、观察视角、表情与身份的组合,直接测量表征的不变性范围和编码维度,并用引入全新面孔集的办法检验经验是否修改反应性质。第三步,以上一步测得的性质为硬约束——调谐不能太细也不能太宽、身份是群体编码、存在平移与视角层面的不变性——反推什么样的网络结构和学习规则能自然产生这些性质,得到"多级收敛 + 各级竞争自组织 + 反向投射引导"的层级假说。
这条逻辑链的关键环节是编码方式与网络性质之间的取舍论证:集群编码(ensemble encoding,由一群神经元的联合反应表征一个物体)让输入到联想记忆(associative memory)网络的表征具备模式补全(pattern completion)、泛化和优雅退化(graceful degradation,容错)等涌现性质,但代价是网络内不同记忆之间会相互干扰;反过来极端精细调谐干扰小、可存记忆多,却丢掉上述全部好处。实验测到的调谐宽度恰好落在这两个极端之间,这正是需要用理论解释的"精细的折中"。
方法
改为:本文综合了作者团队在恒河猴中的多项单神经元研究,其中颞叶不同亚区的功能普查包含超过2600个神经元;原文未给出合并后的动物总数,各子实验的任务和神经元样本量不同。刺激包括正弦光栅、简单几何图形、三维物体与真人及猴面孔,部分亚区还测试了听觉与躯体感觉刺激以判定模态属性。针对具体问题还有几个专门范式:一是表情—身份分离实验,用三只猴脸各配三种表情(另加人类表情)构成 3×3 刺激集,对 45 个面孔选择性神经元做双因素方差分析;二是经验效应实验,先确认神经元对一组熟悉面孔在 5–15 次重复中反应稳定,再以每张 1 秒、多轮随机顺序反复呈现一组全新面孔,观察相对反应量是否随轮次调整;三是平移不变性实验,在视觉注视任务中把面孔放在感受野不同位置测量反应。分析要点包括:面孔与非面孔刺激的反应倍数比较(2–20 倍且统计显著)、调谐宽度的熵度量(对集合中各刺激反应占比求熵,H=1 表示对全部刺激反应均等)、以"反应大于半最大值"为标准量化对各类变换的容忍范围。
主要结果
- 亚区功能特化(图 1 给出解剖定位):面孔神经元在 STS 内的 TPO 区及沟腹侧唇的 TEa、TEm 区密度最高,约占对静止刺激有反应的视觉神经元的 20%,其余颞叶皮层区仅占 4–10%,比例差异统计显著;TPO、PGa、IPa 为视—听—体感多模态区,STS 前背侧神经元特化于运动视觉分析,下颞回及相邻TE区主要属于单模态视觉区。后续的表情—身份实验进一步表明:对表情反应独立的神经元主要位于 STS 皮层,对身份反应独立的神经元主要位于下颞回。
- 面孔选择性与特征组合:这些神经元对面孔的反应比对光栅、简单几何图形或复杂三维物体高 2–20 倍(STS 内一半的面孔神经元对最有效面孔的反应比对其他刺激大 5 倍以上);遮挡或孤立呈现五官(眼、嘴、毛发)显示不同细胞对不同的特征子集反应,且部分细胞要求五官处于正常空间构型——同样的五官打乱排列后反应显著变小,说明所形成的组合不仅包含"有哪些特征",还包含特征的空间排布。
- 身份采用集群编码而非祖母细胞:对面孔做定量研究显示,不同个体的身份信息由神经元群体的反应模式共同表征;沿输出通路在杏仁核也发现面孔选择性神经元,且多数对不同面孔有不同反应、仍是集群编码,腹侧纹状体中亦有类似神经元。调谐宽度被论证为精细调谐与宽调谐之间的折中,以兼顾低干扰与泛化、补全、容错等网络性质。
- 经验塑造反应选择性:在新面孔集的重复呈现中,部分面孔神经元在最初 1–2 轮内调整了对各张新脸的相对反应强度(Rolls et al. 1989),而此前对熟悉面孔的反应是稳定的。这支持视觉经验通过自组织方式把新面孔纳入表征网络的假说。
- 表征的不变性与两种参照系:多数面孔神经元对刺激大小相对不变,反应保持大于半最大值时容忍的中位尺寸变化达 12 倍;在该句后补充:“作者同时指出,群体响应幅度降低本身不等于身份表征方向改变,关键取决于不同神经元是否受到不同比例的影响。”空间频率维度上,图像低通滤波(模糊)或高通滤波(线描状)后仅保留低至每张脸 8 个周期的空间频率信息,许多神经元仍有反应;但窄带滤波实验表明对未滤波面孔的反应无法用各窄带反应的线性组合预测,说明这些神经元的响应不能由各窄带响应线性相加解释,并提示至少在该级灵长类视觉系统中,面孔识别并非简单依赖空间频率成分的线性傅里叶分析。平移不变性方面,注视任务中猴子注视点越过 3–20 度大小面孔的边缘 2–5 度时,许多神经元仍给出大于半最大的反应,且面孔之间的选择性在此偏心位置依然保持,甚至跨视野中线成立。参照系上,10 个神经元对只能用对象坐标描述的运动反应(其中 4 个对头部腹侧屈曲强烈反应,无论呈现全脸、任一侧脸还是后脑勺,且头部倒置时特异性不变,并能跨不同头型泛化),另有少数神经元对特定绝对大小的面孔反应而与视网膜像大小无关,支持对象中心(object-based)编码;但对身份的选择性在 18 个被测神经元中有 16 个并非完全视角无关——身份信息保留的同时反应仍受视角影响,且视角依赖、部分视角无关与视角无关的神经元混存于同一区域。
- 表情与身份的功能分离:45 个面孔选择性神经元中,15 个对身份差异反应而与表情无关,9 个对表情反应而与身份无关;表情神经元集中于 STS,身份神经元集中于下颞回。部分神经元对平时共同出现的社会性动作组合(低头、垂眼、闭眼睑,即猴子结束社会接触的信号)都起反应,可由赫布式竞争自组织解释。
图注解读
图 1 · 猕猴前部上颞沟及周边皮层的细胞构筑分区
原文图注:Figure 1. Coronal section showing the different architectonic areas in and bordering the anterior part of the superior temporal sulcus (s.t.) of the macaque (see text). Areas TE1, TE2 and TEm form part of the inferior temporal gyrus.
解读:这是一张猕猴脑的冠状切片分区示意图,标出上颞沟(s.t.)前部及其两侧缘的各细胞构筑学区,并注明 TE1、TE2 与 TEm 属于下颞回的一部分。读图时可以先认沟的位置,再看沟内(TPO、PGa、IPa、TS、TAa 等)与沟腹侧唇及下颞回(TEa、TEm、TE1、TE2 等)各分区的相对位置:面孔神经元比例最高的 TPO 与 TEa、TEm 正是围绕沟前部分布的,而主要编码身份的 TE 区位于更腹侧的下颞回。这张图本身不含数据,作用是给正文各亚区的功能特化结果(面孔神经元约 20% 对 4–10% 的分布差异、表情在 STS 与身份在下颞回的分工)提供解剖坐标系,也为第 10 节的层级模型划出加工的解剖舞台。

图 2 · 从 V1 到 TE 的逐级汇聚与各阶段可能构建的表征
原文图注:Figure 2. Schematic diagram showing convergence achieved by the forward projections in the visual system, and the types of representation that may be built by competitive networks operating at each stage of the system from the primary visual cortex (VI) to the inferior temporal visual cortex (area TE) (see text). LGN, lateral geniculate nucleas. Area TEO forms the posterior inferior temporal cortex. The receptive fields in the inferior temporal visual cortex (e.g. in the TE areas) cross the vertical midline (not shown).
解读:这是第 10 节计算假说的总示意图:从外侧膝状体(LGN)经 V1、V2、V4、后下颞皮层 TEO 到下颞叶 TE,逐级画出前馈投射带来的感受野汇聚——感受野每上一级约扩大 2.5 倍(V4 约 8 度、TEO 约 20 度、下颞叶约 50 度),各级汇聚带连续重叠;每一级内由竞争网络构建的表征类型逐级升级,从简单特征到"特征组合/构型敏感"(configuration sensitive combinations of features),再到顶端的"视角无关"(view independence)表征。图中横轴按偏心度(eccentricity)标定,并注明 TE 区感受野可跨越垂直中线。需要提醒的是,这张图是模型示意而非实验数据,它把前文的经验发现(不变性、构型敏感、视角无关神经元混存)组织成一条从数据到机制的可检验加工链,支撑"多级收敛 + 竞争自组织"那一节的核心主张。

讨论
在讨论与理论部分,作者把上述发现收拢为一个工作假说:皮层视觉加工是至少包含 V1、V2、V4、TEO、TE 及前颞区的多级层级,每级是一组局部自组织的竞争网络(前馈输入引起非线性激活,反馈抑制性中间神经元实现竞争,再按改进的赫布规则修改突触——用 NMDA 受体的电压依赖激活解释约 0.5 秒的可修饰时间窗)。由于真实物体在物理世界中连续移动,同一物体在相邻视网膜位置相继激活的特征分析器会在这个时间窗内被同一后突触神经元"记住"并加强连接,平移不变性由此从世界的统计规律中学习得到;尺寸、空间频率等不变性可用类似机制逐级习得,且每级只在小范围内找相关性,限制了连接空间的规模。为避免组合爆炸,每级神经元只学习输入的低阶组合(沿用 Feldman 的建议),而特征组合中固有的局部空间排布信息,使同一组特征任意重排不会激活同一神经元——这是作者对该层级内特征绑定问题给出的有限解。视角无关表征则被设想为把同一物体的有限几个视角依赖表征关联起来的产物,这与 Poggio & Edelman 等人的观点一致;来自相邻皮层区及杏仁核、海马的反向投射(backprojections)为各级竞争网络提供温和的教学引导,并承担回忆功能。
会议讨论记录里有两段值得注意的交锋。Cowey 指出解剖证据表明反向投射的终止范围比前向投射的起点更弥散,问这与模型是否相容;Rolls 回应:前向投射必须足够集中以提供驱动突触修饰所需的强后突触激活,反向投射则只需在突触前提供修饰所必需的项,且回忆时可激活学习当时活跃的早期阶段神经元,即便它们不在前向通路上。Bruce 追问面孔的"特征"究竟指什么、是否对应我们有语言标签的东西;Rolls 答称特征不必有标签,它是早期视觉皮层对环境中频繁出现刺激的活动模式的低阶组合,例如 V1 中两组特定排布的活动组合可以就对应"嘴"。局限方面,作者自己也把这整套机制称为"工作假说"(outline working hypotheses):文中未给出模型的定量仿真验证,竞争学习、反向投射教学等环节在 1992 年仍属推测,文中未详述其可与数据直接对撞的具体检验。
一句话总结
以我的理解,这篇文章的分量不在任何单个实验,而在把 1980 年代"面孔神经元"的零散证据整合成一个自洽的计算故事:身份用群体编码、不变性靠逐级竞争学习习得、表情与身份分属 STS 与 TE 两条并行支路。0.5 秒赫布时间窗、反向投射当教信号这些细节今天看确有推测成分,但"ensemble 编码 + 层级自组织"的骨架经受住了后续三十年的检验——这也提醒我们,一篇好的综述可以比一篇好论文走得更远。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 审校纠偏: {'overclaim_id': 'OVERCLAIM_001', 'md_section': '一句话总结', 'current_text': '身份用群体编码、不变性靠逐级竞争学习习得、表情与身份分属 STS 与 TE 两条并行支路。', 'classification': 'OVERCLAIM', 'problem': '该句把不同证据等级压缩成并列事实:群体编码有定量单元记录支持;逐级竞争学习只是作者提出的工作假说;STS与TE的差异是概率性偏好和主要分布,而非绝对、互斥的两条支路。', 'recommended_fix': '改为“记录结果支持身份的群体编码,并显示表情相关响应更常见于STS、身份相关响应更常见于腹侧TE;作者进一步提出但未在本文中直接验证,位置、大小和视角不变性可能由多级竞争学习逐步形成。”'} -> 评注:
- 审校纠偏: {'overclaim_id': 'OVERCLAIM_002', 'md_section': '主要结果', 'current_text': '这支持视觉经验通过自组织方式把新面孔纳入表征网络的假说。', 'classification': 'INTERPRETATION', 'problem': '新面孔重复呈现后部分神经元响应改变是FACT;变化改善群体辨别以及由竞争性自组织造成,是作者的解释。当前使用“支持……假说”基本合适,但应避免进一步写成已证明的学习机制。', 'recommended_fix': '保留为有边界的作者推论,并明确“与竞争性自组织假说一致,但实验未直接鉴别突触或网络学习机制”。'} -> 评注:
- 审校纠偏: {'overclaim_id': 'OVERCLAIM_003', 'md_section': '讨论', 'current_text': '平移不变性由此从世界的统计规律中学习得到;尺寸、空间频率等不变性可用类似机制逐级习得。', 'classification': 'INTERPRETATION', 'problem': '这是作者在Section 10提出的机制模型,不是本文直接测得的因果结果。单元记录证明的是响应具有一定容忍性,不能证明这种性质由0.5秒Hebb时间窗或竞争学习产生。', 'recommended_fix': '改为“作者假设平移不变性可利用时间连续性和竞争学习从环境统计规律中形成,并推测尺寸、空间频率及旋转不变性可能通过类似机制逐级习得。”'} -> 评注:
- 补充要点: : (第 6 页)
- 补充要点: : (第 2 页)
- 补充要点: : (第 1 页)