这是一篇把猴单细胞记录证据接入人类"面孔是否特殊"争论的综述加新证据短文。作者先梳理人脑研究中支持面孔特异机制的每一条证据如何被逐条推翻或限定,再介绍猴"专家化"训练的成果:反复学习辨别两类人工物体后,颞下皮层出现了与面孔细胞性质几乎一致的 wire/amoeba 选择性神经元。文章提出的框架——特异性(specificity)与独特性(uniqueness)要分开谈——以及"面孔是默认特殊类别"的结论,是后来面孔区专家化争论的经典参照。
研究背景
面孔识别在人类中可能是 qualitatively different 的说法,证据来自三个方面:脑损伤研究中的面孔失认症(prosopagnosia,Bodamer 于 1947 年命名;De Renzi 1986;Farah 等 1995a)、行为研究中的倒置效应(inversion effect,Yin 1969)与整体/配置加工(configural/holistic processing,Young 等 1987)、以及神经成像中右侧梭状回面孔区(fusiform face area)的存在(Kanwisher 等 1997;McCarthy 等 1997;Sergent 与 Signoret 1992)。与人类工作平行,猴脑的"面孔细胞"自 Gross 等人 1969 年发现以来已有大量记录,且猴的面孔识别行为表现与人类惊人相似。问题是两支文献几乎不对话:动物研究能提供人类因技术与伦理限制而拿不到的信息,但方法差异巨大,难以直接比较。
更麻烦的是,过去 15 年里,人类研究中几乎每一条支持面孔特异系统的证据都被质疑过了:新生儿对面孔样图形的偏好被归入粗糙的皮层下机制 CONSPEC,而负责成人式面孔识别的皮层机制 CONLERN 认为要到约 2 个月、经反复接触面孔才形成(Morton 与 Johnson 1991);倒置效应在狗专家(Diamond 与 Carey 1986)和笔迹专家(Bruyer 与 Crispeels 1992)身上同样出现;整体加工效应在受训获得新物体专长的被试中也被复现(Gauthier 与 Tarr 1997;Gauthier 等 1998);面孔失认症病人过去被指只损面孔,但新证据显示许多病人对视觉相似的非面孔类别物体同样障碍(Gauthier、Behrmann 与 Tarr 1999b;Damasio 等 1982),甚至一位病人"对倒置面孔比正立面孔更好"的反常倒置效应曾被视为面孔模块的证据,直到另一位病人在鞋子上也表现出同样的反常(de Gelder 等 1998)。缺口由此清晰:Tovée (1998) 总结说,面孔加工系统是否"特殊",取决于颞下皮层的面孔细胞是否在 IT 内或别处没有处理其他物体的功能等价物——这正是本文要用猴的新数据去回答的。
研究思路
作者借用 Hay 与 Young (1982) 的框架把"特殊"拆成两个问题:一是特异性(specificity)——是否有特定脑区加工面孔;二是独特性(uniqueness)——面孔是否以本质上不同的方式被识别。文章的策略是分而治之:先综述猴面孔加工系统的解剖与两类面孔细胞(上颞沟上唇管注视与表情、TEa/m 管身份)的反应性质,给出与人脑的两个人类同源候选区(人 STS 对注视/嘴动,Puce 等 1998;梭状回对应 TEa/m);再围绕独特性与特异性两个问题,逐一引入新证据——受训猴的前颞下皮层出现了"专家物体细胞",其选择性在多个维度上可与面孔细胞等价。最后作者处理编码方式的争论(面孔的稀疏编码是否为面孔独有)与定位争论(专家物体细胞与面孔细胞是否在同一处),指出目前成像与单细胞证据方向竟然相反,需要猴 fMRI 这类新手段来仲裁。
方法
本文为综述性文章,核心新证据来自 Logothetis 与 Pauls (1995) 以及 Logothetis、Pauls 与 Poggio (1995) 的单细胞记录实验。被试为受训辨别两类人工同源类别的猕猴:wire-like(铁丝状)与 amoeba-like(变形虫状)物体(Fig 2),这些物体脱胎于人类心理物理学研究(Buelthoff 与 Edelman 1992)。任务范式:猴子注视中央光点后进入学习阶段,从任意指定的"零视角"观察目标物体;随后测试阶段开始,每个测试相最多 10 次试验,低音提示后呈现目标或干扰物(同类别或异类别)的一个明暗渲染静态视角,目标视角由物体绕垂直、水平、右斜、左斜四轴数学旋转生成;猴子须在目标出现时按右杆、干扰物出现时按左杆才获得强化。
当猴子完成任务后,作者在其前颞下皮层记录单细胞——绝大多数视选择性神经元的记录位点集中在前内颞沟(anterior mediotemporal sulcus, AMTS)周围。为确定驱动细胞反应的特征,Pauls (1997) 发展了系统消除、打乱或遮挡 wire 段的分解方法:把刺激复杂度逐级削减,看细胞反应何时塌陷。文中也特意交代了单细胞记录的方法学约束:一次只能听"一池放电细胞里的一只声音",无法大样本系统取样;即便在 TEa/m 区域也只有约 20% 的细胞对面孔反应,且测量到的选择性直接取决于刺激集(Mikami 等 1994 的刺激集里面孔照片远多于非面孔,所得"45% 的选择性细胞响应人脸"难以解读)。这些交代让读者对结论的边界心中有数。
主要结果
- 行为上,受训猴对新异物体的识别严格依赖视角:在绕深度轴偏离训练视角约 40° 以内可以泛化,超过即跌到机遇水平;不少 wire 物体在"镜像对称"的二维视角之间也能过判(偶然的自遮挡缺失所致)。有趣的是,画面内平面旋转最初也是视角依赖的,但训练几个回合后识别变得旋转不变(p8 段落)。
- 在前颞下皮层(主要在 AMTS 上唇附近)记录到一批对刚学会的物体-视角组合高度选择的细胞,其物体与视角选择性类似于面孔细胞:对中央 5° 范围内的平移不变,对线性尺寸大到 4 倍的变化不变(Fig 1 标注了记录位点,Fig 3 展示反应模式)。
- 刺激分解揭示了两种细胞:一些可被简单特征(如一个角度)激活,另一类则对整个配置极端敏感——哪怕只抽走一根 wire 段,反应也显著下降(Pauls 1997;Fig 3)。面孔细胞"整体构型不可拆"的标志性质,在专家物体细胞身上找到了对应物。
- 综述部分归纳的猴证据呈现清楚的分野:上颞沟上唇的细胞多编码注视方向与表情(对面孔比几何刺激敏感 2–10 倍,五类视角最优细胞,约 10% 能区分个体),损伤该处损害注视/表情知觉但不损面孔识别;TEa/m 下唇细胞编码身份,虽对视网膜位置泛化,但对面内旋转 90° 反应下降过半,且以分数式参与多个面孔的表征(Young 与 Yamane 1992)。TEa/m 群体被认为是人梭状回面孔区的最可能同源体(p5–p7 段落)。
- Logothetis 与 Pauls (1995) 还发现,将'大白物体'修受训物体。或'目标物体'。在基本水平(wire vs amoeba)判断时行为视角无关、在下位水平(区分两根 wire)判断时视角依赖——与人类"下位水平判别更吃视角"的证据平行(p14–15 段)。
图注解读
图 1 · 猴脑侧面观与 wire 选择性神经元的记录位点
原文图注:Fig. 1. Lateral view of a monkey's brain and location of the wire-selective neurons. A. Lateral view with the superior temporal sulcus (STS) opened up to illustrate various visual areas in the temporal pathway. V1, primary (striate) cortex; V2, V4, second and fourth visual areas; MT (or V5) middle temporal visual area; PMTS, posterior mediotemporal sulcus; AMTS, anterior mediotemporal sulcus; TEa/m areas within the inferotemporal cortex; TPO1/2 areas within the STS. B. Histological slice showing the anatomical site in which the wire/amoeba selective neurons were found: ec, entorhinal cortex, 35/36 areas 35 and 46 respectively (perirhinal cortex); rs, rhinal sulcus. The vertical line depicts the position of the coronal section shown in (B). The arrows depict approximately the borders of the corresponding areas.
A 面板把上颞沟"翻开"展示腹侧通路的各级视觉区(V1、V2、V4、MT/V5、PMTS、AMTS、TEa/m、TPO1/2),B 面板用组织学切片标出 wire/amoeba 选择性神经元实际所在的位置——AMTS 周边、近嗅皮层(ec)与鼻沟(rs)内侧的围嗅皮层(areas 35/36)。读图要点:这批"专家物体"位点比以往面孔细胞常在的区域更靠前、更腹侧,是后文讨论"面孔与专家物体定位是同一处还是分处"时的关键证据。

图 2 · wire 与 amoeba 类物体刺激示例
原文图注:Fig. 2. The wire- and amoeba-like objects used to study the neural representations that may be employed for recognising objects at the subordinate level. The exemplars of both classes are different barring the two within each white rectangle, which are two views of the same objects 90° apart. Recognising individual exemplars of these classes is not unlike recognising individual exemplars of other homogeneous natural classes. The wolves in the last row are all different barring those within the white rectangle. Again, the latter are two views of the same animal 90° apart. In each case, identification of a member requires excessive practice.
图的前几行是两类人工物体的众多例样,白色矩形框内是同一物体的两个相差 90° 的视角;最后一行以狼的照片作类比——同属一个同源自然类别的成员须靠部件形状与部件间配置的细微差别区分,逐一识别每个成员需要大量练习。这张图说明实验设计的核心选择:刺激是"同源类别"(共享公共部件及其一阶配置),而非 Tanaka 式的可凭单特征分辨的异类刺激,因此与面孔识别在任务结构上同构。

图 3 · 颞下皮层单细胞反应:wire、amoeba 与面孔细胞的比较
原文图注:Fig. 3. Responses of single units in the inferior temporal cortex of the monkey. The upper row shows responses to wire-like objects and the middle row to amoeba-like objects. The neuron responds best to a recently learned object-view and its response diminishes as the object is rotated in depth. For objects that the monkey could recognise from all vantage points more than one unit was found that responded to different views of the same object. Systematic decomposition of the wire objects showed that while some neurons could also be activated by parts of the object (e.g. an angle), others required the entire configuration, strongly diminishing their response even when only a single wire-segment was removed (Pauls, 1997). The bottom row shows responses of a face-selective neuron recorded in the upper bank of the STS. "Wire" and "amoeba" cells display view tuning similar to that of the face cells.
上排为对 wire 类物体、中排为对 amoeba 类物体的反应:神经元对刚学会的物体-视角组合反应最强,物体绕深度轴旋转时反应递减;能从全视角识别的物体则由多个单元分别负责不同视角。下排是对照——上颞沟上唇记录的面孔选择细胞,其视角调谐曲线与 wire/amoeba 细胞形态相似。这张图是全文实证结论的直观展示:三种细胞在视角依赖性上同构,支撑"面孔的编码方案也可用于其他类别"这一结论。

讨论
作者的解释框架是:面孔细胞在 IT 里的高比例(约 20%)与高度特化,可能不是因为面孔动了专用的"硬件",而是因为在猴的生活中,面孔恰是唯一需要在个体水平反复辨别的类别;一旦其他同源类别的成员也成为必须逐一记忆和辨认的目标,同样性质的配置选择性神经元就会积累出来。因此在编码方式上,面孔并不特殊,只是"默认的特殊"类别(default special class)。讨论也明确承认边界:单细胞记录的取样方式(后向前系统推进、一旦在 AMTS 找到专家细胞就不再回撤)意味着 AMTS 未必是专家物体细胞的唯一所在;AMTS 也未系统测试过面孔刺激;且记录范围仅覆盖后部与前部腹外侧颞叶,内侧颞叶或边缘结构中还可能有同类细胞。作者同时指出一个悖论:人类 fMRI 显示面孔与非面孔专家物体激活"同一批"脑区(定位上的关联),而猴单细胞显示专家物体细胞在面孔细胞典型区域之外(定位上的分离);但这两类方法空间尺度不可通约,若同一批细胞真的代管多类别,fMRI 反而会给出"分离"的假象——分辨两者需要猴功能成像(Logothetis 等 1999)介入。
在对话对象上,本文正面回应 Farah 等 (1998) 对面孔细胞作为"面孔特异证据"的引用和 Tovée (1998) 的判据(有无功能等价物),援引 Kobatake、Wang 与 Tanaka (1998) 训练猴识别 28 个中等复杂刺激后训练刺激响应细胞比例上升的发现,但强调那类刺激集不同源,只有同源类别(共享部件与一阶配置)的专长才最贴近面孔情形(Diamond 与 Carey 1986;Rhodes 与 McLean 1990)。作者还把人类 Greeble 专长成像的结果(Gauthier 等 1999a:专长训练招募中梭状回,但枕外侧回另有强专长效应且对面孔倒置的反应模式与面孔区相反)纳入视野,提出"颞叶内存在一个经验可塑的复杂区域系统",与面孔细胞分布于多个脑区的事实一致。
一句话总结
这篇文章把"面孔特殊性"这个二选一的问题拆成两部分来打,并给出猴子身上的强证据:配置选择性并非面孔独占,经验可以把任何同源类别的成员塑造成"准面孔"。我个人认为,它最重要的贡献其实是方法论的——提供了一套判断"某类别为何在脑内显得特殊"的判据(类别是否同源、任务是否个体水平、经验是否充足),后来围绕 FFA 的争论双方其实都在沿用这套游戏规则;至于"默认特殊"这个说法,我读作一种发展视角的论证而非结论,它把面孔的先天便利性与后天经验巧妙地捆绑在一起,留下了至今仍在争论的空间。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[A, B] - Fig2: 提取质量
good,对齐度full,识别面板[] - Fig3: 提取质量
good,对齐度full,识别面板[]