IT / 文献库

PAPER 263 / CLOSE READING

The distributed human neural system for face perception

语义审核:pass_with_minor_revisions · 图表审核:minor_issue

本文目录 (Table of Contents)
  1. 研究背景
  2. 研究思路
  3. 方法
  4. 主要结果
  5. 图注解读
    1. 图 1 · 猴面孔选择神经元的分布:8 项研究的位点与身份/表情双维分析
    2. 图 2 · 五项功能成像研究中梭状回面孔反应区的位置
    3. 图 3 · 单个被试的核心系统三区(面孔 vs 房屋)
    4. 图 4 · 延伸系统被面孔信息征用的三组证据
    5. 图 5 · 分布式面孔加工系统模型图
  6. 讨论
  7. 一句话总结
  8. 审校与证据追溯 (Verification & Evidence)
    1. 图表审计结果
    2. 关键事实与局限性声明

这篇综述提出了面孔认知领域引用最广的理论框架之一——"分布式面孔加工系统"模型,把 PET/fMRI、皮层内诱发电位与猴单细胞记录的证据整合成一张图:枕颞视觉皮层的三个双侧区构成"核心系统"(core system),负责面孔的视觉分析;空间注意、情绪、言语知觉与传记记忆等系统构成"延伸系统"(extended system),与核心区协同工作以从面孔中提取意义。模型的支柱是面孔的"恒常特征"(invariant aspects,决定身份)与"可变特征"(changeable aspects,如注视、表情、唇动,服务于社会沟通)分别主要由梭状回与上颞沟表征。读它等于拿到了理解此后二十年 FFA/STS 争论以及大量社交注意与情绪面孔研究的坐标系。

研究背景

作者开篇就调转了问题的重心:面孔知觉或为人类最发达的视觉技能,但"识别身份"并不是人们花那么多时间看脸的原因——大部分面孔观看发生在社会互动中,而表情、注视这些可变特征承载的社交信息,其加工水平可能比身份识别更发达。身份识别依赖于跨表情、跨眼嘴运动保持不变的结构特征;这种恒常表征必须与可变特征的表征相对独立,否则表情变化或说话时的嘴动就会误读成"换了个人"。这一区分早在 Bruce 与 Young (1986) 的认知模型里就有:结构编码(视角依赖,表征仍受观看条件与面部配置影响)之后分支进入身份、表情、言语唇动三条通道,再往后是姓名与个人信息的提取;行为证据也支持——熟悉性与重复启动促进身份任务却不促进表情任务。

另一侧的证据积累已久。人类神经心理学提供了面孔加工专门化的最初提示:面孔失认症(prosopagnosia,面孔失认症)病人对熟悉面孔的选择性识别障碍,损伤位于腹侧枕颞皮层、通常双侧,但个别记录完好的病例为右侧单侧损伤。猴的单细胞记录在 STS 与颞下皮层发现成团分布的面孔选择神经元,且 Hasselmo 等人的双维分析显示功能分离的迹象。缺口在于:功能成像虽然在人类腹侧皮层定位了多处面孔反应区——外侧梭状回、枕下回、后上颞沟——但"一个面孔区"(梭状回面孔区,fusiform face area, FFA,Kanwisher 等提出的模块化说法)与多点分布式证据之间如何组织起来、面孔的不同方面是否真的由不同脑区负责,尚无整合框架;甚至有一项对早期成像研究的 meta 分析(Farah 与 Aguirre 1999)找不到跨研究的一致性,提示需要在单个被试内做高分辨率比较。本文正是要填补这个组织学空白。

研究思路

作者的策略可以概括为"认知分解对齐解剖分解"。第一步,确立人类腹侧皮层面孔反应区的数目与稳定性(以被试内成像为主,回应 meta 分析的质疑);第二步,用注意操纵检验这些区域是否分工——这一步是全文的证据枢纽:在同一个 fMRI 实验里让被试注意注视方向或注意身份,看两类注意分别增强哪个区的反应,从而把 Bruce-Young 的认知分支直接映射到脑区上;第三步,把与面孔信息"协同工作"的认知系统(空间注意、情绪、言语、传记记忆)纳入模型,论证一个认知定义的功能(如唇读)并不对应某个专门化的脑区,而是表征视觉配置的区域与表征该配置之意义的区域共同活动的产物。模型由此同时具备分支结构(恒常 vs 可变)与层级结构(核心 vs 延伸)。

方法

本文为综述,不涉及新数据采集,但证据来源值得逐类说明。(i) 正常人的 PET-rCBF 与 fMRI 研究:对照条件包括观看无意义图形或非面孔物体(如房屋、椅子、工具),或性别判断作基线;定位刺激任务有被动观看、同时/延迟匹配、性别或职业判断(后者需要身份识别)。关键的注意实验来自 Hoffman 与 Haxby (2000):被试顺序观看静态面孔照片,在注视条件下判断当前照片的注视方向是否与前一张相同(无论此人是谁),在身份条件下判断是否与前一人为同一人(无论注视方向),比较两种注意对面孔反应区活动的调制。(ii) 癫痫手术病人的皮层表面电极诱发电位研究。(iii) 猴单细胞记录研究:8 项研究的面孔选择细胞位点汇总,以及 将“以及 Hasselmo 等 (1989) 用三只猴 × 三种表情的刺激集做的身份/表情双维分析”替换为“以及 Hasselmo 等对神经元身份与表情选择性及其解剖分布的比较分析”。图像展示手段上,作者用 C-Surf 软件对单个被试做皮层折叠、膨胀与展开处理,以"面孔 vs 房屋"对比呈现核心系统的三个区(Figure 3)。

主要结果

  1. 人类腹侧枕颞皮层存在三个双侧面孔反应区:外侧梭状回(通常双侧、右侧更稳定)、枕下回外侧部与后上颞沟(Fig 2、Fig 3)。枕下回区在解剖上腹邻梭状回区、背邻 STS 区,提示它可能是这两者的共同输入源。梭状回区的位置与房屋、椅子、工具等"邻近类别反应区"的拓扑排列在多个被试内研究中高度一致。值得注意的是,把注意引向注视方向会减弱梭状回对面孔的反应——这为"梭状回更多参与恒常特征"埋下伏笔。
  2. 皮层内诱发电位印证了多点分布:面孔特异的 N200(约 200 ms 锐负波)与 N700(约 690 ms 宽负波)记录于双侧腹侧枕颞皮层(最常在外侧梭状回,部分在颞下回/枕下回)与外侧颞皮层(后中颞回,恰在成像定位的后 STS 面孔区附近);另一面孔特异电位 P350(约 344 ms 宽正波)见于包括右前腹侧颞皮层在内的其他位点——后者可能与传记信息提取研究的激活区对应。
  3. 猴单细胞证据给出功能分离的解剖基础:对表情做差分调谐的细胞主要位于 STS,对身份做差分调谐的细胞主要位于颞下皮层(Fig 1b);STS 内的注视角度与侧脸角度敏感细胞相互混杂,且多数对特定注视方向的细胞也响应相容的侧脸角度。
  4. 人类面孔反应区之间存在功能性双重分离(Hoffman 与 Haxby 2000):注意注视方向时 STS 的反应强于注意身份时,注意身份时外侧梭状回的反应强于注意注视时;枕下回区的注意调制模式提示它在身份知觉中的作用大于注视知觉。这是"恒常-可变"两表征假设最直接的人类证据。
  5. 延伸系统各有实证:被动观看移开注视的面孔(相对直视面孔)使双侧顶内沟(intraparietal sulcus, IPS)及左 STS 显著更强激活(Fig 4a),且 Puce 等发现 IPS 只对眼动反应、STS 对眼动与嘴动都反应——顶内沟特异地参与由感知注视引发的注意转移;恐惧面孔一致地激活杏仁核(Fig 4b),MEG 显示由表情判断情绪先在约 140–170 ms 激活后上颞皮层、后在约 220 ms 激活右杏仁核,杏仁核受损病人对恐惧与愤怒等负性情绪的选择性识别障碍也吻合;无声唇读激活上颞回听觉言语区(该区同样被听到的言语激活,Fig 4c),说明唇读需要 STS 视觉唇动分析与颞上回音位分析的协调;名人/熟人面孔激活前中颞回(早期研究还见颞极),且该区也对名人姓名与熟悉的户外场景反应,提示其功能是传记性与自传性知识的表征。

图注解读

图 1 · 猴面孔选择神经元的分布:8 项研究的位点与身份/表情双维分析

原文图注:Fig. 1. Locations of face-selective neurons identified in single-unit recording studies in the macaque. (a) Summary of eight studies (reproduced, with permission, from Ref. 49). Each symbol represents the work of a different investigator. (See original article for references.) (b) Locations of neurons that were selective for facial expressions (open circles), identity (closed circles), both expression and identity (half-filled circles), showed an interaction between expression and identity (squares), or were selective for neither (triangles) in the study by Hasselmo et al.29

(a) 部分把 8 项研究记录到的面孔选择细胞位点叠加在猴脑解剖标记上(CS 为中央沟、STS 为上颞沟、IOS/PMTS/AMTS/ITS 为各沟回标记,图中另标注 2.0–4.5P 等前后坐标分段);(b) 部分按 Hasselmo 等的编码区分选择类型:空心圆=表情、实心圆=身份、半实心圆=两者、方块=交互、三角=两者皆非。读图要点是空心圆偏 STS 上侧、实心圆偏腹侧颞下皮层——这正是"表情在 STS、身份在颞下皮层"双重分离的原始解剖图,支撑主要结果第 3 条与模型中 STS/梭状回的分工假设。

Figure 1

图 2 · 五项功能成像研究中梭状回面孔反应区的位置

原文图注:Fig. 2. Locations of face-responsive regions in the fusiform gyrus from five functional neuroimaging studies. The PET–rCBF study by Haxby et al.33 and the fMRI study by Clark et al.32 contrasted activation while viewing faces with activation while viewing nonsense pictures. The PET–rCBF study by Sergent et al.12 contrasted activation during a facial identity discrimination task (actor versus non-actor) with activation during a gender discrimination task (male versus female). The fMRI studies by Kanwisher et al.6 and McCarthy et al.7 contrasted activation while viewing faces with activation while viewing non-face objects. Note that the figure from Kanwisher et al.6 also shows the location of the inferior occipital face-responsive region.

这张图把五项研究的梭状回面孔反应区画在同一解剖参照下:两项 PET(Haxby 等:面孔 vs 无意义图形;Sergent 等:身份判断 vs 性别判断)与三项 fMRI(Clark 等:面孔 vs 无意义图形;Kanwisher 等、McCarthy 等:面孔 vs 非面孔物体)。读图方法是看各研究激活点的聚拢程度:尽管对照任务各异,位置却高度重合,且多偏右半球。这支撑主要结果第 1 条,也是对"跨研究一致性找不到"质疑的正面回应——一致性需要被试内高分辨率比较才可见。

Figure 2

图 3 · 单个被试的核心系统三区(面孔 vs 房屋)

原文图注:Fig. 3. Cortical regions that comprise the core system for visual analysis of faces from a single subject. The data are from Subject TB in Ref. 5. Regions shown in red to yellow responded more to faces than to houses. Regions shown in blue responded more to houses than to faces. The upper figures are lateral views of the folded cortical surface. The next row of images shows the cortical surfaces of each hemisphere tilted back 45° to show both the lateral and ventral surfaces of the temporal lobe. In the next images, the cortical surfaces are inflated to show the cortex in the sulci, indicated by a darker shade of gray. The lower images show the entire cortical surface of each hemisphere flattened into a two-dimensional sheet. Cortical rendering and flattening was done using C-Surf software (Boston, MA). Note that all three face-responsive regions are bilateral in this subject.

四行图像依次是:折叠皮层侧面观、后倾 45° 以同时显示颞叶外侧面与底面、膨胀皮层(沟内以深灰显示)、全皮层展开成二维平面。红到黄色为面孔大于房屋的区,蓝色为房屋大于面孔的区。读图关键是数"红色块":该被试的三个面孔反应区——枕下回、外侧梭状回、后 STS——都呈双侧出现,而蓝色(房屋优势)位于腹侧偏内的梭状回/海马旁回一带。这是核心系统模型的解剖实证图,支撑主要结果第 1 条,也直观展示了"面孔区与邻近类别区拓扑相邻"的论证。

Figure 3

图 4 · 延伸系统被面孔信息征用的三组证据

原文图注:Fig. 4. Activation of other neural systems to process the meaning of information gleaned from the face. (a) The intraparietal sulcus (arrows) is activated by perception of averted gaze9. (b) The amygdala is activated by perception of fear in the face of another. (Reproduced, with permission, from Ref. 17.) (c) Lip-reading activates auditory superior temporal regions that are also activated by hearing speech. (Reproduced, with permission, from Ref. 14.)

三个面板对应延伸系统的三条通道:(a) 移开注视(相对直视)面孔激活顶内沟(箭头所示),对应空间注意通道;(b) 观看他人恐惧表情激活杏仁核,对应情绪通道;(c) 无声唇读激活的颞上回听觉区与听言语时激活的相同,对应言语通道。这三幅图(皆引自已发表研究)是"核心系统之外的区域协同参与面孔意义加工"主张的原始证据,支撑主要结果第 5 条的三个分项。

Figure 4

图 5 · 分布式面孔加工系统模型图

原文图注:Fig. 5. A model of the distributed human neural system for face perception. The model is divided into a core system, consisting of three regions of occipitotemporal visual extrastriate cortex, and an extended system, consisting of regions that are also parts of neural systems for other cognitive functions. Changeable and invariant aspects of the visual facial configuration have distinct representations in the core system. Interactions between these representations in the core system and regions in the extended system mediate processing of the spatial focus of another's attention, speech-related mouth movements, facial expression and identity.

这是全文的总结性框图。核心系统一侧:枕下回(面部特征的早期知觉)向下分出外侧梭状回(恒常特征——独特身份的知觉)与上颞沟(可变特征——注视、表情与唇动的知觉);延伸系统一侧:顶内沟(空间注意指向)、杏仁核/脑岛/边缘系统(情绪)、听觉皮层(言语前阶段语音知觉)、前颞叶(个人身份、姓名与传记信息),分别与核心系统的相应表征交互,实现对他人注意焦点、言语相关嘴动、表情与身份的加工。读图时抓住两条线:恒常/可变的分支,以及核心/延伸的层级——后者意味着同一个脑区可以同时属于多个功能系统,支撑"认知功能由多区协调实现"这一核心主张。

Figure 5

讨论

作者在讨论里首先与 Bruce-Young 认知模型划清同异:共享其分支结构,但做出两处修订——表情、注视方向与言语唇动共享一个独立于身份表征的"可变特征"表征(而非三条平行通道),且面孔加工过程是"表征视觉配置的区域"与"表征该配置意义(如情绪显著性)的区域"之间的活动整合,认知模型只讲到分支、没讲到整合。作者同时坦承功能分离的程度并不清楚:梭状回可能在表情知觉中起支持作用(有些人有专属的招牌表情,如歪嘴笑),延伸系统的杏仁核与顶内沟也可能具备一定的面孔视觉分析能力——分离是"更多参与"而非全或无。在模型之外,本文用两个 Box 处理了当时的两个争论。Box 1 对"面孔区是否只为面孔"给出宽和的回答:猴面孔反应区仅约 20% 或更少的细胞面孔选择;人类面孔区对动物(甚至脸部被遮挡的动物)也强烈反应,尽管反应的空间分布模式与面孔不同;据此 Gauthier 等的专长假说——面孔区服务的是"把物体当作独特个体在个体水平上识别"的知觉过程——被作者正面纳入,"面孔区"这个名字本身在其框架下反而显得狭隘。Box 2 处理面孔倒置悖论:认知上倒置面孔的识别损害远大于倒置的普通物体,面孔失认症病人对倒置面孔却几乎无损;但三项 fMRI 研究发现倒置对面孔区反应的削弱很小、在枕下回面孔区甚至反而增强,且房屋倒置在房屋优势区产生方向与幅度相当的效应,倒置面孔倒是在房屋优势区引发了大幅增强——作者的调和方案是:倒置面孔仍有效动员面孔系统(识别"这是一张脸"并尝试读取其独特性),尝试失败时征用邻近物体加工区作为补充资源,这同时解释了倒置面孔为何"像物体一样被加工"以及病人为何对倒置面孔无损。文末的"悬而未决"清单(枕下回的角色、注视/表情/唇动在 STS 内是否等价、面孔表征如何随学习改变、加工的时间顺序与反馈)大致划定了此后十年的研究议程;作者也承认,本综述引述的交互证据多是"邻近激活"式的,区域间交互的测量与建模仍是必需的下一步。

一句话总结

这篇综述的贡献与其说是提出模型,不如说是给一片散点状的人类成像结果装上了组织原则——"恒常对可变"提供分支,"核心对延伸"提供层级,而面孔失认症、猴单细胞与皮层内电位三类异质证据都被安放进同一个骨架。以我的理解,它最经得起时间考验的主张其实是那句"认知功能没有专属脑区、只有多区协同":FFA 的模块论者与分布表征论者后来二十年争的,本质上是这句话里"协同"该算松耦合还是紧耦合;而 Box 2 对倒置悖论的处理,即使以今天的眼光看也仍然是一个漂亮的、可证伪的功能解释。


审校与证据追溯 (Verification & Evidence)

图表审计结果

  • Fig1: 提取质量 good,对齐度 full,识别面板 []
  • Fig2: 提取质量 good,对齐度 full,识别面板 []
  • Fig3: 提取质量 good,对齐度 full,识别面板 []
  • Fig4: 提取质量 good,对齐度 full,识别面板 []
  • Fig5: 提取质量 good,对齐度 full,识别面板 [A]

关键事实与局限性声明