这篇文章用回波平面功能磁共振成像(functional magnetic resonance imaging, fMRI)回答一个当时颇具争议的问题:被认定为"面孔特异"的腹侧颞叶区域,会不会在完全没有面孔的实验里被激活出来。作者只用非面孔物体,操纵被试识别它们的分类水平(基本水平 vs 下位水平),结果仅靠这一任务操纵就在 8 名被试全部身上激活了所谓"面孔区"。它值得读,是因为它是"面孔区并非面孔专属,而可能与细粒度/专长加工有关"这条研究线的早期直接实验证据,也树立了"评估模块假说必须操纵任务需求"的方法论立场。
研究背景
面孔识别研究从诞生起就与脑的模块化(modularity)理论绑在一起:如果脑中存在一个专门负责面孔识别的系统,那就是"领域特异性"(domain specificity)的绝佳例证。九十年代中期的神经影像研究(Kanwisher、Puce、Sergent 等人的工作)与神经心理学证据(颞叶腹侧损伤导致的面孔失认症 prosopagnosia)一起,把包括梭状回与下颞回一部分的区域(fusiform and inferior temporal gyri, FIT)指向为对面孔比非面孔更特异的地带。但作者逐一检视这些研究后指出一个系统性偏向:这些设计几乎都拿被动观看面孔与观看非面孔物体作比较,而这种"不同类别间比较"的范式,结构上只能得出支持领域特异模块的结论。
缺口在于一个被普遍忽略的混淆变量:识别的分类水平。认知心理学早已确立,常见物体首先在"基本水平"(basic level,如"鸟")被识别,这与日常功能需求相符;而"下位水平"(subordinate level,如"鹈鹕")的通达需要额外的知觉加工。面孔则相反——我们日常总是习惯性地在个体(下位)水平上识别面孔,这一加工高度自动化。因此当一项研究比较"看面孔"与"看非面孔"时,它同时比较了刺激类别与分类水平,面孔组激活更强并不能归因于"因为它们是面孔"。作者还注意到两个反向线索:面孔失认症病人常伴随非面孔物体下位水平加工的普遍障碍;而 Kosslyn 等 1995 年的 PET 研究用线条画做"下位减基本"的减法,却没能发现下颞叶激活——作者推测其失败原因包括线条画省去了精细知觉加工、同时间内基本判断次数多于下位判断、以及基线与实验任务共用的词产生了启动效应。
研究思路
作者的总体策略是把"刺激类别"与"分类水平"这两个变量解耦:整个实验只用非面孔物体,在同一张图片上操纵被试对它做基本水平还是下位水平的判断。改为:同一图片设计排除了条件间的图片物理差异;双重减法进一步控制共同的词汇和语义成分,使剩余差异与下位水平视觉识别所需的附加加工相联系,但仍不能证明唯一机制或因果关系。设计上他们针对 Kosslyn 等 PET 研究的三个疑似缺陷逐一改良:改用灰度阴影图片而非线条画,以保留下位判断所必需的细粒度知觉加工;让同一图片同时配有基本水平与下位水平标签;并为视觉任务和语义任务分别生成词表,在词长、词频与语义任务反应时上匹配,以控制词汇提取这个混淆源。
逻辑链很清楚:如果仅仅操纵分类水平就能激活先前用"面孔 vs 非面孔"定义出的那个区域,就有两个后果——第一,用组平均方法定义的"面孔特异区"其实并不特异于面孔;第二,任何把面孔/非面孔比较与分类水平混淆在一起的研究,都不能被无争议地解读为面孔特异性模块的证据。用作者自己的话说,用非面孔物体操纵任务需求,是这类强模块假说唯一可能被证伪的途径。
方法
8 名神经正常被试(5 名右利手、3 名左利手)参加实验。成像在 1.5 Tesla GE Signa 扫描仪上进行,采用单次激发梯度回波回波平面序列,每个重复时间(TR 1547 ms,TE 60 ms)采集 6 个轴斜位切片,每层 128 幅图像;分析集中于包含腹侧颞叶皮层的两层切片。被试完成两个任务、各含两个水平:视觉任务是判断呈现的图片与同时出现的词是否匹配(如图片配"BIRD"或"PELICAN"),语义任务是判断该物体能否靠自身力量移动。刺激在屏 2000 ms、试验间隔 750 ms,72 张灰度图片各重复 4 次(每水平各两次、匹配与不匹配标签各半),以 16 秒的区组为单位重复 3-4 轮。两个任务的词表在平均词长、词频与语义任务反应时上匹配,动物类条目数相近(视觉任务 17 个、语义任务 21 个),其余为车辆、家具等常见物体。两项行为预实验(各 20 名被试)确认所选刺激存在基本水平优势:视觉任务基本水平反应时 849 ms、下位 995 ms(t = 10.6),正确率 97% 对 88%;语义任务也有类似差异,且作者强调这一难度差异本就是两个水平定义的一部分。
数据分析为体素级 t 检验:把数据对半分,两个半区 t 值均不低于 1 且与至少两个同样超阈值的体素相连者判为激活;用模拟激活构建 ROC 曲线估计该方法约 2% 体素为误报、76% 真实激活被正确识别。数据先用 SPM96 做运动校正,再用分段线性形变把各被试配准到共同坐标系后取平均。感兴趣区(region of interest, ROI)按解剖标志逐被试划定:枕叶皮层(OCC)、舌回(lingual gyri, LIN,与面孔区仅有空间而非功能关系)、FIT 以及颞极(temporal poles)。主要分析手段有二:一是对各 ROI 超阈值激活体素数做 ANOVA(简单减法为 2×2×2 设计,双重减法为 2×4 设计),二是跨被试平均后的双重减法 [视觉(下位-基本) − 语义(下位-基本)],用以剔除视觉任务中词汇与语义加工的贡献。
主要结果
- 视觉任务的"下位减基本"减法显示,8 人中 7 人 FIT 出现激活(6 人双侧、1 人仅左侧),第二活跃区是枕叶(仅 4 人、全部在左半球);语义任务的同型减法则相反,OCC 最活跃(7 人),FIT 退居第二(6 人,2 双侧、2 左、2 右)——见图 2。
- 对激活体素量的 ANOVA 发现显著的 ROI×任务交互(F(1,7) = 6.2, p < 0.05):OCC 在语义任务中的激活量显著大于视觉任务(作者推测被试可能用了视觉表象策略,下位词指定了更精细的视觉信息),而 FIT 在两任务间无显著差别——见图 3。
- 还有一个半球主效应(F(1,7) = 7.1, p < 0.05)及与 ROI 的交互:左半球激活量整体大于右半球,而右半球内 FIT 大于 OCC。作者因被试在利手与性别上高度异质而不去解读这一差异。
- 双重减法在全部 8 名被试中得到 FIT 激活;跨被试平均后的激活位置与既往研究定义的"面孔特异区"高度吻合,尤其匹配 Allison 等报告 N200 面孔特异性头皮电位的区域;颞极也被激活,8 人中 7 人(5 双侧)——见图 4。
- 对四个 ROI 的 ANOVA 显示 ROI 主效应显著(F(3,21) = 4.5, p < 0.02,伴半球交互):Scheffé 检验表明 FIT 的激活量双侧均大于 OCC 与颞极,FIT 大于 LIN 的情形仅见于右半球。无论按逐被试体素计数还是跨被试平均图,两种方法都支持同一结论。
图注解读
图 1 · 实验任务流程示意
原文图注:Illustration of task procedure. For both tasks (visual and semantic), the stimuli (a word or a word and a picture) remained on the screen for 2,000 ms with an intertrial interval of 750 ms. Both tasks shared the requirements of reading and accessing the meaning of the word and the response components (responding 'yes' or 'no' by pressing one of two buttons). Trials were randomized for each subject.
读这张图先看左右两栏的对应关系:视觉任务与语义任务呈现同一组"BIRD/PELICAN"式标签,差别只在于屏幕上是否同时出现图片、以及判断标准(图词匹配 vs 能否自主移动)。图中用"6 个基本水平试验"与"6 个下位水平试验"的加减号组合表达了核心设计——下位减基本——并标注 16 秒区组、32 秒任务块、重复 3-4 次、每层 128 幅图像。它支撑的是方法部分对任务的描述:两任务共享词汇通达与按键反应成分,唯一的系统性差异是分类水平与是否需要看图,这正是后文所有减法逻辑的前提。

图 2 · 两个任务的下位减基本激活分布
原文图注:Distribution, averaged across eight subjects, of positive and negative neural activation during the visual and semantic tasks for the 'basic subtracted from subordinate' comparison (t = ± 0.2; cluster size = 11). The figure includes a schematic representation of the regions of interest: FIT, lingual gyri (LIN) and occipital cortex (OCC). Yellow corresponds to the highest activation satisfying the activation criteria. A lower threshold is used here than for the double subtraction (although the region of interest analysis is based on the same threshold for all comparisons) in order to illustrate the absence of negative FIT activation in the semantic task, which could have produced some positive FIT activation in the double subtraction.
图按视觉任务与语义任务两栏排布,右、左半球分列,三个 ROI(FIT、LIN、OCC)以示意图勾出边界,黄色代表满足激活判据的最高激活。注意阈值取得比双重减法低(t = ±0.2),作者特意说明这是为了展示语义任务中 FIT 并无负激活——排除"双减法里 FIT 的正激活只是负激活抵消的伪影"这一可能。这张图对应主要结果第 1 条:视觉任务下激活集中在 FIT,语义任务下转移到 OCC,方向性对比一目了然。

图 3 · 三 ROI 激活体素量的组间比较
原文图注:Mean activation level (number of voxels above threshold; t = ± 1; cluster size = 3) in the three regions of interest — FIT, OCC and lingual gyri (LIN) — for the visual and semantic tasks. Asterisks indicate the regions of interest (FIT and OCC) in which the volume of activation above threshold was significantly different from zero across subjects (by t tests, p < 0.05). Note that the experimental design predicted only positive activation (because subordinate-level access is thought to be inclusive of basic-level access). Indeed, volumes of negative activation were small and not significantly activated across subjects.
纵轴是超阈值(t = ±1、成簇 3 个体素)激活体素数的均值,横轴按 FIT、OCC、LIN 三个 ROI 分组,每组内有视觉-右、视觉-左、语义-右、语义-左四根柱,星号标记跨被试 t 检验下显著异于零的 ROI。要点是 FIT 柱在两个任务间高度相当,而 OCC 在语义任务下明显更高——这正是 ROI×任务交互(F(1,7) = 6.2)的图形呈现。图注还交代了一个设计预期:由于下位通达被认为包含基本通达,理论上只应出现正激活,实际负激活体积确实很小且不显著。

图 4 · 双重减法的平均激活分布
原文图注:Distribution, averaged across eight subjects, of positive and negative neural activation in the [visual (subordinate – basic) – semantic (subordinate – basic)] double subtraction (t = ± 0.3; cluster size = 11). As well as the three regions of interest depicted in Figure 2, the figure includes a schematic representation of a fourth ROI (temporal poles, TPOL) included in the analysis for the double subtraction.
这张图是全文结论的落点:把视觉任务的(下位-基本)再减去语义任务的(下位-基本),剩下的是"看图做下位判断"独有的加工。图中新增了第四个 ROI——颞极(TPOL)。激活落在 FIT 与颞极,而这两处正是既往文献定义面孔特异加工的区域。阈值 t = ±0.3、成簇 11 个体素。它支撑主要结果第 4 条:8 名被试无一例外在 FIT 出现激活,且平均位置与既往"面孔区"及 N200 面孔电位源区吻合。

讨论
作者在讨论里先区分了"模块性"的两种用法。极端的(福多式、系统级)观点认为面孔识别系统在功能上独立、解剖上分离,以质上不同的方式加工视觉信息,快速且强制性地被面孔引发,其发育主要由内生因素决定——这正是本文瞄准的观点。另一种在生理文献中常见的用法只描述相似反应特性神经元的空间聚集:下颞叶由约 0.4 mm 宽的柱组成,各柱细胞对相似复杂视觉特征(如面孔)起反应。作者指出后者与前者的解读之间隔着大量未决问题,且近期发现提示曾被当作特异性特征检测器的 V2、V4、MT 神经元可能其实是通用分析器。最有力的类比来自 Logothetis 等:训练猴子在下位水平识别新异的"回形针"物体,可在下颞叶找到与面孔细胞同等物体选择性和视点选择性的细胞——而没人会为一个"回形针模块"辩护。
作者承认的局限同样清楚:他们不是说分类水平这一个因素就能解释面孔与非面孔之间的所有分离,恰恰相反,他们希望未来研究去操纵专长水平、类别中形状相似范例的多少、范例对知觉者的社会或个人价值等其他维度;被动观看(乃至麻醉下观看)不适合检验模块假说,因为面孔的下位识别可能尤其自动化;组平均方法也掩盖了个体差异——某一被试的面孔敏感皮层只占组平均"面孔区"的一小部分,所以面孔区与下位水平区应当在同一被试内比较。由于同一图片在两个水平条件中出现,结果不可能源于刺激的物理或经验差异,也不能归因于任务指导语。作者的结论是:部分腹侧颞叶皮层可能沿着视觉识别的一般维度(如分类水平)而非类别边界来组织。
一句话总结
我认为这是"面孔区 = 专长细粒度加工区"这条研究线的奠基性实验之一:只用 8 名被试、两层切片和相当保守的阈值,却用一个干净的水平操纵撬动了面孔模块的强版本。它真正留给后来者的方法论遗产是——影像里看到的激活差异可能反映任务/加工水平的差异而非刺激类别的差异,任何"面孔 vs 非面孔"的组间比较在解释模块化之前都得先过这一关。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[] - Fig3: 提取质量
good,对齐度full,识别面板[] - Fig4: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 审校纠偏: 把解剖学FIT激活及组平均空间相似性直接表述为个体“面孔区”被激活。
- 审校纠偏: 把BOLD对比差异唯一归因于下位水平视觉加工,忽略词汇、语义、任务难度及减法模型的限制。
- 审校纠偏: 把本文提升为“面孔区等于专长细粒度加工区”的证据;本文没有直接操纵专长。
- 审校纠偏: 由任务相关fMRI激活推导功能机制时使用近似因果措辞;本研究支持关联和替代解释,不建立因果关系。
- 补充要点: LIN在视觉和语义任务中均未可靠激活,并因激活显著较少而被排除出简单减法ANOVA。
- 补充要点: 实验预测下位条件应产生正向激活;实际负向激活体积很小,且跨被试不显著。
- 补充要点: 双重减法是用于控制视觉任务中词汇和语义加工差异的分析策略,而不是这些混淆因素已被完全消除的证明。
- 补充要点: 原文明确要求未来在同一被试内比较独立定位的面孔敏感区与下位水平加工区;本文没有完成这种个体内验证。
- 补充要点: 3名左利手被试在双重减法中均出现双侧颞极激活,可能影响颞极侧化解释。