一句话定位:这篇文章用 fMRI 在正常人腹侧枕颞皮层里寻找一个对"建筑物"类刺激特化反应的脑区——结果在右侧舌沟前端、海马旁回后方找到了它,并用三个实验系统地排除了低层视觉特征、任务难度、块设计顺序等替代解释。它与同年的梭状回面孔区(fusiform face area)、词区研究一起构成了"腹侧皮层按刺激类别模块化组织"这一框架的关键拼图,文中提出的"Hebbian 学习+环境塑造"解释也预演了此后关于文化性类别区如何形成的长期争论。
研究背景
到 1998 年,"视觉客体加工由按刺激类别组织的特化神经解剖子系统承担"已有相当扎实的证据。最著名的是人类外纹状皮层的面孔区:既有来自神经影像(Kanwisher 等 1997;McCarthy 等 1997)与神经心理学(Moscovitch 等 1997)的决定性证据——梭状回局灶病变可造成单纯的面孔识别障碍即面孔失认(prosopagnosia),该区神经元对面孔的反应也强于任何其他类别(Allison 等 1994;Puce 等 1995, 1997;Kanwisher 等 1997);词识别区的证据虽略欠完整但同样存在(Warrington 与 Shallice 1980;Shallice 与 Saffran 1986;Allison 等 1994;Polk 与 Farah 1998)。作者追问的是:这种"一类刺激一个区"的组织方式,是否延伸到了一个常被忽视的类别——地标与建筑?
神经心理学这边恰好留了一个口子。有一类患者表现出地形定向障碍(topographical disorientation)中的一种亚型,即地标失认(landmark agnosia):他们多在右侧内侧枕叶病变后,难以利用环境中显著的特征认路,且在辨别测试中主要受损的是对街景、风景、纪念碑尤其是建筑物的感知与识别(Hécaen 等 1980;Takahashi 等 1989;McCarthy 等 1996;Rocchetta 等 1996)。关键在于这种障碍可以与其他识别障碍分离:面孔失认或一般物体失认可以不伴发地标失认(Tohgi 等 1994),地标失认患者也并不普遍同时具有这两类障碍(Hécaen 等 1980);他们病后还常改用门把手、邮箱、公园长椅这类低显著性特征来认路。由此可以提出一个朴素假说:存在一个特化于"具有定向价值(orienting value)的视觉刺激"感知的皮层区;由于建筑在城市环境里地标价值极高(Lynch 1960),这个区应当对建筑物刺激反应最强——正像面孔区和词区之于各自类别那样。缺口是:这一假说从未在正常人身上用影像学检验过,而 fMRI 的"选择性反应"又有太多平凡解释(低层特征、类别内辨别难度、块设计的顺序伪影),必须逐一排除。
研究思路
作者的总策略是"初筛定位,然后反复拷问"。实验 1 用带检测任务的块设计扫描,在双侧腹侧外纹状皮层内搜寻候选区,并设了两道偏置闸门:候选体素必须既对建筑物强于对一般物体(排除对所有物体一视同仁的区),又强于对面孔(排除只做类别内下位辨别的区,Gauthier 等 1997 的下位类别化假说)。实验 2 换成被动观看,把建筑物刺激做成几种加工版本——黑白二值化(thresholded)、打乱重组(scrambled)、相位随机化(phase-randomized)——再配上汽车刺激,用来分别检验"只对特定纹理/空间频率反应""对刺激集合的新异性或多样性反应"这类低层解释;选汽车做对照尤其巧妙:它与建筑同属大型无生命物体、同样常见于街景,却几乎不充当地标(位置相对路径点不断变化)。实验 3 则改为事件相关(event-related)fMRI 设计,刺激随机呈现,从根上消除实验 1、2 中块呈现带来的顺序与状态混淆(如总体唤醒、预期、厌倦),同时作为对建筑选择性的独立重复。三步之间还嵌着一个隐含的对照设计:同批数据里检出的面孔敏感区(与建筑区解剖上毗邻但分离)构成影像学"双重分离",使"建筑区其实在做别的什么"这类解释更难成立。
方法
被试共 12 名对假说不知情的参与者,2 名因头动被剔除、1 名只做了实验 3 后退出,报告的为其余 9 人(5 女,均右利手,平均 27 岁,18–38 岁);其中 3 人只参加实验 1,其余 6 人在相隔数天至数周的两个扫描日完成全部三个实验补注:'(S9 例外)'。扫描用 1.5T GE SIGNA 平面回波采集 BOLD 信号(TR 2000 ms,TE 50 ms,层内 3.75×3.75 mm、层厚 4 mm,10 个轴位层完整覆盖腹侧外纹状皮层);数据做运动校正、不做空间平滑以保留解剖分辨率,展示时转换到 Talairach 标准空间。面孔刺激描述补'含耳部';方法或实验3描述中补一句:实验3另有倒置面孔作为第四刺激类(本文未对其做对比分析)。、建筑与汽车(费城城区实拍、去除背景)、一般小型可持握无生命物体;实验 2 由此派生二值化、打乱与相位随机化版本。实验 1 与实验 3 为检测任务:扫描前先学习每类各一幅目标图,扫描中若出现与所学者相同的图即双手按键(目标约占 11%);实验 1 以 30 秒块呈现(每图 3000 ms,每块 10 图),实验 3 以每 16 秒一图的伪随机事件相关设计呈现;实验 2 为被动观看。分析上,将实验 1 检出的建筑敏感区作为感兴趣区(region of interest,ROI),取区内平均时间序列做一般线性模型(噪声按实验室实测的 1/f 幂谱建模、用经验血流动力学函数),个体内做固定效应检验,跨被试用混合效应模型(把每人的参数估计换算成百分比信号变化后做配对 t 检验,自由度 4),多重比较经 Bonferroni 校正;对实验 3 中未在原 ROI 复现的被试,另做事后检验(ROI 扩为半径 2 个体素的球、共 33 个体素)以排除跨扫描日配准误差造成的假阴性。
主要结果
- 实验 1 检出候选建筑敏感区,位置跨被试一致。三名初筛被试中两人(S1、S2)的敏感体素骑跨右侧舌沟(lingual sulcus)前端、紧邻海马旁回之后;随后六人中的五人也在聚焦 ROI 内通过双重标准,位置"接近或位于舌沟前部、在海马旁回后方 5–15 mm",唯 S8 的体素略靠前、在侧副沟内。改为:坐标约为 (x, y, z) = (20.6±5.0, −53.8±6.7, −9.2±3.9),并注明 OCR 文本层中负号丢失、y/z 的负号系据原文语义还原;面孔区右侧均值坐标补 x=29.0±5.6。区内平均百分比信号变化:建筑 3.29、一般物体 0.29、面孔 −0.16(图 2、图 3)。
- 面孔区同批检出且与建筑区分离。9 人中 6 人有面孔敏感体素,其中三人在右侧梭状回、位于建筑敏感体素的下外方,均值坐标 y=−70.0±19.0、z=−17.3±2.3(x 值同样失真);S6 仅左侧有。全部被试中未发现对一般物体的反应大于建筑与面孔两者的体素(图 2)。
- 行为上面孔稍难,反证"难度"解释。建筑与物体加工的检测 d′ 与反应时优于面孔(d′:面孔 3.36、建筑 3.63、物体 3.68;反应时:1057、930、891 ms;类别效应 ANOVA p=0.042 与 0.002),即建筑反应更强并非因为建筑刺激更难辨别(表 1)。
- 实验 2 排除低层解释。灰度建筑强于汽车:5 人中 3 人个体显著,群体 t(4)=5.17、p=0.003;二值化建筑强于打乱版(排除"只对特定纹理反应"):3/5 人显著,群体 t(4)=2.56、p=0.031;两名做了相位随机化的被试(S7、S8)内建筑显著强于相位随机版(排除"只对特定空间频率反应"),因自由度不足未做群体检验。以注视为基线的百分比变化:建筑 4.06、二值化建筑 3.50、汽车 2.27、打乱建筑 1.45、相位随机化 −0.22——汽车的反应几乎只有建筑的一半,但仍是除建筑外最强的一类(表 2)。
- 实验 3 在随机事件相关设计下复制主结果。建筑强于一般物体 t(4)=2.93、p=0.021,强于面孔 t(4)=2.92、p=0.022;S5、S6、S8 三人个体显著,建筑诱发的试次平均信号形似 BOLD 血流动力学反应函数,符合"刺激后短暂神经活动"的预期;事后检验在 S7 原区前方一个体素处确认显著性,S4 在搜索区内无显著反应(图 4、表 2)。
图注解读
图 2 · 实验 1:候选建筑敏感与面孔敏感体素的检出
原文图注:Figure 2. Results from Experiment 1. Shown in gray are axial brain slices in standard (Talairach) space, arranged inferior to superior for seven subjects. Images are displayed using the radiologic convention (left is on the right). The yellow overlay indicates the intersection of the region of interest, defined a priori to include ventral extrastriate cortex, and the locations where adequate fMRI signal was present to test hypotheses. The green overlay is a restricted region of interest guided by the initial subjects who performed Experiment 1 (S1 and S2) and our a priori hypotheses derived from the topographical disorientation literature. As the regions were defined upon the anatomical images collected for each subject in their native spatial frame, the conversion to standard space results in a slightly irregular appearance of the mask. Shown in red are those voxels that evidenced significantly greater fMRI signal during the presentation of buildings as compared with faces and general objects. Shown in blue are voxels that passed analogous tests for faces.
七个被试(自下而上排列)的轴位标准空间切片,按放射学约定展示(图上左侧对应大脑右侧)。读图分四层颜色:黄色是先验定义的腹侧外纹状皮层 ROI 与信号质量合格范围的交集(搜索域);绿色是受初试被试与地形定向障碍病例文献引导的聚焦 ROI(重点拷问域);红色是"建筑>面孔且建筑>一般物体"双重检验通过的体素;蓝色是面孔版同款检验通过的体素。看图要点:红点在多数被试中落在右侧舌回前部/舌沟一带,蓝点则在其下外侧的梭状回——两类类别选择性体素同图并现而位置分离,这就是讨论里所说影像学"双重分离"的直观呈现。它支撑主要结果第 1、2 条。

图 3 · 建筑敏感体素的解剖定位
原文图注:Figure 3. Anatomic Location of Building-Sensitive Voxels. Shown on the left is an axial tissue section of the ventral human brain (adapted from Duvernoy, 1991). Shown on the right are data from three different subjects from Experiment 1. These subjects were selected because of the relative clarity of the sulcal structures in their T1 MRI images. Abbreviations: HIP, hippocampus; PHG, parahippocampal gyrus; SLG, superior lingual gyrus; ILG, inferior lingual gyrus; CC, collateral sulcus; and LC, lingual sulcus.
左半幅是取自 Duvernoy(1991)解剖图谱的人脑腹侧轴位组织切面,右半幅是三名被试的 T1 像与实验 1 数据;缩写对照:HIP 海马、PHG 海马旁回、SLG 舌上回、ILG 舌下回、CC 侧副沟、LC 舌沟。这张图的读法是"以沟回为标尺核对激活":建筑敏感体素骑跨舌沟前端、位于海马旁回之后约 5–15 mm,与产生地标失认的病变部位吻合;之所以选这三人展示,是因为他们的 T1 像上沟回边界最清晰。它支撑主要结果第 1 条,以及讨论中"激活位置与病变文献一致"的论断。

图 4 · 实验 3:事件相关设计下的类别平均反应曲线
原文图注:Figure 4. Results from Experiment 3. Stimuli were presented in a random order every 16 s. The plots show the trial averaged signal (with nuisance effects removed; see Experimental Procedures) evoked for different stimulus categories for four different subjects. The smooth evoked response to buildings (thick black line) approximates the shape of the hemodynamic response of the BOLD fMRI system (Aguirre et al., 1998b) and is thus likely the result of a brief period of neural activity following the presentation of the building stimuli. Note that the plots for S7 are not from the original region defined in Experiment 1 but from a region one voxel anterior to this original area, which was identified by a post hoc test (see Results and Experimental Procedures).
横轴是刺激后时间(每 16 秒一试探次),纵轴是去除干扰效应后的试次平均 BOLD 信号;粗黑线为建筑刺激的反应曲线,其余细线为其他类别。读图关键在曲线的"形状"而不只是高度:建筑反应平滑、形似标准血流动力学反应函数,说明它来自刺激后一过性的神经活动,而不是块设计里可能混入的唤醒、预期等长时程状态;曲线峰值高于其他类别则对应建筑>物体、建筑>面孔的群体检验(t 均约 2.9,p≈0.02)。注意 S7 的曲线取自原 ROI 前方一个体素的事后检验区,而非实验 1 定义的区域。它支撑主要结果第 5 条与"块设计混淆已被排除"这一结论。

讨论
作者在讨论里先划定了结论的边界:影像学永远不能证明某皮层区对某认知过程"必要",也无法穷尽刺激类别来证实"建筑是最大反应者",但已检验并拒绝了一批合理的替代解释,且 Ishai 等的初步报告(1997,侧副沟附近皮层对建筑强于面孔与椅子)提供了独立呼应,因此可以暂时接受"该区对建筑本身反应过高、而非对某简单混淆因素反应"这一命题。区位的来源是讨论的另一半:像运动知觉这样演化上古老、跨物种共享的功能,其特化区可以由基因决定;但某些特化因演化上太晚近、文化上可变,不可能是先天的——字母区即然——更合理的机制是 Hebbian 学习对可塑皮层的组织作用(Polk 与 Farah 1995)。建筑在城市环境中反复、大量共现聚集(Lynch 1960),恰好满足这一机制的条件;同一逻辑还能解释为何汽车在该区也有非零反应(汽车与建筑在城市里频繁共现)。然而"一致跨个体的解剖位置"仍无解释:若皮层起初等效,Hebbian 造就的特化区位置应是随机的——于是作者提出,该区因与其它皮层区的连接方式而被"预置"发展出对常用于定向的刺激(大型自然地貌、走廊与房间、建筑)的表征,这些刺激或在光流场中表现独特、或总从有限的视角被观看;并给出可检验的预测:农村长大者该区的功能反应可能与城市长大者不同。对"任何独特物体都可作地标"的质疑,作者用文字系统作类比:几乎所有符号都可充当文字,但只有一小部分被实际使用,字母区正是因特定符号高频出现于特定语境而形成——地标区同理。最后是与 Epstein 与 Kanwisher(1998)"海马旁回位置区"(parahippocampal place area,对室内外场景反应更强)的关系:作者从其图上判断该激活相当靠后(据小脑宽度与侧脑室三角区的位置,此处海马旁回与舌上回本无清晰边界),且该区对孤立建筑的 fMRI 反应与对场景相当,故提出两者很可能是同一区域;但孤立建筑并不定义延展空间、被试看的又是陌生建筑,"场景布局感知"的解释难以自洽,作者主张把该区的功能描述改为对"具有定向价值的刺激"(孤立地标与环境场景皆然)的反应,并认为"舌回地标区"(lingual landmark area)或许是更贴切的名称。作者承认的局限还包括:以往海马旁回研究都做了空间平滑、有的还在被试内平均,精确对位困难,该区与那些报告的区完全、部分或不重叠尚无法判定,需要在同一被试身上并行两套范式才能澄清。
一句话总结
我认为这篇文章最值得学的是它的"排除法美学":发现本身(右侧舌沟附近对建筑反应偏强)在今天看来只是 PPA 故事的一个版本,但作者把低层特征、纹理、空间频率、难度、新异性、块设计顺序一个个拆掉的过程,示范了如何在 fMRI 里把一个"类别选择区"的主张立稳。以我的理解,它与 Epstein 和 Kanwisher 同年的位置区论文互为镜像——一边强调"场景布局"、一边强调"定向价值的地标物"——这场关于该区究竟编码什么的争论,正是在这两篇文章的张力中延续下来的。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度partial,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[] - Fig3: 提取质量
good,对齐度full,识别面板[] - Fig4: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 审校纠偏: 未发现将相关夸大为因果的情况。笔记对'建筑敏感区'的性质表述忠实于原文的谨慎立场(影像学不能证明必要性、不能穷尽刺激类别),讨论部分的 Hebbian 学习、城乡经验预测、与 Epstein & Kanwisher PPA 的关系均明确标为作者解释/推测,一句话总结中的'PPA故事的一个版本'明确以'我认为'标记为评注者观点。
- 补充要点: 实验1初筛中 S2 除右侧外还在左侧同源位置有建筑敏感体素('S2 also had voxels in a homologous position on the left'),笔记只字未提,略微弱化了'右偏但非绝对单侧'的证据图景。
- 补充要点: 负结果之一:ROI外扩大搜索中,S5、S6、S8 另有对建筑反应更强的体素但位置跨被试不一致——这一'候选区之外无一致建筑区'的负结果对'唯一特化区'主张有支持作用,笔记未收录。
- 补充要点: 实验3刺激每图呈现2000ms、共5次扫描1440个观测;实验1全体平均 d′=4.24±0.32(高于表1分类d′,原文表注有解释),均为可补的细节,非必需。