这篇文章用 fMRI 定位加单细胞记录,首次刻画了猕猴上颞沟前部身体选择区(ASB)的单神经元选择性,并与更靠后的中部上颞沟身体区(MSB)做定量比较。它回答的核心问题是:沿着颞下皮层的两个身体 patch,"身体"这张表征究竟变了什么。答案是清晰的分工——MSB 更擅长把身体和非身体划开,ASB 则携带更多跨视角稳定的姿势与身份信息。对想理解腹侧视觉通路(ventral stream)如何从不偏爱面过渡到不变表征的读者来说,这是身体加工领域的必读之作,也是对 Freiwald & Tsao 面孔 patch 层级规律的一次漂亮的平行验证。
研究背景
fMRI 研究早已在猕猴与人颞下皮层(inferior temporal cortex, IT)找到对身体图片反应更强的区域(Downing et al. 2001;Tsao et al. 2003 等)。在猕猴中,中部上颞沟(superior temporal sulcus, STS)的身体 patch(MSB)紧邻面孔 patch ML,此前已有单细胞工作:Popivanov 等 2014 年发现 MSB 神经元虽在群体水平能把身体与非身体分开,但单个神经元的选择性高度异质——不少细胞对某些非身体物体的反应甚至强于对身体的反应。fMRI 定位还显示 STS 更前部有一个第二个身体 patch(ASB),紧邻面孔 patch AL,电刺激 fMRI 提示两个 patch 相互连接。真正的缺口是:ASB 的单神经元选择性完全没有人测过,因此无从知道两个 patch 的表征差异是什么,也无法回答身体系统是否像面孔系统那样沿前后轴出现视角容忍(view-tolerant)的表征。
作者还从行为/生态角度提出了一个动机:面孔 patch 系统的研究聚焦身份,而身体的姿态(posture)在猴的社会生活中同样关键——支配与顺从的信号很大程度上靠身体姿态传递(作者引 Darwin 1872 及恒河猴行为学观察)。由于同种个体身体的社会意义集中于其当前姿势而非"这是谁",可以预期视觉系统对姿态应有跨视角稳定的表征。这使身体成为检验"前部 IT 不变性增强"这一规律的第二面镜子。
研究思路
总体策略是"同只动物、同套刺激、直接对比"。先用之前研究 MSB 时用过的"类别刺激集"(category set)记录 ASB 单个神经元,使 MSB 与 ASB 的数据在刺激与动物两个维度上都可比;再用一套专为本研究设计的新刺激——"猴视角集"(monkey view set),以 3D 建模正交操纵身份、姿态、视角三个维度,并刻意把面部内部特征最小化、所有身份和姿态共用同样的头部与面部,从而把"身体线索"的贡献从面孔线索中剥离出来。逻辑链是:若身体系统沿前后轴重复面孔系统的层级规律,那么更靠前的 ASB 应当表现出更弱的视角选择、更强的跨视角身份/姿态信息,而更靠后的 MSB 应保留更强的基于图像的(image-based)选择性。为了把这种推断建立在群体水平而非印象之上,作者同时采用了聚类结构比较与线性解码这两种互补的"读出"手段。
方法
被试为两只雄性恒河猴(与 Popivanov et al. 2014 相同),事先植入头部固定柱和分别对准 MSB 与 ASB 的记录舱。先用 MION 造影剂增强的 3T fMRI 在清醒注视状态下定位:只有当体素对"猴身体 − objectsM(人造物体对照)"的激活显著(FWE 校正)且不被面孔相对 objectsM 显著激活时才选为穿刺位点,MSB/ASB 均如此定义,并用留置电极的 MRI 扫描复核到位(图 1A)。电生理以环氧树脂绝缘钨微电极记录单单位放电与同步局部场电位(local field potential, LFP),被动注视任务下呈现刺激,眼位以红外追踪(1 kHz)并把 2°×2° 注视窗内跑完整试次的数据纳入分析。
刺激分两套。"类别集"含 10 类各 10 张无彩色图片(无头猴体、无头人体、猴脸、人脸、四足哺乳兽、鸟、两类长宽比分别匹配猴体与人体的造物、果蔬、身体样雕塑,共 100 张),各类别平均亮度和对比度均衡;平均面积总体匹配,但objectsH与人体类别例外。,置于粉噪声背景上,每张呈现 200 ms、间隔约 400 ms,平均每图约 7 个有效重复。"猴视角集"用 Blender 渲染的 120 张 3D 猴体图:3 个体格身份(胖/正常/瘦)× 5 种姿态(依据 Sade 1973 恒河猴行为志,含 2 支配、2 顺从、1 中性)× 8 个视角(绕竖直轴每 45° 一个)。分析上,放电率取刺激后 50–250 ms 窗、减基线;用分裂图方差分析筛选有反应的神经元;身体选择性以 BSI(Body Selectivity Index,身体选择性指数;BSI=0.33 对应身体反应为非身体的 2 倍)量化;刺激空间表征用 Ward.D2 层次聚类 + NbClust 判定最优簇数,并以 Goodman-Kruskal-gamma(GKg)指数及随机化检验比较两个 patch 的树结构;类别与维度信息用线性支持向量机(SVM,LIBSVM + Neural Decoding Toolbox)解码,配 5/6 折交叉验证、反复重抽样构成伪群体、置换检验与贝叶斯因子三板斧。类别集另测位置、尺寸及平面内旋转容忍性;猴视角集另测身份、姿态和视角选择性的跨尺寸保持。
主要结果
-
ASB 同样身体偏好,且与 MSB 反应潜伏期相同。 猴体−人造物体对比下 ASB 的 fMRI 激活显著(t>7 处穿刺)。ASB 部位的 LFP 功率对身体四类图像均高于非身体类,选择性集中在伽马频段(低/中/高伽马带 Wilcoxon 检验 P ≤ 5×10⁻¹²,贝叶斯因子 >10¹²)(图 1C)。单单位水平上,ASB 对身体平均放电显著更强(两猴均 P≈6–8.7×10⁻⁹),群体 PSTH 上身体与非身体的显著差异最早出现在刺激后 75 ms 的时间格内,且与 MSB 相同——这与"前部应当更慢"的串行层级预期相反(图 1D)。
-
单细胞依旧异质,群体平均的身体选择性是"加和"出来的。 ASB 神经元 BSI 中位数为 0.53(MSB 0.37),两 patch 混合后差异不显著(Mann-Whitney P=0.14)。许多 ASB 细胞对含"肢体"特征的人造物(如钳子)也有反应(图 2A)。
-
MSB 的类别边界更干净,两 patch 的刺激表征结构显著不同。 层次聚类(两猴合并、各 146 神经元)显示 MSB 分 2 簇且一簇主要为身体,ASB 分 3 簇,其中一簇含 10 张人体中的 8 张,其余两簇身体与非身体混杂。GKg 指数仅 0.03,显著低于"从 214 个 MSB 神经元里随机抽 146 个"所得的抽样噪声分布(percentile=0),证明两 patch 聚类结构的差异真实存在;MSB 那个身体比例最高的簇覆盖全部 40 张身体的份额也显著大于 ASB。线性 SVM 解码"身体 vs 非身体"(各 patch 80 神经元)得到 ASB 84% 对 MSB 92% 的正确率、差异 percentile=0(图 3)。
-
ASB 平面朝向选择性远弱于 MSB,在受测子样本中,刺激偏好排序对所测试的位置和尺寸变化具有显著容忍性。 8 方向平面内旋转实验中,ASB 神经元 OSI(Orientation Sensitivity Index,朝向选择性指数)中位仅 0.14,MSB 为 0.42(Mann-Whitney P=1.2×10⁻¹⁰,贝叶斯因子 1.1×10¹¹);而 ASB 神经元的刺激偏好排序在位置(Peripheral 位置 P=2.9×10⁻⁹)与尺寸(2°、4° 与 8° 之间排序保持)变化下均保持(图 2)。
-
猴视角集揭示维度信息的换手。 单张图像解码两 patch 相当(MSB 79%、ASB 80%,chance 0.83%),说明总体信息量没有缩水。但跨视角与姿态的身份解码、跨身份与视角的姿态解码都是 ASB 显著更高(均 percentile=0),而跨身份与姿态的视角解码则是 MSB 显著更高;50 ms 滑窗解码显示这三个维度的差距贯穿整个反应时程(图 5、图 6)。
-
泛化检验(最严苛的一种)坐实结论。 只在一个"姿态×视角"组合上训练、到其他组合上测试的身份解码,MSB 的非对角均值仅 34%、与 chance(33%)无异,而 ASB 达 44%(Wilcoxon P=1.9×10⁻¹¹⁵,贝叶斯因子 9.1×10²⁰⁶);姿态解码的 ASB 非对角均值 62%(对角 98%,chance 20%)远高于 MSB 的 31%;反过来,视角解码的非对角均值 MSB 50% > ASB 35%(图 7、图 8)。这种选择性的大小变化下保持不变(补充图 13),排除了"单纯图像法"解释。
图注解读
图 1 · ASB 的定位与三层证据(fMRI、LFP、放电)
原文图注:Figure 1. The anterior STS body patch (ASB): fMRI mapping, local field potentials and population spiking activity. (A). Activations of the contrast "Monkey bodies" – "objectsM" (t > 5). The images of monkey B show an electrode targeting ASB. The vertical line in the sections of monkey E is superimposed on an electrode/guide tube track. MSB is visible on the saggital sections. (B). One example of each stimulus class. (C) Time frequency plots of normalized LFP power of ASB sites. The normalization consisted of a division by the baseline power. The power was averaged across the exemplars and sites. (D) Left and middle panel: Peri-Stimulus Time Histograms (PSTH) of mean normalized firing rate for each of the 10 stimulus classes in ASB, shown for each animal separately. Right panel: population PSTHs of the mean normalized firing rate for the body (full line) and non-body classes (excluding sculptures; dashed line) for MSB (red) and ASB (blue) neurons.
这张图是全文的地基。A 面板里"猴身体减 objectsM"的对比图给出 ASB 在 STS 内的位置(两猴均偏外侧),叠加的电极轨迹证明单细胞记录确实打在 fMRI 定义的热点内;B 给出 10 类刺激各一例,颜色编码贯穿后文;C 是 ASB 部位的时频图,横轴为刺激时间、纵轴频率,可以看到刺激呈现(虚线之间)后高频段(伽马)功率对身体四类(暖色调)升高、对非身体类不明显,这是"身体选择性在伽马段最突出"的直接来源;D 右侧把 MSB(红)/ASB(蓝)的身体与非身体群体 PSTH 叠在一起:两类都会在 ~75 ms 出现身体曲线抬到非身体之上(空心方块标记 FDR 校正后的显著格),但两 patch 的抬升时间一致,支撑结果 1 中"潜伏期相同、ASB 反应时程更双峰"的描述。
图 2 · ASB 神经元的类别集选择性与容忍性
原文图注:Figure 2. Stimulus selectivity of ASB neurons examined with the category set. (A) Normalized net firing rate to each stimulus plotted for each neuron. Rows correspond to neurons, columns to stimuli. The 100 stimuli are ordered per stimulus class, as indicated by the example images and color bars. The bottom bar ("Average") indicates the normalized mean responses, averaged across neurons, for each stimulus. (B) Mean normalized net firing rate as a function of stimulus rank for two different stimulus locations (upper panel) and 3 different stimulus sizes (bottom panel). The stimulus rank was determined using the response to position R (foveal position) or size 8° and the same ranks were employed to plot the responses for the other position (NR) or sizes (2° and 4°). (C) Distribution of OSI for MSB and ASB neurons. Medians are indicated by arrows. Data were pooled across monkeys. (D) Population orientation tuning curves, shown separately for the MSB (red) and ASB (blue) neurons of monkey E (full lines) and monkey B (dashed lines).
A 是典型的"神经元×刺激"热图:每行一个 ASB 神经元、每列一张图,颜色深浅为归一化放电。肉眼可见同一行内某些身体列亮而其他身体列暗,且不少行在"肢体样人造物"的列上也亮,这正是结果 2"单细胞异质、甚至对钳子类物体有反应"的原始证据;底部"Average"条虽然在群体平均上身体类偏亮,但那是跨行平均的结果。B 上/下面板按参考条件(中心位置、8° 尺寸)排好的刺激排名画曲线:若反应排序不变,非参考条件下的曲线应近似平移而不是 flatten——实测曲线基本平行,说明位置、尺寸容忍完好。C、D 则是朝向部分的关键:C 中 ASB 的 OSI 分布整体左移(箭头为中位数 0.14 对 0.42),D 中两猴的 ASB 调谐曲线都平缓、MSB 明显有峰,共同支撑结果 4"ASB 平面朝向选择性远弱于 MSB"。
图 3 · 两个 patch 的刺激相似性树结构不同
原文图注:Figure 3. Hierarchical cluster analysis of category set stimuli based on MSB and ASB firing rates. (A, B) Dendrogram for MSB (A) and ASB (B) spiking responses. Data of both monkeys pooled. The stimulus classes are color coded as in Fig. 1. The boxes indicate clusters identified with the NbClust algorithm. (C) Distribution of optimum number of clusters (NbClust algorithm) obtained by randomly sampling 146 neurons from the population of MSB neurons (n = 1000 resamplings). The blue line indicates the optimum number of clusters (3) for the 146 ASB neurons, while the red line indicates the median number of clusters of the resampled MSB neurons. (D) Distributions of GKg index. (E–G) Distributions of the metrics P (bodies | cluster), P (bodies | total bodies) and P (cluster size | total stimuli) for 1000 resampled MSB neurons, with the ASB value indicated by the blue line.
A、B 两棵树是本文最直观的证据:从 146 个神经元的归一化反应算 100 张刺激两两欧氏距离再聚类。MSB 树(A)在高层就 split 出一个几乎全是身体的簇;ASB 树(B)则要读得细一些——最高的一簇聚起 8/10 的人体(站姿、双腿分开的那些),但猴体和非身体被拆散混杂。C 的直方图说明从 MSB 里反复重抽 146 个神经元也几乎抽不出 ASB 那样的 3 簇解;D 里真实 MSB–ASB 树间 GKg(0.03)落在灰色置换分布之内、却落在黑色 MSB 自抽样分布之外,一句话:两棵树的差异大于抽样噪声。E–G 的蓝色竖线(ASB)明显低于红色中线(MSB 重抽样分布),即 ASB 最高身体比例簇"装不下"全部身体。这些合起来支撑结果 3。
图 4 · 猴视角集刺激集
原文图注:Figure 4. Monkey view set. Images depicting the 8 viewpoints (rows) for each of 5 postures (columns) are shown for identity I2 ("normal"). Three identities (I1-I3) are shown for one posture (a threat; P1) and one profile viewpoint (V3) in the three boxes to the left.
这张图是方法示意 rather than 数据图:主阵列为身份 I2 的 8 视角×5 姿态网格,左侧三个小框展示胖/正常/瘦三身份在威胁姿态与侧面视角下的样子。读图要点是刺激集的正交结构(3×5×8=120)以及"面部内部特征被最小化、各身份共用同一头部"的设计——这让后文一切身份/姿态/视角结论都可归因于身体线索本身。它为结果 5、6 提供刺激背景。
图 5 · 猴视角集下的放电矩阵:视角与姿态的换手
原文图注:Figure 5. Spiking activity to the monkey view set. (A) Normalized net firing rate to each stimulus of the monkey view set (columns), ordered as shown above the panel (I1-I3: identity; P1-P5: postures; V1-V8: viewpoints). Each row corresponds to a neuron (top: MSB neurons; bottom: ASB neurons). For both patches, we ordered the neurons according to their preferred viewpoint, which was determined by averaging across postures for I2. The numbers to the left indicate the cumulative number of neurons having the preferred viewpoint 1-8. (B). Same as (A) but the same neurons ordered according to their posture preference (averaged across viewpoints for I2).
这是结果 5 的"看图说话"版本。A 面板:神经元按其偏好视角排序后,MSB 半区的行内出现整齐的竖向亮条——同一神经元对固定视角的 15 张图(全部姿态、身份)都有较高反应,说明 MSB 神经元被视角牢牢"锁住";ASB 半区的亮条则破碎得多。左缘的累积计数也显示 MSB 的偏好视角更集中。B 面板换成按偏好姿态排序,反转出现:ASB 行内的亮块更连贯,MSB 更散。这张图先让你用眼睛看到"MSB 偏视角、ASB 偏姿态",图 6 再用解码定量它。
图 6 · 身份/姿态/视角解码及其时间过程
原文图注:Figure 6. Decoding of identity, posture and viewpoint from MSB and ASB neuronal responses. (A) Decoding accuracy for identity (invariant with viewpoint and posture; left), posture (invariant with identity and viewpoint; middle) and viewpoint (invariant with posture and identity; right) for MSB (red) and ASB (blue) neurons. We concatenated 40 neurons of each monkey and of each patch, resulting in 80 neurons per body patch. Dashed lines indicate chance levels and error bars correspond to standard deviations (n = 100 resamplings). (B) Time course of decoding accuracy for identity decoding for MSB and ASB neurons. The analysis windows for decoding was 50 ms, with a step of 10 ms. (C) Time course of decoding accuracy for posture decoding. (D) Time course of decoding accuracy for viewpoint decoding.
A 面板每组两根柱,红为 MSB、蓝为 ASB,虚线为 chance(身份/姿态 1/3,视角 1/8):身份和姿态组蓝柱显著更高,视角组红柱更高,三次随机化检验的 percentile 均为 0——即 observed 差异在 null 分布之外。B–D 用 50 ms 滑窗把解码画成时间函数:三条曲线的 MSB/ASB 差距从解码起始就存在并全程保持,重要的是两个 patch 的解码起始时间本身没有先后,呼应结果 1 中"无潜伏期差异"的发现。注意 A 中"the classifier was trained with presentations of the same images"——此面板训练与测试用同一批图像的不同呈现,真正跨变化的泛化在图 7、8 中。
图 7 · 身份解码的跨姿态×视角泛化矩阵
原文图注:Figure 7. Generalization of identity decoding across viewpoint and posture. (A) Decoding accuracy (in color code; see vertical bar on the right) of MSB neurons for identity as a function of the trained and tested combination of posture and viewpoint. The diagonal corresponds to decodings where trained and test stimuli were identical, while these differed off the diagonal. (B) Same as in (A), except for decoding of identity using ASB neuronal responses.
这是全文最具说服力的一张图。原理:解码器只在某一个"姿态 P×视角 V"组合上学会区分胖/正常/瘦,然后拿到其余 39 个组合上考试。矩阵横轴为测试组合、纵轴为训练组合,颜色为准确率;对角线 = 训练测试同图,非对角 = 真泛化。读图:MSB 的 A 矩阵是"对角线亮、非对角基本熄灭"(均值 34%≈chance 33%),说明 MSB 学到的身份是有视角—姿态绑定的图像特征;ASB 的 B 矩阵非对角明显亮起(均值 44%),虽然不能保证所有泛化格都过显著(星标为与 chance 1/200 的置换检验差异),但整体上身份信息跨视角跨姿态可迁移。对角上 ASB(84%)也高于 MSB(77%),即"individuation 更精细"。
图 8 · 姿态解码的跨视角×身份泛化矩阵
原文图注:Figure 8. Generalization of posture decoding cross viewpoint and identity. (A) MSB; (B) ASB. Same conventions as in Fig. 7.
与图 7 同构,只是换了解码对象:训练在某一"身份×视角"组合上分类 5 种姿态,测试推广到其他组合。ASB 矩阵(B)非对角均值 62%(对角高达 98%,chance 20%),且泛化跨越视角与身份两个维度;MSB(A)非对角仅 31%,泛化主要发生在身份之间、几乎全无跨视角(个别侧向视角除外)。与图 7 呼应,这构成"ASB 携带更多视角容忍的姿态信息、MSB 更基于图像"这条核心结论的另一半证据。
讨论
作者的解读围绕两个层次展开。功能层次上,MSB 群体更像"身体探测器"("this is an animal"式的身体 vs 非身体二分),这与人类 fMRI 和神经心理学研究提出的"越靠前类别信号越弱、个体化(individuation)信号越强"的规律吻合(Tyler et al. 2013;Clarke & Tyler 2015),也与药理失活 ML 损害面孔探测行为的结果相互印证(Sadagopan et al. 2017);ASB 则更胜任姿态与身份的不变识别。一个精细的补充观察是:MSB 中身体簇的形成主要源于非身体反应低,而不是身体反应同质;ASB 里 8 张聚拢的人体图恰好都是站姿、双腿分开的图像,与猴视角集里 ASB 的高姿态选择性彼此印证。作者还提出人类 EBA↔猴 MSB、人类 FBA↔猴 ASB 的同源猜想(借 Caspari et al. 2014 的人类数据:EBA 的身体聚类强于 FBA)。系统层次上,身体 patch 的"前部视角容忍增强+个体化更精细"与面孔 patch 系统(ML/MF→AL/AM;Freiwald & Tsao 2010;Meyers et al. 2015)完全同构,作者据此把这个规律上升为对 IT 一般性加工原则的猜想。值得一提的还有两个诚实的限制:反应潜伏期无差异与串行层级预期相悖,作者只能举出"绕过 MSB 的直接前馈连接"(Kravitz et al. 2013)和非层级模型来调和;此外更新的 fMRI 定位提示可能存在更前的第三个身体 patch(AMB),但本实验的两只猴上没有找到,故视角容忍是否还会继续增强只能留待后人。
一句话总结
在我看来这篇文章的框架性贡献大于它给出的任何单一数字:它用一套被反复锤炼过的刺激与分析流程,把面孔系统里"前部 patch 越来越不视角绑定、越来越个体化"的规律搬到了身体系统,说明这可能真是 IT 的一般设计原则而非面孔的特例。但我也提醒自己注意文中的隐患——BSI 中位差异并不显著、GKg 检验只是层级结构的粗比较、潜伏期无差异又动摇了"MSB→ASB 串行喂入"的朴素版本——这些都在提醒我们"层级"在这个系统里更像功能上的渐变而非解剖上的单向流水线。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[A] - Fig3: 提取质量
good,对齐度full,识别面板[] - Fig4: 提取质量
good,对齐度full,识别面板[] - Fig5: 提取质量
good,对齐度full,识别面板[A] - Fig6: 提取质量
good,对齐度full,识别面板[] - Fig7: 提取质量
good,对齐度full,识别面板[A] - Fig8: 提取质量
good,对齐度full,识别面板[A, B]
关键事实与局限性声明
- 审校纠偏: {'current_text': '这是对Freiwald & Tsao面孔patch层级规律的一次漂亮的平行验证', 'classification': 'OVERCLAIM', 'problem': '身体系统结果与面孔系统趋势相似,但并未在同一实验中直接检验两个系统,也未测试与身体姿态对应的面部表情维度。', 'recommended_fix': '改为“为面孔patch所见的前后向表征变化提供了身体系统中的平行证据”。'} -> 评注:
- 审校纠偏: {'current_text': '身体patch的‘前部视角容忍增强+个体化更精细’与面孔patch系统完全同构', 'classification': 'OVERCLAIM', 'problem': '原文使用的是“reminiscent of a similar trend”,并明确指出身体姿态与面部表情并不完全等价;“完全同构”强于原文证据。', 'recommended_fix': '改为“呈现与面孔patch系统相似的前后向趋势”。'} -> 评注:
- 审校纠偏: {'current_text': '说明这可能真是IT的一般设计原则而非面孔的特例', 'classification': 'INTERPRETATION', 'problem': '这是作者提出的推广性假说,而非本研究直接证明的FACT;证据仅来自两个身体patch、两只猴及与既往面孔研究的间接比较。', 'recommended_fix': '保留为“作者据此提出的候选一般原则”,并明确仍需其他类别系统验证。'} -> 评注:
- 审校纠偏: {'current_text': 'MSB更像‘身体探测器’,ASB更胜任姿态与身份的不变识别', 'classification': 'INTERPRETATION', 'problem': '这是由群体解码差异导出的功能解释;动物没有执行身体检测、姿态判断或身份识别任务,研究未建立这些神经信号对行为的因果作用。', 'recommended_fix': '改为“MSB群体包含更强的身体类别信息,而ASB群体包含更强的视角容忍姿态及合成体格身份信息;其行为功能仍属推论”。'} -> 评注:
- 补充要点: : (第 14 页)
- 补充要点: : (第 21 页)
- 补充要点: : (第 6 页)
- 补充要点: : (第 20 页)