这项研究第一次证明:猕猴下颞叶皮层(inferior temporal cortex, IT)前部的 TE 区神经元不仅对二维形状,也对由双眼视差(binocular disparity)定义的三维形状有高度选择性。作者设计了一组聪明的刺激——交换左右眼图像即可把凹面变成凸面——把 3D 形状信息与单眼线索、二维轮廓彻底解耦,从而回答了一个此前悬而未决的问题:负责物体识别的腹侧视觉通路(ventral visual stream)到底做不做深度。结果是超过三分之一的 TE 神经元对 3D 形状选择性显著,且这种选择性主要来自全局视差梯度而非局部视差。
研究背景
IT 皮层是腹侧视觉通路的核心,对物体识别至关重要,但单细胞研究此前的证据几乎全部集中在二维属性上:2D 形状、颜色、纹理。真实世界的物体是三维的,IT 神经元是否编码物体的 3D 结构,在当时是空白。仅有两条间接线索:Gross 等与 Tanaka 等注意到在单眼观看条件下一些 IT 神经元对三维实物有反应而对相应的 2D 图像没有——但那些研究里动物是被麻醉和瘫痪的,深度线索(尤其立体视觉线索)完全没有被系统操纵,Tanaka 等只能猜测某些 IT 神经元或许需要特定的视差值才会激活;Perrett 等则报告 IT 神经元对真面孔的双眼呈现与单眼呈现反应相同,可单眼呈现的实物照片本身仍携带多种深度线索。因此,既往"IT 对深度加工贡献甚小(尤其对立体视深度)"的解读,其实是建立在从未真正操纵过深度线索的实验之上的。
另一边的已知图景是:双眼视差是最有力的深度线索之一,视差敏感神经元在纹状皮层和多个纹外区都有记载——但这种敏感性只说明神经元能标记"深度中的位置",不说明任何皮层区域能表达"3D 形状"。缺口因此很明确:需要在清醒、注视的动物身上,用只含视差信息的形状刺激,直接检验 IT 神经元是否对 3D 结构本身有选择性。
研究思路
设计核心是一个解耦操作。刺激是 64 个由随机点纹理填充的弯曲 3D 形状,其深度完全由沿垂直轴的视差梯度(disparity gradient)定义——选垂直轴是为了避免引入纹理密度梯度这一混淆线索。八个深度剖面(前三对由正弦函数生成、第四对由高斯函数生成)分四对,每一对的两个成员使用完全相同的两张单眼图像,仅仅交换左右眼所见,就得到一对视差符号相反、凹凸感知截然相反的 3D 形状。这样,一对内两个刺激的单眼图像完全相同、叠加后的 2D 形状也相同,任何反应差异只能来自双眼视差的构型。
逻辑链随之展开:先证明存在对"同对成员"反应显著不同的神经元;再用单眼呈现和双目叠加条件排除"差异来自单眼图像偏好或 2D 形状"的解释;再用"位置-深度测试"把偏好与非偏好形状放在视差范围完全重叠的多个深度上——若选择性只是对某个局部视差值的调谐,两形状在重叠位置的响应就该趋同;最后用无梯度的平坦形状直接测局部视差调谐。作者还全程记录右眼位置,用眼动动力学差异(微扫视与辐辏眼动的时间 course 截然不同)和选择性的极早出现时间,系统排除辐辏眼动(vergence eye movements)造成的假象。
方法
被试为两只雄性恒河猴,正视且经立体视觉诱发电位证实有 excellent 立体视。刺激经双组铁电液晶快门(光学上升/下降 35 ms,各以 60 Hz 交替开闭、与显示器垂直回扫同步)分眼呈现(dichoptic presentation),实测无双眼串扰;亮度 0.8 cd/m²(间视),对比度满格;注视距离 86 cm,视差范围从 1 度交叉到 1 度非交叉,视差梯度幅度 0.8–1.3 度(对人类观察者"大而可融像")。每次记录会话重新生成三套随机点纹理并交叉穿插呈现。白色注视点叠在红色刺激上;猴须在 1.2 度见方的窗口内注视 0.4 度中心目标 1000 ms 后,刺激中央呈现 800 ms,全程保持注视的试次才给果汁奖励并纳入分析。右眼水平垂直位置用巩膜搜索线圈法(scleral search coil)以 200 Hz 记录。记录用钨微电极做常规胞外单细胞记录,位置经结构 MRI 与引导管在位的 CT 联合核实,位于上颞沟腹侧岸与颞下回外侧凸面,属 TE 区(IT 前部)。
流程分两级:先用 32 个 3D 形状的子集筛出有反应的神经元(共 135 个),再对每个神经元详细测试两对源自同一 2D 形状的 3D 刺激(其中一对含筛选时反应最强的形状),并同时测左眼单独、右眼单独呈现,以及两张单眼图像叠加为单一图像的双目叠加条件;各条件穿插进行,每条件至少 6 试次(中位 10)。净反应按试次计算:刺激起始后 100 ms 起的 400 ms 内 spike 数减去起始前 400 ms 的 spike 数。用方差分析(ANOVA)检验 3D 形状选择性的显著性,配对成员间比较用事后最小显著差数检验。为量化立体机制贡献,作者定义立体差异指数(stereo difference index):立体条件下两成员反应之差与单眼反应之和的差异代入比值,指数大于 0.5(即立体差异至少三倍于单眼差异之和)才判定为源自双眼机制;再用位置-深度测试(两形状各置五个深度、视差完全重叠,此时梯度幅度平均减半)做位置 × 形状的两因素 ANOVA,考察选择性随深度平面的变化;辅以七个深度的平坦形状直接测视差调谐。
主要结果
- 135 个有反应的 TE 神经元中,44%(59/135)对同一对 3D 形状的两个成员反应显著不同;经立体差异指数检验,仅 3 个可由单眼反应差异解释,其余 56 个(约 41%,即摘要所说"超过三分之一")判为 3D 形状选择性神经元。这些神经元的中位立体差异指数为 1.17——意味着偏好形状的单眼反应之和反而比非偏好形状更弱;中位选择性指数 0.73(四分位 0.60–0.95),即对偏好深度剖面的反应平均是对同对另一成员的 3.7 倍(图 2、图 3)。
- 选择性出现得极早。群体刺激后时间直方图显示,偏好与非偏好形状的归一化反应差异在反应起始后 20 ms(即刺激起始后 130 ms)即达显著(配对 t 检验 P<0.002)。TE 反应潜伏期约 110 ms、猕猴辐辏眼动潜伏期至少 60 ms,任何眼动影响最早也要 170 ms 后才可能出现——时间上直接排除了辐辏眼动解释(图 3)。
- 将群体统计概括与单细胞案例拆分开来,例如修改为:‘……表现出对全局 3D 结构的选择性。以图 4A 的神经元为例,偏好形状在被调谐深度位置上的反应显著高于视差完全重叠的非偏好形状在任何位置的反应(事后配对比较 P<0.001)。’15 个神经元直接做了平坦形状(无视差梯度)的局部视差调谐测试:4 个对任何测试深度都无反应,5 个的反应不受平坦形状视差影响,其余 6 个为宽调谐(半高宽中位数 1.1 度,超过总视差范围的一半)。结论是绝大多数神经元的选择性基于全局视差梯度而非局部视差(图 4)。
- 但 3D 选择性大多依赖形状的平均深度:20 个全局选择性神经元中 19 个的选择性随平均视差变化——7 个只在注视平面附近保持选择性,6 个偏好在近深度,6 个偏好远深度;仅 1 个在全部五个深度位置都保持显著选择性(图 5)。非偏好形状的反应在任何对应深度都从未显著超过偏好形状(例外是两个确实调谐于局部视差的神经元,它们出现了形状偏好的反转)。
- 另有 8%(11/135)的神经元对"不同对的成员"有反应差异但对同对成员没有;其中 45%(5/11)的选择性既不能归因于单眼反应差异,也不能归因于叠加后的 2D 形状差异。整个实验中眼动控制的兜底数字是:3D 选择性神经元的最大眼位偏差平均仅 2.5 角分,眼位方差最大增幅平均约 1–2 角分平方,绝大多数不显著。
图注解读
图 1 · 刺激设计:交换单眼图像翻转凹凸
原文图注:FIG. 1. (A) Monocular images presented to left eye and right eye (Upper) and schematic illustrations of the perceived 3D structure (Lower). Left and Center illustrate a pair of 3D shapes having the same two monocular images. Exchanging the monocular images results in concave surfaces being perceived as convex and vice versa (compare Left and Center). On the Right are shown the monocular images of another 3D shape, derived from the same 2D shape as the two other 3D shapes. (B) Illustration of the eight different depth profiles that are grouped into four pairs (1–4). The profiles of the first three pairs are derived from a sine function, whereas a Gaussian function defines the depth profile of the last pair. Note that in the stimuli used in the experiment, depth was defined by binocular disp
(注:该图注在材料所给文本中于末尾截断,后文大意是"深度仅由双眼视差定义"。)
(A) 部分上排是呈现给左右眼的单眼图像、下排是感知到的 3D 结构示意:左与中是共用同两张单眼图像的一对 3D 形状,交换双眼图像后凹面变凸面、凸面变凹面;右侧是源自同一 2D 形状的另一个 3D 形状的单眼图像。(B) 部分是八个深度剖面、分四对,前三对源自正弦函数、最后一对由高斯函数定义。这是全文的实验逻辑基石:一对内两成员的单眼图像与 2D 轮廓完全相同,唯一不同的是视差的构型(符号/梯度方向),因此任何神经元反应差异只能归因于 3D 结构。注意图中的明暗和透视只是示意知觉深度,真实刺激里深度仅由视差定义。

图 2 · 单个 TE 神经元对 3D 形状的选择性及眼动控制
原文图注:FIG. 2. Selectivity of a TE neuron for disparity-defined 3D shape. The top row shows profiles of the two pairs of 3D stimuli with which the neuron was tested. The second row shows the peristimulus-time histograms of the neuronal responses to the dichoptic presentation (stereo), together with the mean horizontal eye position in these conditions. The two bottom rows are the responses to monocular presentation of the images to the left eye and to the right eye. The horizontal bars below each histogram and below the eye movement traces indicate the duration of stimulus presentation (800 ms); the vertical calibration along the eye position traces indicates 61 deg, and the thick vertical bar (top left corner), 80 spikesysec. Notice the large difference between the stereo responses to the two left-sided 3D shapes. This difference cannot be accounted for by the difference between the sums of the monocular responses.
(注:图注中"61 deg"与"spikesysec"系 PDF 提取伪迹,应分别为 1 度刻度与 spikes/sec。)
从上往下读:第一行是被测两对 3D 刺激的深度剖面;第二行是双眼分眼呈现(立体)条件下的刺激后时间直方图(PSTH)及其平均水平眼位轨迹;第三、四行分别是图像单独呈现给左眼、右眼时的反应。横杠标 800 ms 刺激时长。关键对比在最左侧两个立体条件之间:该神经元对"上半部朝向观察者倾斜"的 3D 形状反应强烈(两对形状比较 ANOVA F(3,20)=21.3,P<0.001;同对成员间事后比较 P<0.001),而两个单眼条件下的反应都很弱且几乎相同——立体条件下的巨大差异无法由单眼反应之和解释。眼位轨迹在各条件下无显著差异(偏好/非偏好形状的眼位偏差仅 1.4 与 1.1 角分)。这张图一次性示范了结果第 1 条的全部论证要素:选择性、双眼机制、眼动排除。

图 3 · 群体 PSTH:3D 选择性出现得比眼动可能起作用的时间更早
原文图注:FIG. 3. (A) Population peristimulus-time histogram of 3D-shape selective neurons (n 5 56). The solid line represents the population response to the preferred 3D shape and the dotted line, the population response to the nonpreferred 3D shape (bin width, 20 ms). The vertical dashed line indicates the onset of the population response, and the horizontal bar indicates the duration of stimulus presentation. (B) Difference between the normalized responses to preferred and unpreferred 3D shape plotted as a function of time. Open bins indicate nonsignificant differences in normalized response, filled bins, significant differences.
(A) 是 56 个 3D 形状选择性神经元的群体 PSTH(bin 宽 20 ms,各神经元先按两条 PSTH 中的最高 bin 归一化):实线为偏好形状、虚线为非偏好形状,竖直虚线标群体反应起始,横杠为刺激时长。(B) 把两曲线之差按时间展开:空心 bin 表示差异不显著,实心 bin 表示显著。读图要点在实心 bin 出现的时刻——反应起始(约刺激后 110 ms)后仅 20 ms、即刺激起始后 130 ms,选择性已达显著(P<0.002)。由于辐辏眼动潜伏期至少 60 ms,眼动对 TE 反应的任何影响最早也在 170 ms 之后,故早期选择性不可能是辐辏眼动的产物。这是结果第 2 条的直接证据,也是全文最简洁的对照论证。

图 4 · 位置-深度测试:全局梯度胜过局部视差
原文图注:FIG. 4. Neuronal responses in position-in-depth test. (A) Responses of the same neuron as in Fig. 2. (B) Responses of another TE neuron, tested with Gaussian depth profiles. The depth profiles of the stimuli are shown as positioned in depth, and the colors represent the net average firing rate of the neuron: red, 30 spikesysec; white, 0 spikesysec. The plane of fixation is indicated by the vertical dotted line (near disparities are to the left, far disparities to the right); the green dot represents the fixation point. The peristimulus-time histograms of the responses to the preferred 3D shape at five positions in depth (positions 1–5) are illustrated on top of the depth profiles, whereas the responses to the nonpreferred stimulus (positions 19–59) are shown below. Horizontal bars indicate the duration of stimulus presentation (800 ms), and the thick vertical bar indicates 70 and 100 spikesysec in A and B, respectively. Eye movement traces are shown for the extreme stimulus presentations (positions 1, 19, 5, and 59). The vertical calibration along the eye position trace indicates 61 deg.
(注:"spikesysec""61 deg"为提取伪迹(spikes/sec、1 度);"positions 19–59"应为非偏好形状的位置编号 1′–5′。)
图中每个深度剖面的颜色编码该神经元的净平均放电率(红 30 spikes/s,白 0);竖直虚线为注视平面(近视差在左、远视差在右),绿点为注视点。上排 PSTH 是偏好 3D 形状在五个深度位置(1–5)的反应,下排是非偏好形状在对应重叠位置(1′–5′)的反应。读图关键:两形状的视差范围完全重叠(测试中梯度幅度平均减半),若神经元只是调谐于某个局部视差值,上下两排在重叠位置应当趋同——实际却不然。(A) 中图 2 的那个神经元在位置 3 对偏好形状的反应显著高于非偏好形状在任何位置的反应(P<0.001),且对无梯度的平坦形状在七个深度上并无深度位置调谐(F(6,56)=2.04,不显著);(B) 的另一个细胞(高斯剖面)选择性也存在,但集中在近视差(位置 1–4)。此图支撑结果第 3 条:91%(20/22)的神经元编码全局 3D 结构而非局部视差。

图 5 · 3D 选择性对平均深度的依赖
原文图注:FIG. 5. Selectivity for 3D shape depends on the average depth of the shape. The selectivity index is plotted as a function of the mean disparity for five TE neurons. To prevent spuriously large indices, the index was set to zero for responses smaller than three spikesysec (which generally did not differ significantly from zero). Solid lines are two examples of neurons where 3D selectivity predominates in the plane of fixation, dashed lines are neurons where selectivity predominates at near disparities, and the dotted line represents an example of a neuron that is selective at far disparities. Open circles and open squares are the neurons shown in Fig. 4 A and B, respectively.
横轴是形状的平均视差(0 即注视平面,向左为交叉/近、向右为非交叉/远),纵轴是选择性指数(0 到 1;为防止小反应产生虚高指数,反应小于 3 spikes/s 时指数记零)。五个 TE 神经元各一条曲线:实线两例的选择性集中在注视平面附近,虚线两例偏好近深度,点线一例偏好远深度;空心圆与空心方块分别对应图 4A、4B 的神经元。全群统计是 20 个全局选择性神经元中 19 个的选择性依赖于平均深度、仅 1 个在全部五个深度保持显著。这张图划出了本研究结论的边界:TE 神经元的 3D 形状选择性是真实且全局的,但通常绑定在特定的深度平面上,深度不变性只是个案。支撑结果第 4 条。

讨论
作者把发现放在腹侧通路的加工层级里解读:TE 神经元群体高度选择于视差定义的 3D 形状,且这种选择性一般来自全局 3D 结构而非局部视差——据此,IT 皮层不仅加工二维形状信息,也加工三维形状信息。他们同时坦承本实验的刺激限制:只用了大的视差梯度与低亮度(间视)刺激,但作者指出在其后续实验中已证明即使梯度幅度更小、亮度更高,TE 神经元的 3D 选择性依然存在。眼动问题的处理被作者视为本研究的严谨性支柱:单眼记录足以检测辐辏(微扫视平均仅持续 15 ms、速度约 15 度/秒,而辐辏运动持续约 300 ms、速度仅约 1.5 度/秒,动力学截然不同),加上绝大多数条件下刺激期眼位变化不显著、以及 130 ms 即出现显著选择性的时间论证,共同排除了眼动假象(作者注明除单一测试外均无显著辐辏眼动)。
对话对象有三层。其一,结果与 TE 神经元对同一物体不同视角的选择性(Logothetis & Pauls)并不冲突:物体视角既可用二维也可用三维表示,本研究恰好表明 TE 神经元对特定视角内的深度剖面差异敏感。其二,视差选择神经元早已见于早期视觉区和背侧通路,但腹侧通路对视差的加工几乎空白——唯一的 V4 证据还是被引文献中引用的未发表数据,提示 V4 的局部视差调谐神经元可能为前部 IT 提供输入;本研究因此是 TE 区视差选择性的首个证据。其三,与顶叶的分工:已有工作认为物体 3D 结构在顶叶加工、与物体操作相关,但那些研究只测了平面表面在三维空间中的朝向并用单眼对照;本研究操纵的是空间朝向相同、源自相同单眼图像对的形状的 3D 结构。作者由此提出:顶叶与颞叶对 3D 形状的"看似平行"的加工,很可能对应物体操作与物体识别两个不同过程——两者各自处理 3D 结构的哪些侧面,留待后续研究。
一句话总结
这篇论文的精彩之处在于一个极简操作撬动了一个大问题:交换左右眼的两张图像,3D 凹凸就翻转,而单眼图像与 2D 轮廓纹丝不动——于是"IT 神经元到底认不认深度"第一次有了干净的答案:认,而且认的是全局深度轮廓,不只是某个视差值。我读来印象最深的反而是图 5 那道边界——多数神经元的选择性绑定在特定深度平面上,说明 1999 年时 IT 的 3D 表示离"深度不变"还很远;这是我对该结果份量的个人判断,作者在文中未展开此点。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[A, B] - Fig2: 提取质量
good,对齐度full,识别面板[] - Fig3: 提取质量
good,对齐度full,识别面板[A, B] - Fig4: 提取质量
good,对齐度full,识别面板[A, B] - Fig5: 提取质量
good,对齐度full,识别面板[A, B]