这是一篇关于猴下颞叶皮层(inferior temporal cortex, IT)的综述:作者藤田一郎把 20 世纪 90 年代以来 IT 神经元的新性质——跨物理属性剧烈变化仍保持的形状选择性、被 GABA 能抑制掩盖的潜在兴奋性输入、双眼视差与三维表面选择性、学习对选择性的塑造,以及形状特征柱状聚集——与解剖、组织化学证据拼在一起,勾勒出 TE 区"架构—计算—表征"的完整图景。值得读之处在于它把"视觉字母表假说"(visual alphabet hypothesis)讲得相当清楚:TE 以 1300–2000 个特征柱的有限字母,通过组合拼写表达无穷多的物体。
研究背景
猴的下颞叶皮层对物体的知觉与识别至关重要,它包含占据脑回外侧部的细胞构筑区 TE,以及位于 TE 腹前侧的鼻周皮层(perirhinal cortex, PR);TE 是单模态视觉区、视知觉加工的终站,鼻周皮层则接收多模态输入、对视觉记忆的形成至关重要,背侧还有上颞沟(superior temporal sulcus, STS)皮层毗邻。早期生理学已确定 IT 神经元的三个标志:感受野(receptive field, RF)大且常越过垂直中线进入同侧视野、对复杂物体或形状图像有刺激选择性、这种选择性对刺激位置的平移不变。但这些都停留在"有什么"的层面。
缺口有二。其一,关于 IT 神经元到底"怎么选刺激",文献里矛盾丛生:有的研究说 TE 神经元对几乎所有测试刺激都有反应,有的说只对一小撮刺激有选择性——刺激集怎么选、用不用简化程序、麻醉还是清醒、动物受没受训、记录在 TE 还是 STS,都可能造成分歧,这需要系统梳理。其二,相比 V1,TE 的功能架构(functional architecture)几乎一片空白:不同选择性神经元在皮层表面如何排布、内在纤维连接长什么样、结构如何支撑计算,都还没有答案。这篇综述的目标就是把十年来的新证据按这两条线索组织起来。
研究思路
作者的总体策略是"性质—机制—架构"三层递进:先盘点 TE/STS 神经元的视觉反应性质(大感受野、中等复杂度的特征偏好、视差与不变性),再追问每种性质背后的神经机制(会聚性传入、GABA 能抑制、学习、半球间连接),最后落到结构与化学的架构层面(柱状组织、水平轴突补丁的拓扑特征、沿枕颞通路的形态与神经化学梯度),用架构约束来理解计算。这条逻辑链的要点是:TE 神经元的计算特性不是孤立的生理学事实,而应当能在它的解剖结构(更大的树突野、更宽的轴突补丁间距)和化学特性(可塑性相关分子沿通路的系统变化)里找到"硬件基础"。
由于这是综述而非实验,其"设计"体现为材料的选择与批判:作者一面梳理各研究间分歧的技术根源(麻醉 vs 清醒、预定刺激集 vs 刺激简化程序、受训 vs 未受训动物),一面把本实验室的简化程序、双追踪剂标记、高频电刺激等手段得到的证据与其他实验室的预定刺激集研究、光学成像研究互相印证,最后指出哪些问题仍是开放问题(如视差柱与形状柱的空间关系、水平轴突连接的原则)。
方法
文章覆盖的方法以猴单细胞电生理为主。刺激简化方法(stimulus simplification procedure)是其中的核心:先以手工方式向猴展示超过 100 个三维物体及各种剪纸(不同朝向、距离、观察面),找到某个 TE 神经元最有效的物体及其最佳观察条件后拍成视频图像,再用计算机逐步增删或修改其组成特征,在线监测反应,直到找到与原物体激活程度相当(甚至更强)的最简刺激构型——这个最简组合称为该神经元的"关键刺激特征"(critical stimulus feature)。作者论证该程序的优越性:初始的手工展示相当于对每个神经元做了上百幅图像的普查;简化后常能找到比原物体更有效的刺激;从复杂到简化的方向能避开"由简到繁难以预测非线性反应"的陷阱。当然它也有局限(Young, 1993):没有形式化理论支撑、依赖实验者直觉、隐含"一个神经元一个关键特征"的假设、找到的最优刺激可能只是高维刺激空间里的局部极大。
架构层面的方法包括:逆行/顺行追踪剂(如生物素化葡聚糖胺)注射以显示内在水平轴突补丁与层间连接;对相邻两点的双注射比较两组补丁的分布;出生后第 3 天注射、第 7 天灌注的发育学研究;麻醉或清醒固定猴的垂直与切向(tangential)穿刺记录、多单元记录加互相关分析判定抑制性神经元,以及内置光学成像(optical imaging)。组织化学方面则汇总了鸦片受体、蛋白激酶 C 底物磷酸化、calbindin、AMPA 受体亚基 GluR2/3、parvalbumin 及 occ1 基因表达沿通路分布的比较。文中未详述各实验的具体被试动物数目与统计细节,这些信息在所引原文中。
主要结果
-
TE 感受野大但并未丢失位置信息。典型 TE/STS 神经元感受野跨 15–20 度视角、偏向对侧视野但含中央凹、许多越入同侧野;多数感受野空间敏感性规则、可用高斯函数拟合,少数有"热点"或"空洞"。定量研究显示感受野大小在细胞间差异很大(有的只有几度),感受野质心散布在同侧 4°到对侧 8°之间,故 TE 神经元群体仍可能传递旁中央凹区的位置信息。双侧视野反应依赖两半球 TE 之间的连合投射:切断了胼胝体与前连合、或对侧 V1 被损毁的猴 TE 中不再出现双侧感受野,药理学失活对侧 TE 也会取消同侧野反应。
-
TE 神经元偏好中等复杂度的特征,且一切视差选择性细胞同时也是形状选择性的。V2/V4/TEO 强激活所需的刺激比 TE "更简单"(十字、T 形、极/双曲光栅),物体信息逐级变为"复杂"形式;除面孔或习得物体神经元外,TE 神经元对中等复杂度刺激反应最强。双眼视差(binocular disparity)与视差梯度选择性的 TE/STS 神经元(图 3;全部对形状也有选择)可同时编码形状与相对注视平面的深度;STS 中对视差梯度定义的三维表面结构敏感的神经元比 TE 更多,而 V4 也有视差神经元——这动摇了背腹两通路"各管一套视觉属性"的二分法。
-
形状选择性具有跨变换的不变性,但不变性的范围有例外。形状偏好在感受野内不同位置、不同定义线索(亮度、纹理、运动、视差)、部分遮挡、自然观看(背景存在、杂乱场景自由注视搜索)下都保持,不过反应幅度常会变。大小与对比极性对不同神经元影响不一;对朝向变化普遍敏感;镜像翻转的影响小于倒置翻转或图形—背景翻转。这套生理学性质与人类知觉表现惊人地平行(如儿童写字母时镜像错误 b/d 多于倒置错误 b/p)。
-
GABA_A 抑制塑造刺激选择性,TE 神经元携带着被掩盖的潜在兴奋性输入。TE 中约四分之一神经元为含 GABA 的抑制性中间神经元;局部施加 GABA_A 受体拮抗剂荷包牡丹碱(bicuculline)会增强对某些刺激的反应,甚至揭开原本不引发反应的刺激的潜在反应,且效应不是"增益"也不是"冰山"式的整体增强——说明 TE 神经元接收多样的输入,其中一部分被刺激特异的 GABA 能抑制选择性压制。多单元互相关分析显示抑制性神经元与兴奋性神经元同样具有刺激选择性,且抑制性相互作用更多发生在偏好差异较大的神经元对之间。学习也能改变这些区的选择性,在鼻周皮层和 TE 腹侧更显著,机制上可经"调谐"使选择性变锐或经"关联"使之变宽。
-
TE 存在形状特征柱,其内在架构与 V1 形成鲜明对照。相似选择性的神经元在 TE 内垂直贯穿各层成柱,跨皮层表面限于 0.4–0.5 mm,同类柱间距 0.4–1 mm(图 4),单侧半球估计有 1300–2000 个柱;同柱(同穿刺道)神经元对反应的相关系数在刺激集含该区关键特征时可高达 0.30–0.35。解剖上,TE 水平轴突补丁宽 0.35–0.4 mm(与功能柱尺度吻合)、间距与同类柱间距相当、补丁更大更稀疏且分布比 V1 更不规则,标记强度随注射点距离下降的趋势在 TE 远不如 V1 明显,相邻两点的补丁群几乎互不重叠(图 5)——TE 是"补丁式"脑图而 V1 是"连续式"脑图。沿通路,V2/V4 的补丁参数居中,III/V 层锥体细胞的树突野、分支数与棘密度递增;TE 的第 2/3 层水平轴突高频电刺激引发 LTP 而 V1 同样刺激引发 LTD;神经化学梯度(µ 型鸦片受体、PKC 底物磷酸化、calbindin 锥体细胞、GluR2/3 向前递增,parvalbumin 与 occ1 基因向后递增)也与这一层级一致。
-
物体表征 = 被激活特征柱的组合("视觉字母表"假说)。光学成像证实一个物体激活 TE 表面多个斑点,逐步解析简化图像会减少激活斑点数;1300–2000 个柱如 26 个字母拼出百万单词那样,凭中等复杂度特征的组合表达海量物体。这种组合编码不同于"管弦乐队"式的群体编码,更近于"选举"式的各表其意;由于柱内神经元选择性彼此有差异,柱内活动模式还能在保持物体身份表征的同时标记观看条件引起的变化。镜像简化的图像有时反而激活新斑点,说明被抑制的柱也可能是表征的一部分(或简化过程引入了新特征)。
图注解读
图 1 · 下颞叶皮层及相关脑区解剖图
原文图注:Fig. 1. Inferotemporal cortical and related areas shown in the lateral and the ventral views of the brain. amts, pmts: anterior and posterior middle temporal sulcus, ios: inferior occipital sulcus, ots: occipitotemporal sulcus, sts: superior temporal sulcus. V1, V2, V4: visual areas V1, V2, V4, PR: perirhinal cortex, TEO, TE: posterior and anterior parts of the inferior temporal visual areas, TF, TH: parahippocampal areas.
脑的侧面观与底面观各一幅,标出 TE、TEO、鼻周皮层 PR、海马旁区 TF/TH 及各沟壑缩写。这是全文的地名索引:后文的"TE 腹侧""STS 毗邻""PR 位于 TE 腹前侧"等方位描述都要回到这张图定位,也是理解"沿枕颞通路"层级梯度的空间框架。

图 2 · 刺激简化程序示例:从胡萝卜到一条斜虚线
原文图注:Fig. 2. Stimulus simplification procedure. In this example, a TE neuron responded to a plastic model of a carrot with conspicuous highlights on its surface. By removing or modifying component features step by step while monitoring the neuron's responses, the minimal combination of stimulus features for the strong activation of this neuron was determined as a dotted line with a leftward tilt, particular spacing and component dot size, and brighter than the background (CE). Note the stronger responses for this critical set of features than the original object (A).
图中 A 是胡萝卜塑料模型的原始照片,后续各框逐步删改其组成特征,每步旁配该神经元此时的反应(直方图)。读图的关键在结论一格(C、E):最终让该神经元强烈激活的不过是"一条左倾的虚线——特定间距、特定圆点大小、比背景亮",且这一关键特征组合的反应比原始胡萝卜更强(这正是简化程序优于"预定刺激集"的证据:它能发现比自然物体更有效的刺激)。此图直观展示了上文方法部分与结果 2 所说的"中等复杂度关键特征"长什么样。

图 3 · 对视差和形状双重选择的 TE 神经元
原文图注:Fig. 3. Two examples of TE neurons selective for disparity. The cells are also selective for shape. H-bar, V-bar: horizontal or vertical bar, Square-rot: rotated square (diamond). Data from Uka et al. (2000).
两个 TE 神经元的调谐图:横轴为双眼视差(交叉/非交叉等不同值),纵轴为放电率,两个神经元都只在特定视差范围内强放电,且各自的视差偏好随所呈现形状(横条 H-bar、竖条 V-bar、旋转方块 Square-rot)不同而不同——即同一细胞既调谐视差又调谐形状。此图支撑结果 2 中"全部视差选择性 TE 神经元同时对形状有选择性,能同时发出形状与深度信号"的结论。

图 4 · TE 功能柱状组织示意
原文图注:Fig. 4. A schematic drawing of the functional columnar organization of the TE. Neurons within a column respond to the same or a similar stimuli, but the exact optimal stimulus or the tuning properties differ among them, as exemplified by similar but different icons within each column. Multiple columns are selective for similar features, and are shown with the same color.
示意图把皮层画成一组贯穿各层的竖直圆柱:每根柱内用"相似但不全同"的小图标表示柱内神经元最优刺激有差异,同色柱表示对相似特征有选择性的多个柱(间距 0.4–1 mm)。这张图是"视觉字母表假说"的视觉提纲——每个柱相当于一个字母(编码一个物体特征),物体由被激活柱的组合拼写。注意它强调两点:柱内同中有异(柱内活动可携带超出"有/无"的信息)、相似柱不止一个。

图 5 · TE 与 V1 内在水平轴突拓扑的惊人差异
原文图注:Fig. 5. Striking differences in the topographic features of intrinsic horizontal axons in the TE and V1. An anterograde tracer, biotinylated dextran amine, was injected into the TE and V1, and labeled axons and terminals were visualized with DAB reaction. Scale bars: 1 mm.
在同一皮层切面上对比两个区被顺行追踪剂标记出的水平轴突补丁:V1 的补丁小而密、排列较规则,TE 的补丁更大、更稀疏、分布更不规则;比例尺 1 mm 供直接比较。此图支撑结果 5 的架构结论:TE 的水平连接对距离的依赖弱于 V1(V1 标记强度随注射点距离明显衰减),相邻 TE 位点各自连接到空间上基本分离的补丁群,这为"不同特征柱之间跨越式互动"提供了解剖管道,也把 TE 定性为补丁式脑图、V1 为连续式脑图。

讨论
作者的收束方式是"性质—知觉的对应"与"行为的缺失"。一方面,他反复把生理性质与人类知觉现象平行起来:跨线索、跨遮挡、跨自然观看的选择性不变对应我们认物体不挑场景;镜像翻转耐受而对倒置敏感对应儿童认字时的镜像混淆;大小与对比极性的选择性在不同神经元间分裂对应心理物理上形状有时按特定尺寸存储。另一方面,作者坦率承认这些性质的"行为相关性"(behavioral relevance)尚未经实验检验——生理与知觉的平行只是间接证据,最直接的证据必须来自同一物种甚至同一个体上的行为—生理联合研究。他指出人类非侵入成像受时空分辨率限制,动物实验里可用的行为学手段(Parker & Newsome 所列)在 TE/STS 上只有零星尝试,唯一贴近的例子是 Sheinberg & Logothetis 双眼竞争中 STS 面孔神经元的反应与猴"报告看见面孔"的紧密相关。对开放问题他也列得明白:哪些区负责立体视觉、各区如何分工;水平轴突究竟连接相似特征的柱、不同特征的柱,还是视觉世界中常常共现的刺激的柱;视差柱与形状柱在空间上如何安放;TE 与 V1 可塑性方向相反(LTP vs LTD)的机制——膜特性、结构还是神经化学分布——均未知。
就文献对话而言,这篇综述明确回应了 Kobatake & Tanaka "选择性在 V4/TEO 形成后传给 TE"的旧图式(选择性塑造过程在 TE 内继续进行),回应了 Ungerleider & Mishkin 背腹二分的强版本(两通路并非各管一套属性),并用 Nelson & Bower 的连续/补丁脑图框架给 TE 的组织方式定了位。与 Vogels & Orban、Logothetis & Sheinberg 等关于不变性与学习的综述相衔接,但把解剖与神经化学的新证据(Elston 的树突梯度、Murayama 的 LTP/LTD 对照、Tochitani 的 occ1 基因)纳入进来是其特色。
一句话总结
在我看来,这篇综述最有生命力的想法是"视觉字母表":TE 不存物体照片,而是备好一两千个中等复杂度的"字母",物体以其激活柱的组合来拼写——这既解释了组合爆炸式的表征容量,也解释了不变性(换个视角,字母表还是那一套,只是组内活动模式微调)。今天的表征相似性分析时代回头看,文中"柱内各神经元同中有异、柱内活动模式携带超出开/关的信息"一句几乎预言了后来对群体编码的重视,足见其眼光。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[A] - Fig3: 提取质量
good,对齐度full,识别面板[] - Fig4: 提取质量
good,对齐度full,识别面板[A] - Fig5: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 补充要点: 在解释“视觉字母表假说”时,原文明确指出,与英语字母等任意拼音符号不同,TE 柱所表征的特征并非任意集合,而是很可能受到自然场景统计结构(statistics in the structure of the natural scenes)的强约束。Markdown 遗漏了这一关键的理论限定。
- 补充要点: 在讨论不同特征柱在皮层表面的空间排布时,原文强调了一个重要的负面结果(negative result):尽管多个实验室付出了巨大努力,但目前没有任何令人信服的证据表明任何特征或参数在 TE 皮层表面呈现出类似于 V1 的连续映射(continuously represented)。Markdown 虽然提到了 TE 的补丁式分布,但遗漏了作者专门点出的“未发现连续特征映射”这一重要缺口现象。