这篇论文回答了一个很"日常"的问题:为什么在一堆眼熟的杂物里找目标比在一堆陌生图形里找更快?作者训练两只猕猴对固定图片集做了数月搜索任务,在自由观看的视觉搜索(visual search)中同步记录下颞皮层(inferior temporal cortex, IT)单细胞,发现目标选择性神经元对同样的外周目标,在熟悉干扰物包围下放电更强。行为上的"熟悉干扰物优势"由此获得了一个神经基础:熟悉情境同时放大了目标表征的"信号"、压低了干扰物带来的"噪声"。
研究背景
腹侧视觉通路(ventral visual stream)负责物体的表征与知觉,其中 IT 对复杂物体识别尤为重要。已有大量工作表明 IT 神经元的反应性质会随经验改变:辨别训练使刺激选择性变"锐利"(如 Kobatake 等 1998、Freedman 等 2006)。但这些改变都是在孤立物体呈现的条件下测到的——它们对自然观看(多个物体同屏、被试自己控制视线)意味着什么,此前没有直接的生理学证据。作者的猜想是:选择性锐化之所以能带来识别效率,关键在于减少相邻物体神经表征之间的干扰。
行为学一侧已有铺垫:作者自己此前报道人类在熟悉干扰物中搜索复杂目标更高效(Mruczek & Sheinberg 2005);Greene & Rayner(2001)用字母数字刺激比较眼动后提出"熟悉情境下每次注视可加工的视野范围更宽"这一解释,但纯属行为推断。当时缺的就是一环:在清醒动物自由观看时,直接记录熟悉性如何改变目标相关神经活动。
研究思路
设计的关键是"把熟悉性做成情境变量,而不是刺激变量"。猕猴先花数月把 50 张图片训练成有按键关联的目标,另 50 张作为熟悉干扰物;陌生干扰物则是当天首次见面的新图(看完即永久移出),从而把"长期熟悉"与"重复/新近效应"区分开。搜索屏上 1 个目标配 30 个干扰物(10 种各 3 次),熟悉与陌生干扰物的试验构型一一配对(目标与干扰物位置完全相同),保证两种条件下的物理刺激布局无差别。记录方面,每只电极都预先筛选出对某一"有效目标"(effective target)强烈选择性反应、却对全部干扰物(含两类)均无强反应的神经元——这样任何跨条件的放电差异都无法直接归因于干扰物本身,只能来自情境对目标加工的调制。分析上分两个时段:搜索阵 onset 后的瞬态反应(主要反映自下而上的显著性)与自由探索期逐注视的放电(反映自主观看下的加工),再辅以两套对照排除行为差异和眼动注意的混淆,并用多单元活动(multiunit activity, MUA)刻画目标周边神经元群在两种情境下的整体反应。
方法
被试为两只雄性恒河猴(S 与 M,6 与 10 岁),左侧半球植入记录仓,钨丝微电极记录前 IT(颞叶腹侧面、前内侧颞沟外侧),EyeLink II 以 500 Hz 记录眼动、离线用速度算法提取眼跳(可检出约 0.4° 的眼跳)。被动观看任务用于筛选:先注视 500 ms,随后 3–8 张图片在屏幕中央以 200 ms 呈现、间隔 200 ms,最后注视随机方位的第二点获得果汁。搜索任务中,猴子注视中央点 350 ms 后阵列出现,之后完全不限制眼动,自由浏览并按与目标关联的左右键报告;目标出现在 0/2/4/6/8° 五个离心度之一,干扰物随机分布于 9.5° 半径内且互不重叠;每 40 试为一小节,熟悉与陌生干扰物试验随机交替。
每神经元先经两阶段筛选:选定一个"有效目标"(相对三个"无效目标"持续强激活)后,再从猴子熟悉的池子随机抽 10 张"熟悉干扰物"、从当天新图随机抽 10 张"陌生干扰物",凡在被动观看中反应接近有效目标者即被替换,直到凑齐对这根电极"无效"的 20 张干扰物(每 session 平均剔除熟悉 3 张、陌生 2 张)。共完成 30 个神经元(S 猴 11、M 猴 19)。分析时把每个 spike 按该神经元的反应潜伏期后移对齐(潜伏期由不对称高斯窗的 spike density function 定为超过基线—峰值差 10% 且持续 15 ms 以上,全体神经元 64–151 ms,中位 97 ms);自由探索分析以每次注视的放电率按"注视点到目标的距离"分箱(只取 13° 内),群体层面做归一化(无效目标搜索的平均放电为 0、注视有效目标为 1),用双因素重复测量 ANOVA(干扰物类型 × 距离)检验;onset 分析取对齐到各神经元潜伏期的 155 ms 窗(与首注视频数的中位时长一致)。效应量用"干扰物熟悉性指数"(DFI)量化:放电方面 DFIFR 为正代表熟悉条件下目标神经元放电更高,反应时方面 DFIRT 为负代表熟悉条件下更快。MUA 由离线阈值提取(阈值定成使刺激前 200 ms 基线内平均 40 个事件),选择性广度(selectivity broadness)定义为能诱发显著 MUA 反应的刺激比例。
主要结果
- 筛选基线(图 2):30 个神经元对有效目标的反应在群体层面远超无效目标与所有干扰物;被动观看中熟悉与陌生干扰物的反应无任何差异(全部/最好/最差子集、早 50–175 ms 与晚 175–300 ms 时段,各比较 p≥0.15)——"最好"的干扰物也只唤起有效目标反应的约 35%(早)与 34%(晚)。这为后续差异"只能来自情境"提供了前提。
- 行为(图 3):错误率约 3% 且两条件无差(p=0.81)。熟悉干扰物中搜索显著更快:反应时 606 vs 698 ms(t(29)=-6.46,p<0.000001,约快 100 ms),注视次数 3.3 vs 3.8(p<0.000001),而单次注视时长无差(150 vs 149 ms,p=0.70)——效率提升来自"每看一眼看得更多",而非看得更久。朝向目标的眼跳比例更高,但差异局限于近距离目标(距离 × 熟悉性交互 p=0.0003)。
- 自由探索期的神经放大(图 4):群体归一化反应随"注视点—目标距离"衰减(F(6,174)=76.66,p<0.00001),且熟悉条件下整体更强(F(1,29)=14.34,p=0.0007;交互 p=0.0008,差异在距目标较近处最大):陌生干扰物中目标相关活动整体下降 25%。搜索目标为无效刺激时两条件无差(p=0.42)。
- 两组关键对照(图 5、图 6)与行为—神经对应(图 7、图 8):删减试次使行为效应反向后(熟悉反而更慢:622 vs 612 ms;注视更多:3.4 vs 3.3),神经效应依然存在(F(1,29)=9.14,p=0.005,约 23% 下降)——排除了"神经差异是行为差异的产物";剔除所有紧跟朝目标眼跳的注视(平均去掉 22% 的注视,N=28)后结果不变(F(1,26)=8.53,p=0.007,25% 下降)——排除了与眼跳绑定的空间注意的解释。onset 分析同样显著(F(1,29)=13.30,p=0.001,陌生条件下降 28%,交互 p=0.003、中段离心度差异最大),且限制首跳不朝目标的试次后仍存(22% 下降,p=0.03)。逐 session 的 DFI 显示 DFIRT 均值 -0.07(30 个中 27 个为负)、DFIFR 均值 +0.10(onset)/ +0.09(探索),且两种分析中放电指数与反应时指数显著负相关(Pearson r=-0.44 与 r=-0.40,均 p=0.02)——目标神经元越被熟悉情境放大,搜索越快。
- MUA:信号与噪声的两副面孔(图 9):与单细胞结果形成鲜明对比,陌生干扰物诱发的 MUA 反而更强(早段 p=0.00002、晚段 p=0.000002),且陌生干扰物中能唤起显著 MUA 的刺激比例更高(晚段 p=0.000006)——即熟悉干扰物的群体表征更"稀疏"、选择性更锐。搜索任务中(仅无效目标试验)DFIMUA 为负(均值 -0.014,p=0.001;-0.010,p=0.046),即陌生情境下背景 MUA 更高;其群体均值比单细胞 DFIFR 小约一个数量级(约 9 events/s),作者归因于电极设计与相邻 IT 神经元共享反应性质。
图注解读
图 1 · 视觉搜索任务示意
原文图注:Figure 1. Visual search task. After fixating a central square, the stimulus array appeared and the monkey was allowed to freely view the display. The monkey's task was to press a button (left or right) that had been previously associated with the target. In the example displays, the target is the image of the silverware. The target appeared at 0° eccentricity in the left panel and at 4° eccentricity in the right panel. Dashed gray lines denote possible target eccentricities (0, 2, 4, 6, or 8°) and were not present in the actual displays……
(后略:左右两栏分别为猴 S 的熟悉/陌生干扰物试验示例,实际显示为全彩物体。)
读图:中央 fixation 后阵列出现,猴子自由浏览并按键报告目标;虚线只是标注可选离心度(0–8°),实际不显示。左右两栏的阵列乍看无异——正如图注强调的,不预先知道猴子的经验历史,无法从图像上分辨干扰物类别。这张图对应方法部分的搜索任务描述与"熟悉性是情境变量而非刺激变量"的设计逻辑。

图 2 · 示例神经元与群体的刺激选择性
原文图注:Figure 2. Stimulus-selectivity for an example neuron and the neuron population. Neurons were chosen based on their selectivity for one target, the effective target, during a passive viewing task. Other targets and distractors were selected such that they did not activate the neuron to the same extent as the effective target. A, Response of an example neuron (same cell in Figs. 4A, 7A) to all 24 stimuli used in the visual search task. The response to the effective target was strongest. B, The same was true across the population of neurons……
(后略:C 为群体对熟悉/陌生干扰物的中位反应比较,早、晚时段及全部/最好/最差子集均无显著差异,p=0.15 in all cases。)
A 为单细胞(S169)对 24 个刺激(4 目标+20 干扰物)的 SDF,有效目标一枝独秀;B 为群体(N=30)归一化曲线,有效目标约 1.0、无效目标贴近 0、最好的干扰物约 0.35;C 的箱线图逐一比较两类干扰物,均不显著。这张图是全文解释的基石:干扰物本身不分化,后来的放电差异只能写成"情境 × 目标"的交互,支撑主要结果 1。

图 3 · 行为结果
原文图注:Figure 3. Behavioral results from the visual search task. A, Visual search for targets embedded among familiar distractors was ~100 ms faster than search among unfamiliar distractors (p < 0.000001). B, Monkeys also required fewer fixations to locate targets among familiar distractors (p < 0.000001). C, There was no consistent difference in fixation durations across distractor type (p = 0.70)……
(后略:D 为朝向目标的眼跳比例随注视—目标距离的函数,熟悉条件下更高,差异局限于近距离目标,p<0.001。)
A–C 箱线图给出三组配对比较:反应时(约 606 vs 698 ms)、注视次数(3.3 vs 3.8)、注视时长(无差)。D 的两条曲线在近距离处分开、远距离处合拢。这张图确立行为基线,并提示熟悉性的收益有空间结构——恰好为图 4 中神经差异"近处最大"做了铺垫,对应主要结果 2。

图 4 · 自由探索期间的神经反应
原文图注:Figure 4. Neural response during active exploration of the search array. A, Example trial with the effective target for one neuron (same cell in Fig. 2A). Horizontal (H) and vertical (V) eye position (top, solid lines) and the target position (dashed lines) as well as the distance from the gaze position to the target (middle) are shown. Shaded regions denote fixations during search. Spike times, backward-shifted by the onset latency of the neuron, are depicted by the black vertical marks……
(后略:B 为群体归一化反应(±SE),有效目标反应随注视—目标距离增加而衰减(p<0.00001),陌生干扰物中衰减更快;各离心度合计陌生条件下降 25%(p<0.001);无效目标无差异(p=0.42)。)
A 展示方法的全部要素:眼位轨迹、注视分段、按距离分箱的放电;B 是核心结果图——横轴为注视点到目标的距离,两条实线(有效目标 × 两种干扰物)在近距离处张开、随距离合拢,虚线(无效目标)贴零。对应主要结果 3。

图 5 · 对照一:平衡反应时与注视次数
原文图注:Figure 5. Control analysis for the unbalanced number of fixations across distractor type contributing to the active exploration analysis. A, Histogram of response times for trials with familiar (upward bars) and unfamiliar distractors (downward bars) for an example neuron. For this analysis, the fastest familiar distractor trials and slowest unfamiliar distractor trials were removed (light gray bars). For the remaining subset of trials, search was, on average, faster for unfamiliar distractor trials……
(后略:B 为对照子集的群体行为——与全集相反,熟悉条件更慢(p<0.001)、注视更多(p=0.001);C 为子集上的群体神经反应,结论与全集一致:陌生条件下降约 24%(p=0.005),交互 p=0.0002,无效目标无差异(p=0.17)。)
此图的巧妙之处在 B:通过删试次把行为效应"反过来",若神经效应随之消失,则神经差异只是行为的影子;实际上 C 中曲线依旧分开。对应主要结果 4 的第一组对照。

图 6 · 对照二:剔除朝向目标的眼跳
原文图注:Figure 6. Control analysis for possible differences in eye movement patterns across distractor type. The normalized population response during active exploration of the search array is plotted as a function of distractor type and distance between fixation and target position. For this subset of trials, all fixations that were immediately followed by a saccade to the target were removed. The results were comparable with the same analysis on the full data set (see Fig. 7)……
(后略:有效目标反应随距离衰减(p<0.00001),陌生条件下降 25%(p=0.007),交互 p=0.001,无效目标无差异(p=0.38);D 为干扰物、T 为目标。)
由于眼跳前注意必然移向眼跳终点,此对照专门剥离"注意已指向目标"的注视。去掉这些注视后效应不减,说明熟悉性的放大不依赖对目标的空间注意分配——对应主要结果 4 的第二组对照。

图 7 · 阵列 onset 的瞬态反应
原文图注:Figure 7. Neural response to the onset of the search array. A, Raster and spike density functions for an example neuron (same cell as in Fig. 2A) aligned to stimulus onset as a function of target eccentricity and distractor type. For effective target trials, the transient response magnitude decreased with increasing target eccentricity and was generally stronger when distractors were familiar. Rasters are only shown for effective target trials……
(后略:B 为对齐到各神经元 onset 潜伏期的群体直方图;C 为 155 ms 窗内群体反应(±SE),随离心度衰减(p<0.00001)、陌生条件下降 28%(p<0.001)、无效目标无差异(p=0.37);D 为首跳不朝目标的试次子集,效应依旧。)
A 的栅格图按离心度与干扰物类型排列,可直观看到瞬态爆发随离心度降低、熟悉条件下更高。此分析把效应推进到搜索开始后的最初 155 ms——主要由自下而上输入驱动——从而把熟悉性的作用一直推到视觉通路的早期,对应主要结果 4 的 onset 部分。

图 8 · 行为与神经效应的跨 session 相关
原文图注:Figure 8. Comparison of behavioral and neural effects across experimental session. Histograms of DFIs are shown for response time (far right) and firing rate during the array onset (top left) and active exploration (top right) analysis epochs. Positive values for DFIFR indicate higher firing rates in response to the effective target when distractors were familiar. Negative values for DFIRT indicate lower response times for familiar distractor searches……
(后略:三个分布均值均显著异于零(p<0.00001 in all cases);onset 与探索分析中行为—神经效应量显著相关(均 p=0.02);空心圆为示例神经元。)
读图:右侧直方图绝大部分 DFIRT 落在零左侧(27/30),上方两个 DFIFR 分布落在零右侧(23/30 与 27/30);下方两张散点图的负相关系数(-0.44、-0.40)把"目标神经元被放大多少"与"搜索快多少"逐 session 绑定在一起,是"神经效应支撑行为效应"这条因果链上最直接的一环,对应主要结果 4 末句。

图 9 · 被动观看与搜索中的多单元活动
原文图注:Figure 9. Multiunit activity during passive-viewing and visual search. A, Population MUA during passive viewing. Shaded region denotes 95% confidence intervals. B, Unfamiliar distractors induced stronger MUA than familiar distractors during both the early (50–175 ms) and late (175–300 ms) response periods. This difference was significant across all distractors tested, as well as when limiting the comparison to the "best" distractors or "worst" distractor of each class (p<0.002 in all cases)……
(后略:C 为选择性广度,陌生干扰物更高(早 p=0.004、晚 p=0.000006);D 为 DFIMUA 直方图,onset 与探索两时段均值均显著小于零(p<0.05 in both cases)。)
A–C 说明群体层面对陌生刺激的"原初反应"更强、表征更宽泛;D 说明搜索场景中背景 MUA 在陌生情境更高。与图 8 对照,单细胞(信号)与多单元(噪声/干扰)在同一情境变量下朝相反方向走,这正是"信噪比升高"叙事的实证两半,对应主要结果 5。

图 10 · 经验依赖改变的电路示意图
原文图注:Figure 10. Basic diagram of the experience-dependent changes in the response properties of IT neurons accounting for the distractor familiarity effect. A, B, The activity in a hypothetical population of IT neurons is shown during visual search through unfamiliar (A) and familiar distractors (B). Active neurons are denoted in black. Local inhibitory neurons are drawn as circles; output neurons are drawn as hexagons. T denotes a target-selective output neuron and D denotes distractor-selective output neurons……
(后略:经验使 IT 内局部抑制性与干扰物选择性输出神经元活动更稀疏、对输出神经元的抑制减弱、目标选择性输出增强,最终目标表征信噪比更高;注:V4 等低区的输入变化亦可能发生,此处未画。)
这是作者对全部结果的理论收束:A(陌生)中激活的神经元又多又杂,抑制性中间神经元(圆圈)大量活动压制目标单元 T;B(熟悉)中活动稀疏、抑制减轻、T 的输出线更粗。此图为概念模型而非数据,对应讨论中"信号升高、噪声降低"的机制解释。

讨论
作者的机制解释是:长期经验让 IT 对目标表征的信噪比(signal-to-noise ratio, SNR)在熟悉情境中升高——目标更"显眼"(salient)。MUA 结果与文献一致地显示陌生刺激在 IT 群体中唤起更广、更强的活动,作者认为这构成了对目标加工的干扰:抑制性中间神经元约占猴颞叶皮层的 25%、主要参与局部环路并影响刺激选择性神经元的反应性质,陌生情境下更强的 MUA 意味着目标神经元受到更强抑制;兴奋性神经元的多余活动同样可能通过降低下游信噪比起反作用。熟悉干扰物活动减少则有两个来源——选择性锐化使参与表征的神经元更少、以及猴子可能已学会"忽略"这些干扰物。作者进一步指出,首注期间(主要反映前馈输入)效应即已出现,提示经验可塑性还改变了来自 V4 等低区的前馈输入。结果与"外周目标识别与目标选择性 IT 神经元的调制紧密相关"的既往工作相接,作者把效应概括为:熟悉情境相当于"功能性感受野变大"。作者承认的局限包括:为归因而做的严格刺激筛选偏离真实世界(但作者论证真实场景中全体目标选择性神经元不会同时被同一批干扰物激活,群体层面结论仍可外推);未纳入"孤立目标"条件,只能借助与 Sheinberg & Logothetis(2001)的比较(补充材料)说明熟悉但杂乱的情境并不等于孤立呈现;MUA 电极并非为多单元记录优化,加之相邻 IT 神经元可能共享反应性质,群体层面的真实差异很可能被低估。
一句话总结
这篇文章的可贵之处在于把"熟能生巧"拆到了单细胞水平:同一个目标、同一张布局,只因周围图你认不认识,IT 目标神经元的放电就差出四分之一——而且行为反着做、注意剥离掉,效应照样在。我读下来觉得信号/噪声的双通道证据(单细胞升、MUA 降)是这个故事最漂亮的部分;至于"感受野功能性变大"和抑制环路那一段,则更像合理的框架而非被直接检验的机制。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig10: 提取质量
good,对齐度full,识别面板[A, B, D] - Fig2: 提取质量
good,对齐度full,识别面板[A, B, C] - Fig3: 提取质量
good,对齐度full,识别面板[A, B, C, D] - Fig4: 提取质量
good,对齐度full,识别面板[A, B] - Fig5: 提取质量
good,对齐度full,识别面板[A, B, C] - Fig6: 提取质量
good,对齐度full,识别面板[] - Fig7: 提取质量
good,对齐度full,识别面板[A, B, C] - Fig8: 提取质量
good,对齐度full,识别面板[] - Fig9: 提取质量
good,对齐度full,识别面板[A, B, C]