少于 1 分钟阅读

核心速递: 该研究展示 FFN 如何在词表空间中逐步推动概念,为解释和控制 LLM 输出提供了细粒度视角。

1. 论文基本信息

  • Title: Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space
  • Journal: arXiv
  • First Author: Mor Geva
  • 领域定位: 大模型与智能体架构 / 关键方法论

2. 研究背景与痛点

语言模型生成 token 的过程通常被看作层间表示变换,但每一层到底如何把概率质量推向最终答案并不清楚。该研究把中间表示投影到词表空间,尝试直接观察预测构建过程。

3. 核心材料与方法

作者将 FFN 输出视为对词表分布的 additive update,并进一步分解为单个参数向量造成的 sub-updates。这样可以看到哪些向量在推动哪些概念,并可据此做输出控制和早退推理。

4. 关键发现与机制解析

4.1 核心结论一

FFN 层通过在词表空间中添加更新来逐步构建预测,而这些更新常对应可解释概念。

4.2 核心结论二

单个 FFN 参数向量可推动一组相关 token 或概念,形成可分析的子更新。

4.3 核心结论三

基于该机制可控制 GPT-2 毒性输出近 50%,并用 early exit 平均节省约 20% 计算。

5. 局限性与未来展望

实验集中在语言模型,干预效果依赖任务和模型;概念可解释性仍有主观成分。 后续使用这类方法时,还需要关注数据来源、benchmark 设置、跨任务泛化和真实应用中的失败案例。对于 arXiv 预印本,也应持续跟踪正式发表版本、代码发布状态和社区复现情况。

6. 核心思考与研究启发

公开方法论启发在于,可解释性不必停留在输入归因层面,也可以分析模型每一层如何改变候选答案分布。该思路适合用于调试专业问答、检测错误概念放大,以及构建更高效的推理策略。

留下评论