| 文献精读 | FFN 在词表空间中促进概念预测 |
核心速递: 该研究展示 FFN 如何在词表空间中逐步推动概念,为解释和控制 LLM 输出提供了细粒度视角。
1. 论文基本信息
- Title: Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space
- Journal: arXiv
- First Author: Mor Geva
- 领域定位: 大模型与智能体架构 / 关键方法论
2. 研究背景与痛点
语言模型生成 token 的过程通常被看作层间表示变换,但每一层到底如何把概率质量推向最终答案并不清楚。该研究把中间表示投影到词表空间,尝试直接观察预测构建过程。
3. 核心材料与方法
作者将 FFN 输出视为对词表分布的 additive update,并进一步分解为单个参数向量造成的 sub-updates。这样可以看到哪些向量在推动哪些概念,并可据此做输出控制和早退推理。
4. 关键发现与机制解析
4.1 核心结论一
FFN 层通过在词表空间中添加更新来逐步构建预测,而这些更新常对应可解释概念。
4.2 核心结论二
单个 FFN 参数向量可推动一组相关 token 或概念,形成可分析的子更新。
4.3 核心结论三
基于该机制可控制 GPT-2 毒性输出近 50%,并用 early exit 平均节省约 20% 计算。
5. 局限性与未来展望
实验集中在语言模型,干预效果依赖任务和模型;概念可解释性仍有主观成分。 后续使用这类方法时,还需要关注数据来源、benchmark 设置、跨任务泛化和真实应用中的失败案例。对于 arXiv 预印本,也应持续跟踪正式发表版本、代码发布状态和社区复现情况。
6. 核心思考与研究启发
公开方法论启发在于,可解释性不必停留在输入归因层面,也可以分析模型每一层如何改变候选答案分布。该思路适合用于调试专业问答、检测错误概念放大,以及构建更高效的推理策略。
留下评论