忘记密码?
其他方式登录

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

2026年8月18日

详细介绍

Transformer的许多关键技术,在一场会议上集体塌房了?!

第一篇论文名叫《Cracks in the Foundation》,来自Ai2等机构,瞄准的是QK归一化、GQA、滑动窗口注意力、预训练上下文长度这几个常年被当成「标配」的架构选择。

第二篇论文名叫《Lost in Backpropagation》,来自康奈尔大学,瞄准的是几乎所有语言模型都在用的最后一层——输出投影层。

还有一篇论文,名叫《When Fewer Layers Break More Chains》,来自图宾根大学,说的是一个已经被广泛使用的模型压缩手段——层剪枝,也就是直接把Transformer里的某几层整个删掉,减少模型深度来省算力。

[1]https://arxiv.org/abs/2608.10296

[2]https://arxiv.org/abs/2603.10145

[3]https://arxiv.org/abs/2510.22228

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论