多模态检索头首次被锁定:揭开大模型长文档内部检索真相 | EMNLP'26
详细介绍
随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。
长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。
受QRHead启发,研究团队提出了MMRetHeads检测方法。
注意力指向证据,只能说明两者存在关联。为了检验模型是否真正依赖这些头,研究团队屏蔽得高分的检索头,再与屏蔽相同数量随机注意力头的结果进行比较。
随机屏蔽后,两项任务仍分别保留32.2和52.6分。屏蔽检索头造成的下降明显更大,说明这些头不只是把注意力放在证据附近,也对模型访问证据具有因果作用。
研究团队进一步把这些注意力头中的证据信号用于多模态文档检索。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
联系方式
赞赏支持
累计赞赏 0 积分
0 人支持
登录后赞赏
