arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-04-08 至 2026-04-08 共收录 34
2510.19457 2026-04-08 cs.CL

MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models

MINED:利用多模态时间敏感知识进行探测与更新以提升大多模态模型

Kailin Jiang, Ning Jiang, Yuntao Du, Yuchen Ren, Yuchen Li, Yifan Gao, Jinhe Bi, Yunpu Ma, Bin Li, Lei Liu, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Northeast Forestry University(东北林业大学) C-FAIR&school of software, Shandong University(山东大学软件学院C-FAIR) State Key Lab. for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) The University of Sydney(悉尼大学) Anhui Polytechnic University(安徽工程大学) Ludwig Maximilian University of Munich(慕尼黑大学)

AI总结 本文提出MINED基准,评估LMMs在时间敏感知识上的认知、意识、可信度等六个维度,发现Gemini-2.5-Pro在时间理解上表现最佳,而多数开源模型仍缺乏此能力,且在体育知识上表现最差。

Comments ACL 2026, Project Page: https://mined-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05026 2026-04-08 cs.CL

Idiom Understanding as a Tool to Measure the Dialect Gap

成语理解作为衡量方言差距的工具

David Beauchemin, Yan Tremblay, Mohamed Amine Youssef, Richard Khoury

机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组(GRAIL)) Université Laval(拉瓦尔大学)

AI总结 本文提出结合成语理解和方言理解任务,构建三个新的法语方言基准数据集,发现模型在魁北克成语上表现显著逊色,证实了基准测试在量化方言差距中的有效性。

Comments Accepted to ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20546 2026-04-08 cs.CL cs.AI

Enhancing Hallucination Detection via Future Context

通过未来上下文增强幻觉检测

Joosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo

机构 * NAVER CLOUD(NAVER云) NAVER AI Lab(NAVER人工智能实验室) KAIST(韩国科学技术院) University of Richmond(里士满大学)

AI总结 本文提出通过采样未来上下文来增强幻觉检测,结合多种采样方法提升检测性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06556 2026-04-08 cs.SE cs.CL

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏