arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10296
2604.26243 2026-04-30 cs.CL cs.AI

StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

StratMem-Bench:评估虚拟角色对话中的战略记忆使用超越事实回忆

Yerong Wu, Tianxing Wu, Minghao Zhu, Hangyu Sha, Haofen Wang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国) College of Design and Innovation, Tongji University, China(同济大学设计与创新学院,中国)

AI总结 StratMem-Bench旨在评估虚拟角色对话中战略记忆的使用,通过异构记忆池测试角色在不同记忆类型间的决策能力,提出多种评估指标以衡量记忆整合与利用效果。

Comments 20 pages, accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12249 2026-04-30 cs.CL cs.AI cs.CV

SciMDR: Advancing Scientific Multimodal Document Reasoning

SciMDR:推动科学多模态文档推理

Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学)

AI总结 本文提出SciMDR数据集,通过合成与重嵌框架生成大规模多模态文档推理数据,提升科学问答任务的复杂度和真实性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03412 2026-04-30 cs.CL

Verified Critical Step Optimization for LLM Agents

用于大语言模型代理的验证关键步骤优化

Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学) Northwestern University(西北大学)

AI总结 本文提出CSO方法,通过验证关键步骤进行强化学习,以提升代理在复杂任务中的表现,实验显示其在GAIA-Text-103和XBench-DeepSearch上优于SFT基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21459 2026-04-30 cs.LG cs.AI

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

HER:面向大语言模型角色扮演的人类级推理与强化学习

Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

机构 * Fudan University(复旦大学) MiniMax

AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。

Comments Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13969 2026-04-30 cs.AI cs.IR cs.LG

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval

自主知识图谱探索与自适应广度-深度检索

Joaquín Polonuer, Lucas Vittor, Iñaki Arango, Ayush Noori, David A. Clifton, Luciano Del Corro, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Departamento de Computación, FCEyN, Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏州市先进研究中心) ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés(圣安德鲁大学工程系ELIAS实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Allston, MA, USA(自然与人工智能研究所,马萨诸塞州阿利斯顿) Broad Institute of MIT and Harvard, Cambridge, MA, USA(MIT和哈佛大学Broad研究所) Harvard Data Science Initiative, Cambridge, MA, USA(哈佛大学数据科学倡议)

AI总结 本文提出ARK工具,通过全局词搜索和邻域探索平衡知识图谱的广度与深度检索,提升多跳遍历效率,在STaRK上达到59.1%的平均Hit@1和67.4的平均MRR,优于其他方法。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13942 2026-04-30 cs.CV cs.AI

Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning

glance-or-gaze: 通过强化学习激励大 multimodal 模型适应性聚焦搜索

Hongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出 glanco-or-gaze 框架,通过强化学习使大 multimodal 模型主动规划视觉搜索,通过选择性注视和复杂度自适应强化学习提升复杂视觉查询性能。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06160 2026-04-30 cs.AI

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration

学生指导教师:通过频谱正交探索实现弱到强推断

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Spectral Orthogonal Exploration框架,通过正交探针引入语义异质性推理信号,提升数学推理任务的准确率和采样效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03242 2026-04-30 cs.CR

SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones

SLIM:通过潜在空间混淆区实现隐蔽的低覆盖率黑盒水印

Hengyu Wu, Yang Cao

AI总结 SLIM通过利用LLM内在属性诱导潜在空间混淆区,实现低覆盖率黑盒数据溯源验证,兼具隐蔽性与模型实用性,提供现代LLM流水线中保护训练数据的稳健解决方案。

Comments Accept the findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07689 2026-04-30 cs.CL cs.AI cs.LG

Stress Testing Factual Consistency Metrics for Long-Document Summarization

对长文档摘要的事实一致性度量进行压力测试

Zain Muhammad Mujahid, Dustin Wright, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学)

AI总结 本文评估了六个常用无参考事实性度量在长文档摘要中的可靠性,发现短形式度量在处理信息密集型声明时可靠性下降,提出改进方向包括多跨度推理、上下文感知校准和训练保留意义的变体。

Comments Accepted in Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21828 2026-04-30 cs.CV cs.CL

Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images

多模态关系知识图像上的结构化与抽象推理

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 本文提出STAR-64K数据集及两阶段增强框架,通过合成多模态指令数据提升模型在抽象推理任务中的性能,实验表明小型模型在STAR任务中超越GPT-4o。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18165 2026-04-30 cs.AI cs.CL cs.LG cs.SE

Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model

Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型

Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17548 2026-04-30 cs.CL

When Annotators Disagree, Topology Explains: Mapper, a Topological Tool for Exploring Text Embedding Geometry and Ambiguity

当标注者意见不一致时,拓扑解释:Mapper,一种用于探索文本嵌入几何和模糊性的拓扑工具

Nisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy

机构 * CReSTIC, Université de Reims Champagne-Ardenne(里摩日大学CReSTIC研究所) Chochoy Conseil(Chochoy咨询公司)

AI总结 本文提出用拓扑方法分析模型如何编码模糊性,通过Mapper工具揭示微调后嵌入空间的模块化结构,并探讨结构自信与标签不确定性的矛盾。

Comments Accepted to appear in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025, Main Conference)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 8457--8480, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09547 2026-04-30 cs.CV cs.AI

GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning

GoViG:通过多模态推理实现目标条件视觉导航指令生成

Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。

Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21420 2026-04-30 cs.CV cs.CL

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE:通过减少令牌数在MLLMs中实现更快更好的学习

Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

AI总结 ReGATE通过参考引导的自适应令牌消除方法加速MLLM训练,减少计算量同时保持模型准确性,在多个基准测试中表现出色。

Comments ACL 2026. Project page: https://people-robots.github.io/regate

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20876 2026-04-30 cs.CL

Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine

少做决定,多进行沟通:关于医学领域端到端事实核查构建效度的探讨

Sebastian Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain J. Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Indiana University School of Medicine(印第安纳大学医学院) King’s College London(伦敦国王学院) Massachusetts Institute of Technology(麻省理工学院) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Northeastern University(东北大学)

AI总结 本文探讨医学领域端到端事实核查系统的构建效度,指出其在连接现实声明与科学证据、处理模糊声明及主观真实性标签方面的挑战,主张将其视为互动沟通问题。

Comments ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22910 2026-04-30 cs.CL

Talent or Luck? Evaluating Attribution Bias in Large Language Models

天赋还是运气?评估大语言模型中的归因偏差

Chahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) Thomas Jefferson High School For Science and Technology(托马斯·杰斐逊科学与技术高中) University of Washington(华盛顿大学)

AI总结 研究探讨大语言模型在事件归因中的偏差,提出基于认知的评估框架,识别模型推理差异如何放大群体偏见。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22897 2026-04-30 cs.CL

VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models

VIGNETTE:面向视觉语言模型的社会性偏见评估

Chahat Raj, Bowen Wei, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

AI总结 本文提出VIGNETTE基准,通过多方向问题回答框架评估视觉语言模型的偏见,揭示模型在身份识别中的刻板印象和歧视性模式。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13963 2026-04-30 cs.CL cs.LG

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

通过压缩镜头:探讨量化对事实知识回忆的影响

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland Informatics Campus(萨尔州信息学院) LMU Munich(慕尼黑大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Technical University of Munich(慕尼黑技术大学)

AI总结 研究通过量化技术对大型语言模型的事实知识回忆能力影响,发现量化导致信息损失,但部分模型在低精度下表现更优,BitSandBytes保留最多原始精度的知识回忆能力。

Comments TrustNLP @ ACL 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00761 2026-04-30 cs.SE cs.AI cs.CL

Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models

找出阿基里斯之踵:一种用于动态揭示大语言模型事实错误的迭代方法

Wenxuan Wang, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Xiaohongshu Inc.(小红书公司) Tencent Inc.(腾讯公司)

AI总结 本文提出HalluHunter框架,通过知识图谱和规则基NLP技术,系统揭示大语言模型的事实错误,测试表明可触发55%的问题错误。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25676 2026-04-29 cs.CL cs.AI

CORAL: Adaptive Retrieval Loop for Culturally-Aligned Multilingual RAG

CORAL:面向文化对齐的多语言RAG自适应检索循环

Nayeon Lee, Jiwoo Song, Byeongcheol Kang

机构 * Naver(纳维尔) Samsung Research(三星研究院)

AI总结 CORAL通过迭代优化检索空间和查询,提升多语言检索生成在文化相关性上的表现,实验显示在低资源语言上准确率提升3.58%。

Comments 23 pages, 9 figures. Accepted at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25584 2026-04-29 cs.AI

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

DualFact+: 一种用于过程视频理解的多模态事实验证框架

Cennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland Informatics Campus(萨尔兰信息学校区)

AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24179 2026-04-29 cs.CL cs.AI

MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection

MemeScouts@LT-EDI 2026:问对问题——针对弱监督的提示方法用于表情包仇恨言论检测

Ivo Bueno, Lea Hirlimann, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 本文提出一种提示弱监督方法,通过分解表情包理解为基于问题的标注函数,提升多语言多模态仇恨言论检测效果,尤其在中文和印地语中表现突出。

Comments Accepted at Sixth Workshop on Language Technology for Equality, Diversity and Inclusion at ACL2026 (LT-EDI@ACL26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05110 2026-04-29 cs.AI

GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

GlimpRouter: 通过窥视一个思考标记实现高效的协作推理

Wenhao Zeng, Xuteng Zhang, Yuling Shi, Chao Hu, Yuting Chen, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出GlimpRouter框架,通过分析推理步骤首个标记的熵值来决定是否调用大模型,从而减少推理延迟并保持精度。

Comments Accepted to ACL 2026 Findings. Code available at https://github.com/Zengwh02/GlimpRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03136 2026-04-29 cs.CL cs.AI cs.RO

Limited Linguistic Diversity in Embodied AI Datasets

具身AI数据集中的语言多样性有限

Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Institute of Computer Science, University of Tartu(塔尔图大学计算机科学学院) Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校机械工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

AI总结 本文分析了多个广泛使用的视觉-语言-动作数据集的语言特性,发现其指令存在高度重复和结构单一的问题,旨在推动更详细的 dataset 报告和语言覆盖的扩展策略。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01490 2026-04-29 cs.CL

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

多个篮子里的合成鸡蛋:合成数据多样性对LLM微调的影响

Max Schaffelder, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

AI总结 本文研究合成数据来源多样性对LLM微调的影响,发现多样化数据可缓解分布崩溃,提升输出质量,并减少自偏好偏差。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏