arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 482 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2604.03922 2026-07-14 cs.LG 版本更新 70%

ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

ACES: 谁测试测试?留一法AUC一致性用于代码生成

Hui Sun, Yun-Ji Zhang, Zheng Xie, Ren-Biao Liu, Yali Du, Xin-Ye Li, Ming Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出ACES方法,通过留一法AUC评估测试区分正确与错误代码的能力,解决测试正确性判断的循环依赖问题,实现代码生成的高精度筛选。

Comments 32 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00137 2026-07-14 cs.AI cs.SE 版本更新 70%

Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents

开放、可靠且集体:一个由社区驱动的工具使用AI代理框架

Hy Dang, Quang Dao, Meng Jiang

机构 * University of Notre Dame(圣母大学) Rose-Hulman Institute of Technology(罗斯-霍曼理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出OpenTools框架,通过标准化工具方案、提供轻量级插件式封装及自动化测试套件,提升工具使用可靠性,实验表明社区贡献的高质量工具在多个架构上提升了6%-22%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04277 2026-07-14 cs.RO cs.AI 版本更新 70%

VehAnchor: Metadata-Free Metric Scale Recovery from Vehicle Cues in Aerial Imagery

VANGUARD:用于GPS受限环境下的无人机车辆锚定地面采样距离估计

Yifei Chen, Chenqian Le, Jiayi Cheng, Xupeng Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Tandon School of Engineering, New York University(纽约大学工学院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 VANGUARD通过利用车辆锚点和核密度估计,为无人机在GPS受限环境中提供可靠地面采样距离估计,降低空间推理中的误差和失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10504 2026-07-14 cs.CL 版本更新 70%

DR-Arena: an Automated Evaluation Framework for Deep Research Agents

DR-Arena:深度研究智能体的自动化评估框架

Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型作深度研究智能体时任务性能评估难的问题,提出DR-Arena自动化评估框架,通过动态调查、构建实时信息树、自动考官出题及自适应进化循环提升任务复杂性来评估,实验证明其与人类偏好对齐效果好,可替代人工裁决。

Comments 22 pages, 8 figures. Accepted to ACL 2026 as an oral presentation and selected as an SAC Highlight

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 27130-27152, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10790 2026-07-14 eess.AS 新提交 67%

Data Augmentation for L2 English Speaking Assessment using TTS

使用文本转语音技术进行第二语言英语口语评估的数据增强

Stefano Bannò, Penny Karanasou, Mengjie Qian, Kate M. Knill, Mark J. F. Gales

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对第二语言英语口语评估数据稀缺问题,利用文本转语音技术,通过分析说话者-文本关系,提出先将书面回答语音化,再转为语音,并研究配对策略的数据增强框架,经评估可提升评分性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 67%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09970 2026-07-14 cs.CR cs.CY 新提交 67%

Evaluating AI Models' Capability to Automate Voice Phishing Attacks

评估人工智能模型自动实施语音网络钓鱼攻击的能力

Fred Heiding, Claudio Mayrink Verdun, Simon Lermen, Andrew Kao, Vitor Albiero, Lauren Deason, Irina-Elena Veliche, Christine Lehane

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究评估美国成年人对人工智能驱动语音网络钓鱼攻击的易感性,通过大规模调查实验和定性访谈,让参与者接触多种语音模型及人类基线生成的诈骗场景,发现高合规率,分析得出人工智能驱动的vishing在经济上可行,其风险在于自动化经济性,引发相关政策担忧。

Comments Accepted for publication in Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-07-14 cs.CV 版本更新 67%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02772 2026-07-14 cs.SE 版本更新 67%

From Codebases to LLMs: Non-Inclusive Naming in Linux Foundation Repositories

从代码库到语言模型:Linux 基金会存储库中的非包容性命名

Honghao Tan, Md Nafiu Rahman, Shin Hwei Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究利用 NISCAN 框架检测 Linux 基金会存储库中代码及相关工件的非包容性术语,对 461 个存储库进行生态系统规模研究,分析术语变化及影响因素,还通过案例研究评估大语言模型处理情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06921 2026-07-14 cs.SD 版本更新 67%

Towards Event-Robust Acoustic Scene Classification

面向事件鲁棒的声学场景分类

Yiqiang Cai, Bohan Hu, Yu Yang, Pengwei Lu, Shengchen Li, Xi Shao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhongdian Zhiheng Information Technology Service Co., Ltd(中电智恒信息技术服务有限公司) China Telecom Jiangsu Branch(中国电信江苏分公司) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有声学场景分类系统在未知声音事件下性能下降的问题,提出事件移位声学场景数据集ESAS,通过大语言模型注入前景事件模拟真实环境,评估并推动事件鲁棒ASC研究。

Comments Accepted to Interspeech 2026. The ESAS dataset is available at: https://doi.org/10.5281/zenodo.21317541

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03430 2026-07-14 cs.RO 版本更新 67%

ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

ProAct:用于结构感知主动响应的基准和多模态框架

Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian, Zhenlin Hu, Yufei Huang, Yuchun Guo, Xinyu Wu, Zhengyou Zhang, Fangzhen Lin, Xuantang Xiong

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) Tencent, Shenzhen, China(腾讯(中国深圳)) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01767 2026-07-14 cs.CL cs.AI cs.LG 版本更新 67%

HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA

HiQA:一种用于多文档问答的分层上下文增强检索与生成模型

Xinyue Chen, Pengyu Gao, Jiangjiang Song, Xiaoyang Tan

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Southeast University(东南大学) Hello World(Shanghai) Technology Co., Ltd.(Hello World(上海)科技有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对检索增强生成在多文档问答中面对大量相似文档时检索准确性有限的问题,提出HiQA框架,它集成级联元数据与多路径检索机制,还发布MasQA基准,在多文档环境中展现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 62%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11267 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Enhancing LLMs through human feedback: a journey towards self-improvement

通过人类反馈增强语言模型:自我提升之旅

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

机构 * Intel Corporation(英特尔公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究在信息检索系统中,通过整合辅助反馈RAG系统及人工参与,利用人类反馈优化主RAG系统性能,经多数据集测试验证方法有效,强调了其变革潜力,为自适应信息检索技术研究树立了先例。

Comments AIC 2025: The 10th International Workshop on Artificial Intelligence and Cognition (held as part of ECAI 2025). October 25-26, 2025. Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22770 2026-07-14 cs.CY cs.AI cs.CL cs.HC 版本更新 62%

Learning in Blocks: A Multi Agent Debate Assisted Personalized Adaptive Learning Framework for Language Learning

基于块的学习:一种多智能体辩论辅助的个性化自适应语言学习框架

Nicy Scaria, Silvester John Joseph Kennedy, Deepak Subramani

机构 * Indian Institute of Science, India(印度科学研究院) Talking Yak, India(Talking Yak) Indian Institute of Technology Patna, India(帕纳布印度理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于块的学习框架,利用多智能体辩论技术评估语言能力,结合评分和推荐机制,通过间隔复习和掌握进度提升语言学习效果。

Comments Published as main paper in AIED 2026

Journal ref Artificial Intelligence in Education. AIED 2026. Lecture Notes in Computer Science(), vol 16582. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11751 2026-07-14 cs.CR cs.LG cs.MA 新提交 57%

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

当局部监测器遗漏组合性危害时:诊断多智能体系统中的分布式后门

Yibo Hu, Ren Wang

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究多智能体系统中分布式后门问题及局部监测器漏洞,提出可观测性边界概念,通过实验证明局部监测器在局部无害时会失效,还展示了特定监测器和门的效果,指出找到能暴露负载的表示形式是未解决问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交 57%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11486 2026-07-14 cs.CL 新提交 57%

Communicating Chess Strategies in Natural Language

用自然语言传达国际象棋策略

Langyuan Cui, Chun Kai Ling, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 针对人类难以理解国际象棋引擎走法背后策略的问题,提出策略语言化任务,设计了策略语言化流程与评估框架,实验表明自然语言可有效传达策略信息,还得出了关于评估、描述及评估方式的一些见解。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11342 2026-07-14 cs.SE cs.AI 新提交 57%

Fail-Aware and Explainable Test Oracle Prediction

故障感知与可解释的测试预言机预测

Yue Zhao, Binish Tanveer, Jelena Zdravkovic

机构 * Department of Computer and Systems Sciences(计算机与系统科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对测试预言机构建难题,提出基于代码语言模型的FOCAL方法预测测试前缀成败,通过学习带标签数据、强调失败案例损失及基于行为证据预测,相比基线方法提升了未见过项目失败案例性能并提供更丰富解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11279 2026-07-14 cs.CL 新提交 57%

FAD-SA-GRU: Enhancing Hate Speech Detection in Algerian Dialect Through Feature-Augmented Self-Attention GRU Networks

FAD-SA-GRU:通过特征增强自注意力GRU网络增强阿尔及利亚方言中的仇恨言论检测

Sara Yakoubi, Ikram Khalfallah, Kenza Khelkhal, Dihia Lanasri

机构 * USTHB(阿尔及尔科学技术大学) ATM Mobilis Algiers(阿尔及尔移动ATM公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究阿尔及利亚方言社交媒体上的仇恨言论检测,提出FAD-SA-GRU混合架构,通过多嵌入融合结合多种语义表示,经自注意力增强GRU编码器检测。实验表明该方法在多指标上优于基线,有效提升低资源方言仇恨言论检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10972 2026-07-14 cs.AI 新提交 57%

From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth

从检查器到预测器:在延迟的地面真值下对模型生成的战略路线进行代码拥有的评估

Aleh Manchuliantsau

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在地面真值延迟等情况下对模型生成战略路线的评估,提出RouteCast机制,通过模型提出候选路线等产生临时预测排名,后续结果评估预测,在回顾性试点中显示出一定区分能力,建立了可行性结果并揭示失败模式。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交 57%

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10380 2026-07-14 cs.CL 新提交 57%

CAFE: A Compound-AI Factorial Evaluation Framework

CAFE:一种复合人工智能因子评估框架

Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff

机构 * University of Göttingen(哥廷根大学) Bielefeld University of Applied Sciences and Arts (HSBI)(比勒费尔德应用科学与艺术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CAFE是开源平台,用于复合人工智能系统评估。它将管道组件设为因子构建析因设计,运行配置并用模型评判器和人工评分。能归因质量差异,报告多种结果,还能解释组件影响,在问答管道验证有效,已发布为Python包和Web应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09908 2026-07-14 cs.CL cs.IR 新提交 57%

RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation

RouteRec:推荐代理选择与聚合的严格评估

Kaiji Zhou, Vladimir Kalmykov, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究在推荐系统异构代理选择中,RouteRec框架在成本约束下比较请求级硬选与项目级学习聚合,发现在MovieLens-1M数据集上,请求级选择粗糙,项目级聚合更有前景,不同聚合方式有不同效果。

Comments 8 pages, 7 figures. Accepted at AgentSearch 2026 (The First Workshop on Indexing, Retrieval, and Ranking of AI Agents), co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 57%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23993 2026-07-14 cs.CL 版本更新 57%

The GRADIEND Python Package: An End-to-End System for Gradient-Based Feature Learning

GRADIEND Python包:一种基于梯度的特征学习端到端系统

Jonathan Drechsel, Steffen Herbold

机构 * Faculty of Computer Science and Mathematics University of Passau(计算机科学与数学学院 巴伐利亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 GRADIEND Python包提供端到端系统,通过语言模型中的事实-反事实MLM和CLM梯度学习特征方向,并支持特征数据创建、训练、评估及多特征比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07533 2026-07-14 cs.IR cs.CL cs.DL 版本更新 57%

Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature

《相似轨迹:拉丁文学中互文性提取的基准》

Julian Schelb, Michael Wittweiler, Marie Revellio, Barbara Feichtinger, Andreas Spitz

机构 * Department of Computer and Information Science, University of Konstanz(计算机与信息科学系,康斯坦茨大学) Department of Latin Philology, University of Konstanz(拉丁语言学系,康斯坦茨大学) Department of Archaeology, Classical Philology and Ancient Studies, University of Zurich(考古学、古典语言学与古代研究系,苏黎世大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对拉丁文学互文性提取任务,因缺乏标准化基准和数据集阻碍新方法发展的问题,引入“相似轨迹”基准,利用约172k文本片段数据集及545个相似之处,用先进语言模型建立互文性检索和分类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新 57%

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏