arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 142 篇

2508.15760 2026-05-26 cs.CL cs.AI 79%

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

LiveMCP-101:对支持MCP的智能体进行压力测试与诊断

Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sathish Reddy Indurthi, Xun Wang, Yiran Chen, Kaiqiang Song

机构 * Duke University(杜克大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对MCP工具在动态多步任务中的评估空白,提出LiveMCP-101基准测试(101个真实查询),通过并行评估框架发现前沿LLM成功率低于60%,并识别出七种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24331 2026-05-26 cs.CV 78%

Spatial-aware Vision Language Model for Autonomous Driving

面向自动驾驶的空间感知视觉语言模型

Weijie Wei, Zhipeng Luo, Ling Feng, Venice Erin Liong

机构 * Motional University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出LVLDrive框架,通过融合LiDAR点云与视觉语言模型,利用渐进融合Q-Former和空间感知问答数据集,解决3D度量空间推理瓶颈,提升自动驾驶场景理解与决策可靠性。

Comments Accepted to CVPR AutoPilot Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09431 2026-05-26 cs.CR cs.CV 78%

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models

基于文本驱动的攻击:提升编码器对抗迁移性以攻击大型视觉-语言模型

Xinwei Zhang, Li Bai, Tianwei Zhang, Youqian Zhang, Qingqing Ye, Yingnan Zhao, Ruochen Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出文本驱动攻击(GDA),通过将扰动优化与文本接地证据对齐,并采用接地感知扰动分配和接地中心证据破坏策略,显著提升编码器攻击在黑盒大型视觉-语言模型上的迁移性。

Comments Under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25676 2026-05-26 cs.CL 77%

Llamion Technical Report

Llamion 技术报告

Kisu Yang, Yoonna Jang, Hyeonseok Moon, Hwanseok Jang, Taewoo Lee, Hyungjin Lee, Jeseung Lee, Juhyoung Park, Heuiseok Lim

机构 * VAIV Company(VAIV公司) Korea University(韩国大学) University of Copenhagen(哥本哈根大学) Samsung Electronics(三星电子)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出 KEPT 方法将 Orion-14B 转换为 Llama 架构的 Llamion 模型,通过参数映射和知识蒸馏在少量数据上恢复性能,并在 KoMMLU 上达到领先水平。

Comments Research conducted in 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25626 2026-05-26 cs.CL 77%

Beyond Literal Translation: Evaluating Cultural Effectiveness in Social Media UGC

超越字面翻译:评估社交媒体用户生成内容中的文化有效性

Linjuan Wu, Ruiqi Zhang, Xinze Lyu, Ye Guo, Daoxin Zhang, Zhe Xu, Yao Hu, Yixin Cao, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对社交媒体用户生成内容翻译中文化传递与情感共鸣不足的问题,提出CULTURE-MT基准,通过构建涵盖14个领域、4种文化负载类型的1002条UGC笔记,并引入文化有效性评估标准,实验表明传统指标无法捕捉文化有效性,且基础LLM的文化有效性与模型规模相关。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25272 2026-05-26 cs.AI cs.CY stat.AP 77%

AI Cartography: Mapping the Latent Landscape of AI Benchmark Ecosystems

AI 制图:绘制 AI 基准生态系统的潜在景观

Michael Hardy, Anka Reuel, Lijin Zhang, Jodi M. Casabianca, Sang Truong, Yash Dave, Hansol Lee, Benjamin Domingue, Sanmi Koyejo

机构 * Open LLM Leaderboard(开放大语言模型排行榜) HELM ICML(国际机器学习会议)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 针对排行榜分数受测量噪声影响的问题,提出基于验证性因子分析和概化理论的框架,分解排名方差来源,揭示基准间关系、局部依赖性及元数据影响,并比较显式与潜在缩放律的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21463 2026-05-26 cs.SD cs.AI 77%

Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs

通过先验增强的音频大语言模型统一语音编辑检测与内容定位

Jun Xue, Yi Chai, Yanzhen Ren, Jinshen He, Zhiqiang Tang, Zhuolin Yi, Yihuan Huang, Yuankun Xie, Yujie Chen

机构 * Key Laboratory of Aerospace Information Security(航空信息安全与可信计算重点实验室) School of Cyber Science and Engineering(网络安全工程学院) Wuhan University(武汉大学) Independent Researcher(独立研究员) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) Communication University of China(中国通信大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出基于音频大语言模型的统一框架,通过生成式方法联合处理语音编辑检测和内容定位,并引入先验增强策略和声学一致性损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24267 2026-05-26 cs.CL 77%

DRInQ: Evaluating Conversational Implicature with Controlled Context Variation

DRInQ: 通过受控上下文变化评估会话含义

Hirona Jacqueline Arai, Xiang Ren

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出DRInQ基准,通过半自动化管道生成系统变化的问答上下文实例,评估大语言模型在会话含义中的语用推理能力,发现模型在生成与推理之间存在不对称性。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22542 2026-05-26 cs.CL 77%

Scene Abstraction for Lexical Semantics: Structured Representations of Situated Meaning

词汇语义的场景抽象:情境意义的结构化表示

Yejin Cho, Katrin Erk

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出场景抽象框架,通过少样本提示大语言模型构建词汇使用情境的结构化表示,实验证明场景可可靠识别且优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25446 2026-05-26 cs.AI cs.LG 76%

A Signal-Language Foundation Model for Broad-Spectrum Cardiovascular Assessment from Routine Electrocardiography

面向常规心电图广谱心血管评估的信号-语言基础模型

Ziqing Yu, Yuhui Tao, Jiayu Huo, Lei Pan, Zilong Xiao, Juecheng Chen, Xiao Li, Jianxuan Li, You Zhou, Zhixing Li, Cong Wang, Beijian Zhang, Chen Chen, Hongyang Lu, Konstantinos Patlatzoglou, Daniel B. Kramer, Jonathan W. Waks, Yangang Su, Fu Siong Ng, Shuo Wang, Yixiu Liang, Junbo Ge

机构 * Department of Cardiology, Zhongshan Hospital of Fudan University(复旦大学中山医院心内科) Shanghai Institute of Cardiovascular Diseases, National Clinical Research Centre for Interventional Medicine(上海心血管病研究所,国家介入医学临床研究中心) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学研究院数字医疗研究中心) Shanghai Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention(上海医学影像计算与计算机辅助手术重点实验室) National Heart and Lung Institute, Imperial College London, Hammersmith Hospital, Du Cane Road(伦敦帝国学院国家心肺研究所,哈马舍姆医院,杜肯路) Department of Cardiology, Shanghai Geriatric Medical Center(上海老年医学中心心内科) Cardiac Rhythm Management, Medtronic Technology Center, Medtronic (Shanghai) Ltd.(美敦力技术中心,美敦力(上海)有限公司,心律管理部) Richard A. and Susan F. Smith Center for Outcomes Research in Cardiology, Beth Israel Deaconess Medical Center, Harvard Medical School(哈佛医学院比尔·德·阿克谢心脏结局研究中心,贝斯以色列·德aconess医疗中心) Harvard-Thorndike Electrophysiology Institute, Beth Israel Deaconess Medical Center, Harvard Medical School(哈佛-托尔恩迪克电生理研究所,贝斯以色列·德aconess医疗中心,哈佛医学院) Department of Cardiology, Imperial College Healthcare NHS Trust(伦敦帝国学院医疗信托心内科部) Department of Cardiology, Chelsea and Westminster NHS Foundation Trust(切尔西和温斯洛医院 NHS 基础信托心内科部) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 提出ECGCLIP信号-语言对比学习框架,通过大规模心电图-报告预训练,在89项下游任务中超越基线,实现对常见心律失常、超声心动图靶标及罕见心脏病的广谱评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24556 2026-05-26 cs.IR cs.CL cs.LG 76%

The Multilingual Curse at the Retrieval Layer: Evidence from Amharic

多语言诅咒在检索层:来自阿姆哈拉语的证据

Yosef Worku Alemneh, Kidist Amde Mekonnen, Maarten de Rijke

机构 * Independent Researcher(独立研究者) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG;large language model(comments);language model(comments)

AI总结 针对零样本多语言检索在低资源形态丰富语言(如阿姆哈拉语)上表现不佳的问题,通过对比实验发现单语检索器显著优于多语言检索器,并揭示了多语言基准测试的局限性。

Comments 10 pages, 4 tables. Accepted to the 1st Workshop on Multilinguality in the Era of Large Language Models (MeLLM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25334 2026-05-26 cs.CV 75%

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

双路径几何感知多模态大语言模型用于空间智能

Yufei Zheng, Xuhan Zhu, Zide Liu, Chunpeng Zhou, Chenfeng Wang, Yongchao Xu, Yunnan Wang, Jiawei Liu, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出GAMSI,一种仅以RGB图像为输入、通过双路径查询和专家引导视觉对齐实现3D结构与度量尺度联合感知的多模态大语言模型,在七个空间智能基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25180 2026-05-26 cs.LO cs.PL 75%

DateSAT: A Framework for Solving Date and Period Constraints

DateSAT: 解决日期和周期约束的框架

Leyi Cui, Shrey Tiwari, Rohan Padhye

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出DateSAT框架,通过形式化日期与周期算术语义并归约为整数SMT公式,实现日期约束的可满足性求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12850 2026-05-26 cs.CL cs.AI cs.CR cs.LG 75%

Persona-Model Collapse in Emergent Misalignment

涌现性失调中的人格模型崩溃

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出人格模型崩溃假说,通过道德易感性(S)和道德稳健性(R)两个指标,证明在有害数据上微调大语言模型会导致模型模拟、区分和维持一致角色的内部能力恶化,从而引发涌现性失调。

Comments 23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24292 2026-05-26 cs.LG 74%

TUBE: Tangent Upper Bound on Evidence for Discrete Diffusion Language Models

TUBE: 离散扩散语言模型证据的切线上界

Arseny Ivanov, Sergei Kholkin, Vladislav Gromadskii, Grigoriy Ksenofontov, Ivan Oseledets, Alexander Korotin

机构 * Applied AI Institute(应用人工智能研究所) HSE University(俄罗斯高等经济学院) MIRAI

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 针对离散扩散模型无法精确计算对数似然的问题,提出变分上界TUBE,并通过无偏蒙特卡洛估计器评估,发现块状扩散模型和块状任意阶自回归模型的对数似然严格低于自回归模型基线。

Comments Preprint. 9 pages main text, 5 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25836 2026-05-26 cs.CR cs.AI cs.CL 73%

TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification

TTPrint:通过发散-收敛验证实现基于证据的TTP提取

Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Universitas Ary Ginanjar(阿里甘jar大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出TTPrint方法,采用先广泛提取后严格验证的发散-收敛设计,结合确定性证据定位与权威定义验证,在文档级TTP提取任务上显著提升宏F1分数。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16023 2026-05-26 cs.CL cs.LG 73%

Judge Circuits

Judge Circuits

Nils Feldhus, Tanja Baeumel, Elena Golimblevskaia, Qianli Wang, Van Bach Nguyen, Aaron Louis Eidt, Selin Kahvecioglu, Christopher Ebert, Wojciech Samek, Jing Yang, Vera Schmitt, Sebastian Möller, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) Marburg University(马尔堡大学) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信人工智能研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究利用位置感知边归因修补(PEAP)因果分析Gemma-3、Qwen2.5和Llama-3的内部机制,发现结构化理解和开放式偏好任务中的判断共享一个稀疏、泛化的潜在评估子图,并通过解耦抽象判断与输出格式,揭示了格式诱导不一致性的机制原因。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25162 2026-05-26 cs.CL cs.AI 73%

STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media

STREAM:一个以数据为中心的框架,用于从流媒体中挖掘高价值任务导向对话

Liang Xue, Haoyu Liu, Cheng Wang, Pengyu Chen, Haozhuo Zheng, Yang Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Byering Technology(伯英技术)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出STREAM框架,利用流媒体数据合成大规模多领域任务导向对话数据集StreamDial,通过角色构建和对话蓝图结合RAG生成高质量对话,解决数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24703 2026-05-26 cs.CL cs.AI 73%

TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

TS-Skill: 用于评估时间序列问答中分析技能的基准

Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Samsung Research America(三星美国研究院) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TS-Skill基准,通过三种可组合的分析技能(时间尺度选择、时间定位和跨区间整合)来诊断时间序列问答中模型的信号级能力,并开发SKEvol框架自动构建基准,实验揭示不同技能上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26086 2026-05-26 cs.AI 70%

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

Claw-Anything: 对更广泛访问用户数字世界的始终在线个人助手的基准测试

Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu

机构 * Beijing Institute of Technology(北京理工大学) Huawei Technologies Co., Ltd(华为技术有限公司) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Claw-Anything基准测试,通过扩展长期活动历史、相互依赖的后端服务以及跨多设备的GUI和CLI交互三个维度,评估大型语言模型代理在始终在线环境下的性能,发现GPT-5.5仅达34.5% pass@1,并发布自动化数据生成管道提升基线模型23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25707 2026-05-26 cs.AI 70%

AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions

AgentHijack:基准测试计算机使用智能体对常见环境干扰的鲁棒性

Jingwei Sun, Jianing Zhu, Yuanyi Li, Tongliang Liu, Xia HU, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sydney AI Centre, The University of Sydney(悉尼大学 AI 中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentHijack基准,通过9种可配置的常见环境干扰评估多模态大语言模型驱动的计算机使用智能体的鲁棒性,并设计AgentHijack-Agent框架提升其抗干扰能力。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05550 2026-05-26 cs.CL cs.CE 70%

AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery

AutoSOTA:面向最先进AI模型发现的端到端自动化研究系统

Yu Li, Chenyang Shao, Xinyang Liu, Ruotong Zhao, Peijie Liu, Hongyuan Su, Zhibin Chen, Qinglong Yang, Anjie Xu, Yi Fang, Qingbin Zeng, Tianxing Li, Jingbo Xu, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) Zhongguancun Academy(中关村学院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出AutoSOTA系统,采用多智能体架构实现从论文复现到模型优化的全自动化,成功发现105个超越原始方法的新SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07644 2026-05-26 cs.AI 70%

FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations

FloorplanQA:使用结构化表示进行大语言模型空间推理的基准测试

Fedor Rodionov, Abdelrahman Eldesokey, Michael Birsak, John Femiani, Bernard Ghanem, Peter Wonka

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学) Miami University(迈阿密大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FloorplanQA基准,通过结构化室内场景表示评估大语言模型在距离测量、可见性、路径查找和物体放置等空间推理任务上的表现,揭示模型在物理约束和空间一致性方面的盲点。

Comments ICML 2026, Project page: https://OldDeLorean.github.io/FloorplanQA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25226 2026-05-26 cs.CL 70%

From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

从自动化到协作:面向安全可信NLP的人机协同方法

Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul Islam

机构 * Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Electrical and Electronic Engineering, Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学电子与电气工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了人机协同方法,通过人类监督支持审计、鲁棒性评估、数据构建和模型引导,以提升NLP在安全可信方面的表现,并指出了可扩展探测、可持续鲁棒性基准、低资源设置和私有系统治理等方面的差距。

Comments Preprint, manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25052 2026-05-26 cs.CL 70%

Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

忠实性指标并不衡量忠实性:基于真实标签的元评估

Yoav Gur-Arieh, Ana Marasović, Mor Geva

机构 * Tel Aviv University(特拉维夫大学) University of Utah(犹他大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对思维链忠实性度量缺乏真实标签验证的问题,构建了包含真实忠实性标签的数据集BonaFide,系统评估现有指标,发现多数指标表现接近随机、存在偏差且计算成本高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24885 2026-05-26 cs.CL 70%

DTO: a Differentiable Training Objective for Effective Counterfactual Story Rewriting

DTO:一种用于有效反事实故事重写的可微分训练目标

Amelia Girard, Massimo Piccardi

机构 * University of Technology Sydney(技术大学悉尼)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种可微分训练目标(DTO),通过端到端反向传播联合优化对参考重写的忠实度和与源叙事的语义一致性,以解决反事实故事重写中模型忽略细微修改的问题。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24883 2026-05-26 cs.AI cs.CR cs.SE 70%

Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications

反转盾牌:从策略规范中系统生成安全测试

Xiaoyue Lu, Xianglin Yang, Haijun Liu, Jiahao Liu, Kuntai Cai, Yan Xiao, Jin Song Dong

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出POLARIS框架,通过将非结构化自然语言策略编译为一阶逻辑表示并构建语义策略图,实现覆盖驱动的可重复安全测试,相比基线方法提高了策略覆盖率和攻击成功次数。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24652 2026-05-26 cs.AI cs.CV cs.MM cs.SD 70%

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

AVBench:面向音视频生成模型的人类对齐与自动化评估基准

Jialiang Yang, Bin Xia, Ruihang Chu, Dingdong Wang, Wanke Xia, Zhun Mou, Tianyang Zhong, Yiting Zhao, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 提出AVBench,通过细粒度人类中心指标和偏好学习训练的专业评估器,实现音视频生成的自动化、准确评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08988 2026-05-26 cs.AI 70%

SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment

SEA-Eval: 超越情景评估的自进化智能体基准

Sihang Jiang, Lipeng Ma, Zhonghua Hong, Keyi Wang, Zhiyu Lu, Tengfei Wang, Shisong Chen, Jinghao Zhang, Tianjun Pan, Weijia Li, Jiaqing Liang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出自进化智能体(SEA)的形式化定义及其最小充分架构进化飞轮,并构建首个专门评估SEA的基准SEA-Eval,通过顺序任务流设计量化进化增益、稳定性和隐式对齐收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21297 2026-05-26 cs.CL 70%

Persuasion Should be Double-Blind: A Multi-Domain Dialogue Dataset With Faithfulness Based on Causal Theory of Mind

说服应该是双盲的:基于因果心智理论的多领域对话数据集

Dingyi Zhang, Linhai Zhang, Fanglei Qu, Ziqing Zhuang, Deyu Zhou

机构 * Department of Informatics, King’s College London(信息学院,伦敦国王学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于因果心智理论的多智能体框架ToMMA构建双盲说服对话数据集CToMPersu,以解决现有数据集信息泄露问题,提升对话真实性和说服力。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏