arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 142 篇

2507.05890 2026-05-26 cs.CL cs.AI 85%

Psychometric Item Validation Using Virtual Respondents with Trait-Response Mediators

使用具有特质-反应中介的虚拟受访者进行心理测量项目验证

Sungjib Lim, Woojung Song, Eun-Ju Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Communication, Seoul National University(首尔国立大学通信系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种利用LLM模拟虚拟受访者(通过中介因素)来高效验证心理测量项目效度的框架,实验证明该方法能有效识别高有效性项目。

Comments This paper has been accepted for publication at TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24699 2026-05-26 cs.AI cs.LG 85%

MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional

MDIA:HealthBench Professional上的多智能体诊断智能流水线

Roberto Cruz, David Rey-Blanco

机构 * TietAI

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出MDIA多智能体诊断系统,通过7节点专业路由临床推理图架构,在非微调LLM上实现HealthBench Professional基准性能提升3.72个百分点,归因于系统架构设计而非提示工程。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22874 2026-05-26 cs.CL 84%

A Comprehensive Dataset for Human vs. AI Generated Text Detection

人类与AI生成文本检测的综合数据集

Rajarshi Roy, Gurpreet Singh, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Gaytri Jena, Amitava Das, Amit Sheth, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) IIIT Guwahati(古瓦哈提理工学院) IIIT Delhi(德里理工学院) BITS Pilani Hyderabad Campus(比什帕利 Hyderabad 分校) University of South Carolina(南卡罗来纳大学) NIT Silchar(西里 char 工程学院) San José State University(桑乔斯州立大学) UCLA(加州大学洛杉矶分校) Washington State University(华盛顿州立大学) Vishwakarma Institute of Information Technology(维斯瓦卡arma 信息科技学院) Gandhi Institute for Technological Advancement(甘地技术进步研究所) BITS Pilani Goa(比什帕利 Goa 分校) Meta AI Amazon AI(亚马逊AI)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一个包含73,193个文本样本的综合数据集,结合真实纽约时报文章与多个先进LLM生成的合成文本,用于区分人类与AI生成文本及归因任务,基线准确率分别为58.35%和8.92%。

Comments Defactify4 @AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24693 2026-05-26 cs.CL 84%

CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming

CP-Agent: 一种用于反馈驱动竞赛编程的校准风险控制智能体

Peisong Wang, Bowen Liu, Zehua Li, Yuyao Wang, Zhiwei Ma, Yuhan Li, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出CP-Agent,通过校准停止过程建模反馈驱动求解,结合双重粒度验证、测试增强和经验驱动自我进化机制,在不更新参数的情况下显著提升竞赛编程性能。

Comments Code: https://github.com/NineAbyss/CP-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24573 2026-05-26 cs.CL 84%

AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models

AstroMind:基于大型语言模型的航天器行为推理高保真基准

Hao Liu, Siyuan Yang, Qinglei Hu, Dongyu Li

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) KTH Royal Institute of Technology(皇家理工学院) School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学网络空间安全学院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 针对航天器机动行为理解问题,提出基于高保真天体动力学模拟和真实观测约束的基准AstroMind,涵盖意图推断、参数估计和威胁评估三类任务,并评估多种开源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28128 2026-05-26 cs.LG cs.CR 84%

ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment

ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架

Tran Duong Minh Dai, Triet Huynh Minh Le, M. Ali Babar, Van-Hau Pham, Phan The Duy

机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) Vietnam National University(越南国家大学) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。

Comments 21 pages, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12194 2026-05-26 cs.AI cs.CV 84%

Teaching large language models to reason like expert diagnosticians

教会大型语言模型像专家诊断医生一样推理

Thomas A. Buckley, Riccardo Conci, Peter G. Brodeur, Jason Gusdorf, Sourik Beltrán, Bita Behrouzi, Byron Crowe, Jacob Dockterman, Muzzammil Muhammad, Sarah Ohnigian, Andrew Sanchez, James A. Diao, Aashna P. Shah, Daniel Restrepo, Eric S. Rosenberg, Andrew S. Lea, Emily Glanton, Kimberly LeBlanc, Undiagnosed Diseases Network, Marinka Zitnik, Scott H. Podolsky, Zahir Kanjee, Raja-Elie E. Abdulnour, Jacob M. Koshy, Adam Rodman, Arjun K. Manrai

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达医院内科部) The Mongan Institute, Massachusetts General Hospital(麻省总医院蒙根研究所) Division of Gastroenterology, Brigham and Women’s Hospital(布里洛妇女医院胃肠病科) Department of Medicine, Brigham and Women’s Hospital(布里洛妇女医院内科部) Department of Medicine, Massachusetts General Hospital(麻省总医院内科部) Department of Pathology, Massachusetts General Hospital(麻省总医院病理学部) Department of Health Humanities and Bioethics, University of Rochester School of Medicine and Dentistry(罗切斯特大学医学院和牙科学院健康人文与生物伦理学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学凯普纳人工智能研究所) Center for the History of Medicine, Countway Library of Medicine, Harvard Medical School(哈佛医学院医学史中心,考特维图书馆) Department of Global Health and Social Medicine, Harvard Medical School(哈佛医学院全球健康与社会医学部) Division of Pulmonary and Critical Care Medicine, Brigham and Women’s Hospital(布里洛妇女医院呼吸科和重症医学科)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出 Dr. CaBot 代理 AI 系统,通过生成基于初始病例描述的幻灯片演示来模拟专家诊断推理,并在 NEJM CPC 和 NIH 未诊断疾病网络病例上取得优于前沿模型的表现,同时发布 CPC-Bench 基准以促进临床 AI 发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10090 2026-05-26 cs.AI cs.CL cs.LG 83%

Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning

Agent World Model: 用于智能体强化学习的无限合成环境

Zhaoyang Wang, Canwen Xu, Boyi Liu, Yite Wang, Siwei Han, Zhewei Yao, Huaxiu Yao, Yuxiong He

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Agent World Model (AWM)全合成环境生成管道,通过代码驱动和数据库支持的环境进行大规模强化学习,使智能体在多样日常场景中泛化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25388 2026-05-26 cs.LG q-bio.QM 83%

ViroBench: Benchmarking Nucleotide Foundation Models on Viral Genomics Tasks

ViroBench:病毒基因组学任务中的核苷酸基础模型基准测试

Dongxin Ye, Fang Hu, Han Hu, Shu Hu, Yang Tan, Wanli Ouyang, Stan Z. Li, Jie Cui, Nanqing Dong

机构 * Shanghai Innovation Institute Shanghai China(深圳河套学院) University of Electronic Science Fudan University Shanghai China Shanghai Artificial Intelligence Laboratory Shanghai China Institute of Infection Health Fudan University Shanghai China Shanghai Sci-Tech Inno Center for Infection \& Immunity Shanghai China Shanghai Jiao Tong University Shanghai China Shenzhen Loop Area Institute Shenzhen China Chinese University of Hong Kong Hong Kong China Westlake University Hangzhou China Shanghai Innovation Institute Fudan University Shanghai Artificial Intelligence Laboratory Shanghai Sci-Tech Inno Center for Infection \& Immunity Shanghai Jiao Tong University Shenzhen Loop Area Institute Chinese University of Hong Kong Westlake University

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出首个针对病毒基因组学的综合基准ViroBench,评估66个核苷酸基础模型在生物学理解和潜在生物安全风险上的表现,发现模型在系统发育和时间偏移下性能下降,生成任务中统计似然与生物功能有效性脱钩,且预训练数据的分类多样性比参数规模更重要。

Comments 42 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24647 2026-05-26 cs.CL 83%

Know You Before You Speak: User-State Modeling for LLM Personalization in Multi-Turn Conversation

在你说话之前了解你:多轮对话中用于LLM个性化的用户状态建模

Jiani Luo, Xiaoyan Zhao, Yang Zhang, Shuyi Miao, Bingbing Xu, Stefan Konigorski, Tat-Seng Chua

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) German Institute of Human Nutrition Potsdam-Rehbruecke(德国人类营养研究所波茨坦-雷赫布鲁克)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于自由能原理的PUMA框架,通过显式用户状态模型和动作选择机制,将个性化对话从被动记忆检索转变为基于模型的用户演化决策,在医疗咨询基准上提升长期对话效果。

Comments 30pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25814 2026-05-26 cs.CL cs.AI 82%

Adaptive Graph Refinement and Label Propagation with LLMs for Cost-Effective Entity Resolution

自适应图优化与基于大语言模型的标签传播用于经济高效实体解析

Hongtao Wang, Renchi Yang, Haoran Zheng, Xiangyu Ke

机构 * Hong Kong Baptist University(香港 Baptist 大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出Alper框架,通过迭代概率标签传播整合匹配与聚类,自适应融合图传播弱信号与LLM强查询,在预算约束下最大化边际增益,实现高效实体解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10644 2026-05-26 cs.AI cs.CL cs.CR cs.HC cs.MA 82%

From Multi-Agent Systems and the Semantic Web to Agentic AI: A Unified Narrative of the Web of Agents

从多智能体系统和语义网到智能体AI:智能体网络的统一叙事

Tatiana Petrova, Boris Bliznioukov, Aleksandr Puzikov, Radu State

机构 * SEDAN - SnT University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出智能体网络(WoA)经历了从平台端协调(第一代)、数据端标注(第二代)到模型端解释(第三代)的语义努力迁移,并分析了各代失败模式及当前开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24247 2026-05-26 cs.CL cs.AI 82%

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

通过详细的宪法定义和AI驱动的评估提高标注一致性

Konstantin Berlin, Adam Swanda

机构 * Cisco AI Defense(思科AI防御)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出一种AI驱动的工作流,通过为每个类别编写详细的宪法定义并由前沿LLM解释,以比人类更一致和准确地生成黄金标签,在三个内容审核类别上将跨模型不一致性降低高达57倍。

Comments Under review at ACL Rolling Review (ARR), May 2026 cycle. Also available at https://doi.org/10.5281/zenodo.20125267

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23956 2026-05-26 cs.AI cs.LG cs.MA 82%

QUIVER: A Formal Framework for Quantifying Perturbation Propagation and Bifurcation in Compound AI Systems

QUIVER: 复合AI系统中扰动传播与分岔的量化形式化框架

Prashanti Nilayam, Sankalp Nayak

机构 * Servicenow CA, USA(Servicenow加州美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出QUIVER形式化框架,通过敏感性矩阵、轨迹散度、分岔阈值和分布忠实度四个组件,量化图结构LLM流水线中扰动传播与结构分岔,并在三个不同架构的企业和公共流水线上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL 82%

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI;large language model(comments)

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25686 2026-05-26 cs.CL 81%

Testing the Deliteralization Hypothesis in Human and Machine Translation

测试人类与机器翻译中的去字面化假设

Malik Marmonier, Rachel Bawden, Benoît Sagot

机构 * Inria(法国国家信息与自动化研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过比较人类翻译、NMT系统与LLM在54个语言对上的字面化程度,验证去字面化假设是否适用于LLM生成与修订过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21602 2026-05-26 cs.AI cs.SE 81%

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

基准测试与改进LLMs中的分布外对齐失败监控器

Dylan Feng, Pragya Srivastava, Anca Dragan, Cassidy Laidlaw

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Haize Labs, New York, USA(Haize实验室) Google DeepMind, India(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24775 2026-05-26 cs.AI cs.MA 81%

PRIMA: Operational Patterns for Resilient Multi-Agent Research with Verifiable Identity and Convergent Feedback

PRIMA: 具有可验证身份和收敛反馈的弹性多智能体研究的操作模式

Sasank Annapureddy

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对长时间运行的多智能体LLM系统面临的故障模式,提出PRIMA框架,包含弹性恢复、子智能体操作规范和结构化工程交付的多阶段应用模式,并通过图同构案例验证其有效性。

Comments 11 pages. Single-author preprint. Supplementary case-study report (Graph Isomorphism algorithm proposal with three theorems, five conjectures, complete complexity analysis, and hard-instance evaluation) available at https://spockstein.github.io/prima/case-study-graph-isomorphism.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21740 2026-05-26 cs.AI 81%

SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

SMDD-Bench: 大语言模型能否解决真实世界的小分子药物设计任务?

Kevin Han, Renfei Zhang, Kathy Wei, Hamed Mahdavi, Niloofar Mireshghallah, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学) Stealth Pennsylvania State University(隐形宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SMDD-Bench基准,通过502个多轮长时任务实例评估LLM在真实小分子药物设计中的表现,发现最优模型GPT5.4仅解决40.2%任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24371 2026-05-26 cs.CV cs.CL 81%

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation

SliceWorld: 一种用于CT报告生成的预测性和可控世界状态模型

Yuanhe Tian, Yan Song

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出SliceWorld世界状态框架,通过编码CT切片序列为因子感知的潜在状态,实现未来切片预测、病变因子干预和LLM报告生成,在M3D-Cap和CT-RATE上提升NLG指标和临床评估。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24117 2026-05-26 cs.AI 81%

SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills

SkillEvolBench:从情景经验到程序性技能的演化基准测试

Yingtie Lei, Zhongwei Wan, Jiankun Zhang, Samiul Alam, Zixuan Zhong, Peizhou Huang, Xin Wang, Jingxuan Zhang, Donghao Zhou, Yunta Hsieh, Zhihao Dou, Hui Shen, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) The University of Chicago(芝加哥大学) University College London(伦敦大学学院) University of Michigan(密歇根大学) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillEvolBench基准,通过六个真实环境中的180个任务,评估大语言模型代理能否将情景经验提炼为可复用的程序性技能,发现当前代理难以形成稳健的技能,且原始轨迹复用优于蒸馏技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24096 2026-05-26 cs.DB cs.AI cs.DC cs.SE 81%

The Time is Here for Just-in-Time Systems: Challenges and Opportunities

即时系统的时代已到来:挑战与机遇

Shu Liu, Alexander Krentsel, Shubham Agarwal, Mert Cemri, Ziming Mao, Soujanya Ponnapalli, Alexandros G. Dimakis, Sylvia Ratnasamy, Matei Zaharia, Aditya Parameswaran, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出基于LLM的即时系统合成方法Jitskit,通过从零开始合成专用键值存储系统,在18个规格上性能超越现有系统最高达4.6倍。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05448 2026-05-26 cs.LG 81%

BlitzRank: Principled Zero-shot Ranking Agents with Tournament Graphs

BlitzRank: 基于锦标赛图的原则性零样本排序智能体

Sheshansh Agrawal, Thien Hang Nguyen, Douwe Kiela

机构 * ContextualAI

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出一种基于锦标赛图框架的k-wise排序方法,通过聚合偏好图并计算传递闭包,以最少比较次数准确识别top-m项,在LLM重排序中实现25-40%的token节省。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17198 2026-05-26 cs.LG cs.CL 81%

Structural Abstraction as an Inductive Bias for Non-Stationary Language Model Training

结构抽象作为非平稳语言模型训练的归纳偏置

Elnaz Rahmati, Nona Ghazizadeh, Zhivar Sourati, Nina Rouhani, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出抽象增强训练(AAT)方法,通过联合优化具体实例及其结构抽象,减少灾难性干扰并提升关系泛化能力,在非平稳语言模型训练中验证了结构抽象作为稳定学习信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24702 2026-05-26 cs.CV 80%

Do Image-Text Metrics Respect Semantic Invariances?

图像-文本度量是否尊重语义不变性?

Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe, Michael Avendi, Yassi Abbasi, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 通过空间、物体和社会语言框架三个维度的语义保持扰动,系统评估了五种流行图像-文本评估器(CLIPScore、PAC-S、UMIC、FLEUR和确定性LLM评判)的语义不变性,发现它们对非语义变化敏感,并提出了不变性校准评分作为后处理调整方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11632 2026-05-26 cs.CL 79%

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

CArtBench: 评估视觉语言模型在中国艺术理解、解读与真实性方面的能力

Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術大學) Liaoning Normal University(遼寧師範大學)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出CARTBENCH基准,通过四个子任务评估视觉语言模型在中国艺术作品上的识别、推理、鉴赏和真伪鉴别能力,发现现有模型在复杂证据链接、风格断代和真伪诊断方面表现不足。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24562 2026-05-26 cs.CV cs.AI 79%

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction

PEDESTRIANQA: 面向行人意图与轨迹预测的视觉-语言模型基准

Naman Mishra, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad, India(IIIT-海得拉巴计算机视觉与智能技术研究所,印度)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出大规模视频数据集PedestrianQA,将行人意图和轨迹预测转化为带结构化理由的问答任务,通过微调视觉-语言模型显著提升预测准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07647 2026-05-26 cs.CL cs.AI 79%

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

自动简答题评分中的质量条件一致性:中等范围退化与任务特定适应的影响

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院) ETS(教育考试服务中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究自动简答题评分中不同模型的任务适应程度与质量条件评分一致性的关系,发现所有AI模型在完全正确和完全错误的回答上表现良好,但在中等范围回答上出现显著退化,且退化程度与任务特定数据量相关。

Comments PRE-PRINT VERSION Accepted to ACL 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23989 2026-05-26 cs.AI cs.CL cs.CR 79%

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

迈向可信的自主AI:安全性、鲁棒性、隐私与系统安全的全面综述

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, Irwin King, Zenglin Xu

机构 * Faculty of Engineering, Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学工程学院、计算机科学与工程系) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了自主AI系统在安全鲁棒性与隐私系统安全两个核心维度的风险来源、阶段缓解策略及统一评估指标,并讨论了开放挑战。

Comments 36 pages, 4 figures. Survey/review article on trustworthy agentic AI. Published in Academia AI and Applications, 2026

Journal ref Academia AI and Applications, vol. 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23966 2026-05-26 cs.CL cs.AI cs.SY eess.SY math.CO 79%

TriVAL: A Tri-Validation Framework for Faithful Automatic Optimization Modeling

TriVAL: 一种用于忠实自动优化建模的三重验证框架

Ziyang Fang, JinXi Wang, Jinghui Zhong, Yew-Soon Ong

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TriVAL三重验证框架,在语义规范、数学公式和代码生成三个阶段进行显式验证,通过构建-验证-修正循环提高自动优化建模的准确性,并在新基准NL4COP上超越现有方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏