arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2605.11663 2026-05-13 cs.CL 81%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11355 2026-05-13 cs.LG cs.CE 81%

gym-invmgmt: An Open Benchmarking Framework for Inventory Management Methods

gym-invmgmt:一种用于库存管理方法的开放基准框架

Reza Barati, Qinmin Vivian Hu

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出gym-invmgmt框架,通过统一的环境合同评估不同库存策略,揭示了场景条件、信息访问、需求变化和策略表示对性能的联合影响。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11229 2026-05-13 cs.CR cs.AI cs.SE 81%

Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution

评论与控制:通过上下文引导进化劫持代理工作流

Neil Fendley, Zhengyu Liu, Aonan Guan, Jiacheng Zhong, Yinzhi Cao

机构 * Johns Hopkins University Applied Physics Lab(约翰霍普金斯大学应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) Wyze Labs(Wyze实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出JAW框架,通过上下文引导进化方法劫持自动化平台上的代理工作流,揭示代理工作流中因输入操控导致的安全风险,并展示了对GitHub和n8n的广泛影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11195 2026-05-13 cs.CL 81%

How Does Differential Privacy Affect Social Bias in LLMs? A Systematic Evaluation

差分隐私如何影响大语言模型中的社会偏见?一项系统评估

Eduardo Tenorio, Karuna Bhaila, Xintao Wu

机构 * University of Arkansas(阿肯色大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统评估了在差分隐私框架下训练的大语言模型的社会偏见,发现差分隐私在句子评分任务中减少偏见,但无法普遍适用,揭示了logit层偏见与输出层偏见的差异。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11029 2026-05-13 cs.CR cs.AI 81%

FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

FragBench:隐藏在看似无害片段中的跨会话攻击

Astha Mehta, Niruthiha Selvanayagam, Cedric Lam, Hengxu Li, Phuc-Nguyen Nguyen, Raymond Lee, Olivia McGoffin, My, Luong, Arthur Collé, Jamie Johnson, David Williams-King, Linh Le

机构 * New York University(纽约大学) Tufts University(塔夫茨大学) Distributed Systems(分布式系统) ERA(欧洲研究联盟) Lida Safety(Lida安全) Mila

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 FragBench通过24个真实网络攻击案例构建,评估LLM跨会话攻击检测,采用对抗重写和图基检测方法,实现事件级F1分数达0.88-0.96。

Comments preprint of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04334 2026-05-13 cs.DB cs.AI cs.LO cs.PL 81%

SpotIt+: Verification-based Text-to-SQL Evaluation with Database Constraints

SpotIt+: 基于验证的文本到SQL评估与数据库约束

Andrew Tremante, Yang He, Rocky Klopfenstein, Yuepeng Wang, Nina Narodytska, Haoze Wu

机构 * Amherst College(阿默斯特学院) Simon Fraser University(西蒙弗雷泽大学) VMware Research by Broadcom(Broadcom VMware 研究)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 SpotIt+通过有界等价验证评估文本到SQL系统,结合规则和LLM方法挖掘约束,提升数据库差异识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13625 2026-05-13 cs.AI 81%

Bridging Dual Knowledge Graphs for Multi-Hop Question Answering in Construction Safety

连接双知识图谱以实现施工安全多跳问答

Yuxin Zhang, Xi Wang, Mo Hu, Zhenyu Zhang

机构 * organization= Department of Construction Science, College of Architecture, Texas A\&M University, College Station , country= USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BifrostRAG系统,通过双图检索增强生成模型处理施工安全多跳问答,实现92.8%精度和85.5%召回率,优于传统基线方法。

Comments 22 pages, 13 figures

Journal ref Automation in Construction, Volume 183, March 2026, 106794

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 81%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12272 2026-05-13 cs.IR cs.DB 80%

BatchBench: Toward a Workload-Aware Benchmark for Autoscaling Policies in Big Data Batch Processing -- A Proposed Framework

BatchBench: 一种面向工作负载的自动扩展策略基准测试框架

Venkata Krishna Prasanth Budigi, Siri Chandana Sirigiri

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BatchBench框架,旨在为大数据批处理中的自动扩展策略提供统一的基准测试平台,通过工作负载分类、参数化工作负载生成器和五维评估体系,实现不同策略的公平比较。

Comments 5 pages, 1 table, position paper. Reference implementation in active development. Empirical follow-up to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12270 2026-05-13 cs.SE 80%

Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues

表征LLMs在解决现实世界GitHub问题中的故障模式

Yanjie Jiang, Yian Huang, Guancheng Wang, Junjie Chen, Hui Liu, Lionel Briand

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过评估三种先进模型在SWE-bench Verified数据集上的表现,揭示了LLMs在复杂修复任务中故障模式的分类,发现策略制定和逻辑综合是错误率最高的阶段,而故障定位错误率最低,同时揭示了不同模型在鲁棒性和成本上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11700 2026-05-13 cs.HC 80%

MindMirror: A Local-First Multimodal State-Aware Support System for Digital Workers

MindMirror: 一种面向数字工作者的本地优先多模态状态感知支持系统

Wenqi Luo, Changbo Wang, Yan Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MindMirror通过整合面部表情、文本输入和语音交互等多模态数据,为数字工作者提供本地优先的状态感知支持,通过本地大语言模型生成响应,提升工作效率与状态监控能力。

Comments 10 pages, 4 figures, 12 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11321 2026-05-13 cs.CV 80%

KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes

KeyframeFace: 通过语义关键帧实现语言驱动的面部动画

Jingchao Wu, Zejian Kang, Haibo Liu, Yuanchen Fei, Xiangru Huang

机构 * Westlake University(西湖大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Hunan University(湖南大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出KeyframeFace框架,通过语义关键帧实现语言驱动的面部动画,提升面部表情的精确控制与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11653 2026-05-13 cs.CR cs.AI 79%

Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark

每一个比特,处处,一次又一次:一种二项式多比特大语言模型水印

Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种新的多比特水印方法,通过二项式编码在每个token位置直接编码每个比特,提升水印的准确性和鲁棒性,同时引入每比特置信度评分作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09965 2026-05-13 cs.CV 78%

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse

迈向通用游戏玩家:对游戏多元宇宙中基础模型的调查

Kuan Zhang, Dongchen Liu, Qiyue Zhao, Tianyu Xin, Yue Su, Haisheng Wang, Han Yin, Hongbo Ma, Peize Li, Tianjun Gu, Xiangnan Wu, Xinran Zhang, Yongxuan Li, Zirong Chen, Yiming Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) MMLab, The University of Hong Kong(香港大学MMLab) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文探讨了在游戏多元宇宙中训练通用游戏玩家的基础模型,分析了数据集、模型、工具和基准四个支柱,并提出五阶段路线图,旨在实现能够同时创造和演化游戏世界的通用智能体。

Comments 51 pages, 7 figures, github: https://github.com/THUSI-Lab/Awesome-LFMs-Play-Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08083 2026-05-13 cs.CV 78%

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

在自动驾驶中基于视觉基础模型的输入监控基准测试

Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann

机构 * Continental AG(大陆汽车集团) Technical University of Munich(慕尼黑技术大学) University of Lübeck(吕贝克大学) University of Oxford(牛津大学) University of Wuppertal(伍珀塔尔大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种基于视觉基础模型和密度建模技术的统一方法,用于检测语义和协变量偏移,通过全面基准测试评估了VFM在复杂条件下的OOD分类能力,并证明其在识别高风险输入方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11002 2026-05-13 cs.CR cs.AI 77%

MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

MT-JailBench: 一个多模块的多轮 jailbreak 攻击评估基准

Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

机构 * International Computer Science Institute(国际计算机科学研究所) Berkeley Lab(伯克利实验室)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 MT-JailBench,一个用于评估多轮 jailbreak 攻击的模块化框架,揭示了资源预算和评估函数对攻击效果的影响,发现提示生成是性能变化的主要因素,而动态策略生成并非必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11874 2026-05-13 cs.IR 75%

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems

RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试

Wenwen Zeng, Jinhui Zhang, Hao Chen, Zhaoyu Hu, Yongqi Liang, Jiajun Chai, Dengcan Liu, Zhenfeng Liu, Shurui Yan, Minglong Xue, Xiaohan Wang, Wei Lin, Guojun Yin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12477 2026-05-13 cs.LG cs.CL 73%

MEME: Multi-entity & Evolving Memory Evaluation

MEME:多实体与演进记忆评估

Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能实验室) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) NAVER AI Lab(NAVER人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究探讨多实体与演进内存系统在持续环境中的表现,发现默认配置下所有系统在依赖推理上表现不佳,仅文件型代理配合Claude Opus 4.7能部分改善,但成本高且不实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05630 2026-05-13 cs.CL cs.AI cs.CR 73%

One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue

一念之差:多轮对话中针对隐藏恶意意图的响应感知防御

Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UCSD(加州大学圣地亚哥分校) National Taiwan University(台湾大学) IBM Research(IBM研究院) Virtue AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。

Comments Project Website: https://turn-gate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27055 2026-05-13 cs.CL cs.AI 73%

Detecting Data Contamination in LLMs via In-Context Learning

通过上下文学习检测大语言模型中的数据污染

Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

机构 * NVIDIA

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoDeC方法,通过测量上下文学习对模型性能的影响,检测并量化大语言模型训练数据污染,揭示开放权重模型中的记忆现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10991 2026-05-13 cs.LG cs.AI 73%

Test-Time Personalization: A Diagnostic Framework and Probabilistic Fix for Scaling Failures

测试时个性化:一种诊断框架和概率修复方法用于缩放失败

Linhai Zhang, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出测试时个性化框架,通过采样候选策略模型并使用个性化奖励模型选择最佳方案,解决缩放失败问题,并推导出统一缩放定律以诊断用户级崩溃和查询级奖励黑客两种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22933 2026-05-13 cs.AI cs.CL 73%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post:可审计的证据导向多模态事实核查

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

机构 * School of Computing (SoC), National University of Singapore (NUS)(新加坡国立大学计算机学院(SoC)) National University of Singapore (NUS)(新加坡国立大学) Department of Electrical and Computer Engineering (ECE), National University of Singapore (NUS)(新加坡国立大学电子与计算机工程系(ECE))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RW-Post提出一种可审计的多模态事实核查基准,通过人类事实核查文章提取证据,支持不同场景下的可控评估,提升视觉 grounding 和证据利用能力。

Comments Code and dataset will be released at https://github.com/xudanni0927/AgentFact

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV 73%

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12313 2026-05-13 cs.CL cs.IR 70%

Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering

BioCreative IX MedHopQA 轨道概述:轨道描述、参与及多跳医学问答系统评估

Rezarta Islamaj, Joey Chan, Robert Leaman, Jongmyung Jung, Hyeongsoon Hwang, Quoc-An Nguyen, Hoang-Quynh Le, Harikrishnan Gurushankar Saisudha, Ganesh Chandrasekar, Rustam R. Taktashov, Nadezhda Yu. Bizyukova, Sofia I. R. Conceição, Paulo R. C. Lopes, Reem Abdel Salam, Mary Adewunmi, Zhiyong Lu

机构 * National Library of Medicine (NLM), National Institutes of Health (NIH)(美国国家医学图书馆(NLM)、国家卫生研究院(NIH)) University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学) VNU University of Engineering and Technology, Hanoi, Vietnam(越南河内工程大学) Concordia University, Montreal, QC, CA(蒙特利尔大学) Institute of Biomedical Chemistry (IBMC), 10 bld. 8, Pogodinskaya str., 119121 Moscow, Russia(俄罗斯生物医学化学研究所(IBMC)) LASIGE, Departamento de Informática, Faculdade de Ciências, Universidade de Lisboa, 1749-016 Lisbon, Portugal(葡萄牙里斯本大学 LASIGE 实验室) Faculty of Engineering, Computer Engineering Department Cairo University(埃及开罗大学工程学院) Menzies School of Health Research, Charles Darwin University, NT, Australia(澳大利亚查尔斯达尔文大学梅恩兹健康研究中心) CaresAI, Australia(澳大利亚 CaresAI)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了BioCreative IX MedHopQA共享任务,旨在评估大型语言模型在多跳推理中的表现,通过构建1000个挑战性问题,展示了检索增强生成策略的重要性,并提供了公开数据集和评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12154 2026-05-13 cs.AI 70%

MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

MM-OptBench:一种面向多模态优化建模的求解器导向基准

Zhong Li, Qi Huang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen, Zaiwen Wen, Lincen Yang

机构 * Great Bay University(大湾大学) Leiden University(莱顿大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MM-OptBench,一个基于求解器的多模态优化建模基准,通过文本和视觉信息生成数学模型和求解器代码,评估9种多模态大语言模型在不同难度实例上的表现,结果显示任务仍远未解决。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11868 2026-05-13 cs.CR cs.AI 70%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11770 2026-05-13 cs.CR cs.AI cs.SY eess.SY 70%

Behavioral Integrity Verification for AI Agent Skills

AI代理技能的行为完整性验证

Yuhao Wu, Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI 70%

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11645 2026-05-13 cs.MA cs.LG q-fin.ST 70%

GeomHerd: A Forward-looking Herding Quantification via Ricci Flow Geometry on Agent Interactive Simulations

GeomHerd:通过Ricci流几何在代理交互模拟中进行前瞻性从众量化

Lake Yang, Junwei Su, Jingfeng Zeng, Wenhao Lu, Xingzhi Qian, Weitong Zhang, Chuan Wu, Dunhong Jin

机构 * University of Science and Technology of China(科学技术大学) MaxQuant The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出GeomHerd框架,利用Ricci流几何直接量化代理交互图中的协调性,提前预测从众行为,实验显示其在连续自旋模型中提前检测从众现象,且在Vicsek模型中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11117 2026-05-13 cs.LG cs.MA math.PR 70%

GRAFT-ATHENA: Self-Improving Agentic Teams for Autonomous Discovery and Evolutionary Numerical Algorithms

GRAFT-ATHENA:自我改进的代理团队用于自主发现和进化数值算法

Juan Diego Toscano, Zhaojie Chai, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 GRAFT-ATHENA通过自我改进的代理团队,在自主发现和进化数值算法中实现跨领域的方法积累与能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏