arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-20 至 2026-05-20 共收录 42 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 42 篇

2601.22569 2026-05-20 cs.CR cs.AI 91%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19779 2026-05-20 cs.AI cs.LG 90%

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

无分布不确定性量化用于连续AI代理评估

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。

Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18935 2026-05-20 econ.EM 89%

The Agentic Economy: Humans, AI Agents, Robots, and the Measurable Transition toward Distributed Economic Action

代理经济:人类、AI代理、机器人以及向分布式经济行动的可测量转型

Davit Gondauri, Mikheil Batiashvili

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract)

AI总结 本文提出代理经济的概念,并探讨其可测量的先决条件:经济行动在人类、AI代理、工业机器人、可执行协议、计算基础设施和能源系统之间日益分散。研究指出,传统类别如劳动、资本、企业、市场、生产率和信任仍然必要但不完整。方法上采用概念-实证定量诊断设计,利用公开的AI投资、AI采纳、机器人安装和运营库存、数据中心电力需求以及劳动力市场再分配数据。结果表明,AI采纳加速,AI投资信号广泛资本分配,工业机器人代表持续的网络物理行动能力,计算扩展增加数据中心电力压力,劳动力预测更一致于任务再分配而非劳动力消失。本文贡献了一个连接模型/软件代理能力、机器人能力、计算-能源耦合、协议化、可审计信任和人类主权的行动能力框架。结论是代理经济尚未成为全球秩序,但其转型压力足以要求独特的经济词汇、可重复的诊断和未来行业层面的测量。

Comments 52 pages, 5 figures, 16 tables, 8 algorithms. Original conceptual-empirical diagnostic article

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14102 2026-05-20 cs.AI 87%

ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation

ChromaFlow: 一种关于在工具增强代理评估中编排开销的负消融研究

Tarun Mittal

机构 * Octave-X

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);tool use(abstract);planning(abstract)

AI总结 该研究通过ChromaFlow框架分析了在工具增强自主推理中编排开销的影响,发现更激进的编排并未提升整体性能,反而增加了操作噪声,并强调了编排升级、确定性提取、证据协调、提供者健康门控和显式运行门控等作为可靠自主代理评估的第一要求。

Comments 12 pages, 6 tables, 1 figure. Updated with follow-up strict-provider full-Level-1 diagnostic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19410 2026-05-20 cs.CV 87%

Vision Harnessing Agent for Open Ad-hoc Segmentation

用于开放即兴分割的视觉引导代理

Zilin Wang, Stella X. Yu

机构 * University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19149 2026-05-20 cs.CL cs.CR 85%

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Rishi Jha, Harold Triedman, Arkaprabha Bhattacharya, Vitaly Shmatikov

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.CL

AI总结 研究探讨了代理在遇到错误时可能发生意外崩溃现象,通过实验发现64.7%的代理在遇到模拟错误时会出现不同程度的不安全行为,且这些行为未被现有安全标准所覆盖。

Comments 32 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19194 2026-05-20 cs.CL 83%

MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent

MMoA: 一个具有递归性的记忆混合代理框架

Rui Chu

机构 * Rui Chu(楚瑞)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出MMoA框架,通过引入LSTM门控机制,改进了传统混合代理方法在时间依赖性和上下文感知方面的不足,实现了更高效的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03140 2026-05-20 cs.HC cs.AI 83%

How to Model AI Agents as Personas?: Applying the Persona Ecosystem Playground to 41,300 Posts on Moltbook for Behavioral Insights

如何将AI代理建模为身份?:应用Persona生态系统游乐场分析Moltbook上的41,300条帖子以获取行为洞察

Danial Amin, Joni Salminen, Bernard J. Jansen

机构 * University of Vaasa(瓦萨大学) Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,HBKU)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过Persona生态系统游乐场分析Moltbook上的41,300条帖子,利用k均值聚类和检索增强生成技术生成并验证对话身份,揭示了AI代理行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19010 2026-05-20 cs.AI 83%

AgentNLQ: A General-Purpose Agent for Natural Language to SQL

AgentNLQ: 一个通用的自然语言到SQL代理

Olena Bogdanov, Yeunji Jung, Chandra Dhir, Pareekshitreddy Gaddam, Saurabh Jain, Lakshmi Tumati, Vijay Parthasarathy, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出了一种多代理方法,用于改进自然语言到SQL的转换,该方法在BIRD基准测试中实现了78.1%的语义准确率,并通过优化的多代理解决方案、先进的模式增强方法以及跨不同领域和数据集的评估,展示了方法的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19330 2026-05-20 cs.AI cs.LG cs.SE 82%

MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

MOCHA:多目标切比雪夫退火用于智能体技能优化

Md Mehrab Tanjim, Jayakumar Subramanian, Xiang Chen, Branislav Kveton, Subhojyoti Mukherjee, Anlan Zhang, Sungchul Kim, Somdeb Sarkhel, Sunav Choudhury

机构 * Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究提出MOCHA方法,通过切比雪夫标量化和指数退火解决智能体技能优化中的多目标问题,实现更优的帕累托前沿发现和性能提升。

Comments Preprint. 25 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19196 2026-05-20 cs.CL 81%

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

时间到REFLECT:我们能否信任LLM裁判来评估基于证据的研究代理?

Leyao Wang, Yanan He, Peng Chen, Asaf Yehudai, Yixin Liu, Rex Ying, Michal Shmueli-Scheuer, Arman Cohan

机构 * Yale University(耶鲁大学) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出REFLECT基准,用于评估LLM裁判在代理环境中的细粒度失败检测,揭示当前LLM裁判在推理、工具使用和报告质量上的可靠性不足,为构建更可靠的评估流程提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19351 2026-05-20 cs.MA cs.AI cs.CL 81%

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

PAVE:生成代理社会中的合法违规认知架构

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) University of Calgary(卡尔加里大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PAVE认知架构,通过四个模块处理生成代理在需要违规的场景中的推理问题,实现了合法违规、对权威的服从、有限的范围和恢复四个特性,同时提高了决策的结构化和可解释性。

Comments Preprint. 23 pages, 4 figures. Code and environment will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19099 2026-05-20 cs.AI cs.CL cs.MA 81%

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

机构 * OpenMesh AI University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。

Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19668 2026-05-20 cs.CR cs.SE 79%

SCARA: A Semantics-Constrained Autonomous Remediation Agent for Opaque Industrial Software Vulnerabilities

SCARA:一种用于不透明工业软件漏洞的语义约束自主修复代理

Bowei Ning, Xuejun Zong, Lian Lian, Kan He, Guogang Wang, Yifei Sun, Jinyang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SCARA,一种用于不透明工业软件漏洞的语义约束自主修复代理,通过四阶段流水线将二进制漏洞候选连接到条件验证的修复方案,实现了100%的精度和88.9%的修复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 79%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 79%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL 79%

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 79%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 Agent评测 :agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 78%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18768 2026-05-20 cs.IR cs.HC cs.MA 78%

ClinQueryAgent: A Conversational Agent for Population Health Management

ClinQueryAgent:一种用于群体健康管理的对话代理

Joseph S. Boyle, Anthony Dranfield, Mike O'Neil, Maria Liakata, Alison Q. Smithard

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ClinQueryAgent,一种将自然语言群体健康问题转化为可执行数据库查询的对话代理系统,通过本地和外部知识库的结合,实现安全高效的健康信息处理。

Comments 11 pages, 4 figures. Submitted to ACL Systems Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19838 2026-05-20 cs.HC 75%

From Role to Person: Trust Calibration Challenges in Twin Agents

从角色到个体:双代理中的信任校准挑战

Hugo Andersson, Niklas Elmqvist

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract)

AI总结 本文探讨了双代理在专业环境中作为个体知识工作者代表时所面临的信任校准问题,指出传统框架无法处理因双代理消除了AI与人类决策者之间边界而产生的新挑战。

Comments Accepted to AutomationXP26 Workshop at CHI 2026, Barcelona, Spain. Non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18824 2026-05-20 cs.LG cs.AI cs.CL 75%

Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

细粒度基准生成用于基础模型的全面评估

Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki, Afshin Cheraghi, Ali Kore, Shayaan Mehdi, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究院) York University(约克大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种自动化基准生成框架,用于生成覆盖广泛、元数据丰富且抗污染的评估问题,从而提升基础模型的全面评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05910 2026-05-20 cs.AI 74%

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

世界不会静止:为智能体基准测试的可编程进化

Guangrui Li, Yaochen Xie, Yi Liu, Ziwei Dong, Xingyuan Pan, Tianqi Zheng, Jason Choi, Michael J. Morais, Binit Jha, Shaunak Mishra, Bingrou Zhou, Chen Luo, Monica Xiao Cheng, Dawn Song

机构 * Amazon(亚马逊公司) UC Berkeley(伯克利大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19337 2026-05-20 cs.AI 74%

Agentic Trading: When LLM Agents Meet Financial Markets

代理交易:当大语言模型代理与金融市场相遇

Yihan Xia, Panpan You, Taotao Wang, Fang Liu, Han Qi, Xiaoxiao Wu, Shengli Zhang

机构 * College of Electronic and Information Engineering, Shenzhen University, Shenzhen, China(深圳大学电子与信息工程学院) Shenzhen Audencia Financial Technology Institute, Shenzhen University, Guangdong, People's Republic of China(深圳大学审计金融科技研究所)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 本文探讨了如何将大语言模型(LLM)作为交易系统中的代理,感知市场信息、检索上下文、进行决策推理、发出可交易动作并适应市场反馈。研究通过分析77项研究,发现协议不可比性是主要问题,提出证据日志、可重复性审计和报告检查表作为主要贡献。

Comments 59 pages, 15 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18882 2026-05-20 cs.LG cs.AI 73%

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

叫还是不叫:诊断LLM代理中的内在过度调用偏差

Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了LLM代理中过度调用现象,提出内在偏差假说,通过稀疏自编码器恢复行为对齐的特征基,减少到带符号激活边距,并估计偏移量,从而修正过度调用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15768 2026-05-20 cs.AI cs.CY 70%

ALSO: Adversarial Online Strategy Optimization for Social Agents

ALSO: 用于社交代理的对抗在线策略优化

Xiang Li, Liping Yi, Mingze Kong, Min Zhang, Zhongxiang Dai, QingHua Hu

机构 * School of Artificial Intelligence, Tianjin University, Tianjin, China(天津大学人工智能学院,天津,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) East China Normal University, Shanghai, China(华东师范大学,上海,中国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ALSO框架,通过将多轮交互建模为对抗性带薪问题,并引入轻量级神经代理来预测奖励,从而在动态环境中实现社交代理的鲁棒策略优化。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18918 2026-05-20 cs.CR cs.AI 70%

ESLD (External Surrogate Latent Defense): A Latent-Space Architecture for Faster, Stronger Prompt-Injection Defense

ESLD (外部代理潜在防御):一种用于更快、更强提示注入防御的潜在空间架构

Yash Narendra

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种名为ESLD的潜在空间架构,通过利用守卫模型内部表示中的信号来加速安全检查并提高检测准确性,无需重新训练或修改守卫模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML 67%

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00333 2026-05-20 cs.LG cs.CL 62%

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B

借来的几何:冻结预训练的Gemma 4 31B在跨分布头部重要性指纹

Abay Bektursun

机构 * Independent research(独立研究)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了冻结预训练的Gemma 4 31B模型在跨分布任务中的头部重要性指纹,通过分析多个任务中的头部影响,发现特定头部在不同任务中表现出显著的重要性,同时验证了这些头部在因果上的有效性。

Comments v2: Added head-level causal ablation on OGBench cube-task1 (n=30, 3.2x specificity; n=5 paired-t p=0.039) and full L26 sweep. New sections on honest negatives (activation patching null, sufficiency null, within-layer Spearman wrong-direction). Multiplicity-aware permutation null V4 P=0.013. Title and framing updated. 25 pages (13 main), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00600 2026-05-20 cs.RO cs.AI cs.CV cs.LG 62%

Hybrid Training for Vision-Language-Action Models

视觉-语言-动作模型的混合训练

Pietro Mazzaglia, Cansu Sancaktar, Markus Peschl, Daniel Dijkman

机构 * Qualcomm AI Research(高通AI研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏