arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-01 至 2026-07-01 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2606.31046 2026-07-01 cs.AI 新提交 70%

OpenLife: Toward Open-World Artificial Life with Autonomous LLM Agents

OpenLife:迈向基于自主LLM代理的开放世界人工生命

Atsushi Masumori, Itsuki Doi, Norihiro Maruyama, Ryosuke Takata, Takashi Ikegami

机构 * Alternative Machine Inc.(Alternative Machine公司) Their Inc.(Their公司) Atomi University(迹见学园女子大学) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出开放世界人工生命范式,通过将无状态LLM与异步进程(记忆、感知、评估、预算代谢)结合,使代理在开放世界中涌现自发活动、个体化、社会结构和自创收入。

Comments Accepted at ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23088 2026-07-01 cs.CR cs.AI 版本更新 70%

From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching

从相似性到脆弱性:LLM语义缓存的密钥碰撞攻击

Zhixiang Zhang, Zesen Liu, Yuchong Xie, Quanfeng Huang, Dongdong She

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出语义缓存存在密钥碰撞攻击风险,通过CacheAttack框架在黑盒条件下实现86%的LLM响应劫持命中率,并能在不同嵌入模型间迁移,威胁智能体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 67%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 67%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31002 2026-07-01 cs.AI cs.CL cs.LO 新提交 62%

Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

超越编译:评估从自然语言到Lean的忠实语句形式化

Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy, Yi Xie, Zhi Wang, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of Arizona(亚利桑那大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11030 2026-07-01 cs.SE cs.AI cs.MA 版本更新 62%

An Executable Benchmarking Suite for Tool-Using Agents

为工具使用智能体设计的可执行基准测试套件

Zhiqing Zhong, Zhijing Ye, Jiamin Wang, Xiaodong Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出一个可执行基准测试套件,通过共享证据准入合同明确工作负载、行动生成驱动器和系统面向声明的证据。该套件连接WebArena Verified和MiniWoB++,并提供统一的工作负载适配器、任务清单、事件模式、回放/冻结政策、声明驱动器和报告管道。

Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07385 2026-07-01 cs.CL cs.AI 版本更新 62%

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

SAGE:面向自由形式问答的大语言模型的搜索增强评估

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SAGE框架,通过主动检索和综合外部证据评估LLM输出的事实性,无需固定参考答案,在多个自由问答基准上实现与人类评估的高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31055 2026-07-01 cs.CL cs.SD eess.AS 新提交 57%

Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

基于参考的口语对话系统韵律与节奏评估

Ashish Hallur, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30774 2026-07-01 cs.AI 新提交 57%

What Drives Interactive Improvement from Feedback?

什么驱动了来自反馈的交互式改进?

Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki, Szymon Pobłocki, Alicja Ziarko, Piotr Miłoś

机构 * University of Warsaw(华沙大学) AKCES NCBR Princeton University(普林斯顿大学) Mistral AI Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。

Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30701 2026-07-01 cs.CR cs.AI 新提交 57%

An AI-Based Solution for Secure Service Provisioning in IoT

基于人工智能的物联网安全服务提供解决方案

Marco Arazzi, Mert Cihangiroglu, Serena Nicolazzo, Antonino Nocera, Vinod P

机构 * Department of Electrical, Computer and Biomedical Engineering, University of Pavia(帕维亚大学电气、计算机与生物医学工程系) Department of Computer Applications, Cochin University of Science and Technology(科钦科技大学计算机应用系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种结合深度强化学习和联邦学习的框架,用于在物联网环境中选择可靠智能对象并监控其行为,以增强服务提供的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14200 2026-07-01 cs.LG 57%

TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning

TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准

Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien, Alpay Hasanli, Max Rosenblattl, Fan Wu, Kevin Riehl, Maxwell A. Xu, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) Stanford University(2 斯坦福大学) Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) Google(5 谷歌) Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。

Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31875 2026-07-01 cs.CV 新提交 50%

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving

SENSE-VAD:面向自动驾驶的情感和语义视频异常检测

Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz

机构 * University of South Florida(南佛罗里达大学)

专题命中 Agent评测 :agent(abstract)

AI总结 针对自动驾驶中社会关系导致的异常(如追逐、被抱等),提出首个合成视频异常检测基准SENSE-VAD,利用CARLA和UE生成多类别社交异常场景,并分离社交异常与运动异常,评估现有方法发现其难以解决该挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31858 2026-07-01 cs.LO cs.MA 新提交 50%

The Logic of Data Access and Data Exchanges

数据访问与数据交换的逻辑

Alexandru Baltag, Sonja Smets

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种扩展动态认知逻辑的新逻辑,结合命题知识模态与数值条件非命题知识算子,并引入基于最小化算子的限定描述,用于数据交换场景的推理,给出了完全公理化并证明了可判定性与共表达性。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 93-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31292 2026-07-01 cs.CE 新提交 50%

AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation

AtomiMed:用于通用临床感知医学报告评估的分层原子事实核查

Yuan Wang, Wanxing Chang, Songtao Jiang, Shujian Gao, Xiaotian Zhang, Ruifeng Yuan, Weiwei Cao, Bowen Shi, Ling Zhang, Zuozhu Liu, Jianpeng Zhang

专题命中 Agent评测 :agentic(abstract)

AI总结 提出AtomiMed框架,将复杂医学叙述分解为分层原子临床事实,通过代理交叉验证循环模拟多放射科医生同行评审,实现诊断检测和描述准确性的解耦评估。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 50%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30666 2026-07-01 cs.CY 新提交 50%

Reframing AGI Confrontation with Off Earth Autonomy

重构与地外自主性的AGI对抗

Alexey Potapov

专题命中 Agent评测 :agent(abstract)

AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31142 2026-07-01 math.OC 新提交 50%

Augmenting airline networks using airside-to-airside buses to strengthen system resilience under disruptions

利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性

Micah M. Borrero, Max Z. Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31228 2026-07-01 eess.SY cs.SY physics.app-ph physics.ins-det 新提交 50%

FPGA-based LQG controller and hardware-in-the-loop simulator implementation for nanomechanical systems

基于FPGA的纳米机械系统LQG控制器与硬件在环仿真器实现

Vojtěch Mlynář, Johannes Berndorfer, Andreas Kugi, Andreas Deutschmann-Olek

专题命中 Agent评测 :workflow(abstract)

AI总结 提出在低成本Red Pitaya STEMlab FPGA平台上实现实时LQG控制与硬件在环仿真,支持三自由度耦合振荡系统,并通过悬浮纳米粒子双势阱稳定实验验证。

Comments Submission to SciPost

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01897 2026-07-01 cs.SD eess.AS 版本更新 50%

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

FastTurn:统一声学和流式语义线索以实现低延迟和鲁棒的轮换检测

Chengyou Wang, Hongfei Xue, Mingchen Shao, Chunjiang He, Jingbin Hu, Shuiyuan Wang, Bo Wu, Yuyu Ji, Jimeng Zheng, Ruofei Chen, Zhou Zhu, Lei Xie

机构 * Audio, Speech and Language Processing Group(语音与语言处理组) Shengwang(盛王) QualiaLabs

专题命中 Agent评测 :agent(abstract)

AI总结 FastTurn通过结合流式CTC解码与声学特征,实现低延迟和鲁棒的轮换检测,同时释放基于真实人类对话的测试集,提升实际全双工对话系统的性能。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14647 2026-07-01 cs.LO math.LO 版本更新 50%

A Semantics for Belief in Simplicial Complexes

单纯复形中信念的语义

Adam Bjorndahl, Philip Sink

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种基于单纯复形的信念语义,满足KD45公理和“知识蕴含信念”,并通过与关系模型的保真对应给出简单公理化。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 173-188

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02376 2026-07-01 cs.HC 版本更新 50%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2606.31744 2026-07-01 eess.SY cs.SY 新提交 78%

A Conversational Agentic Interface to Physics-Based Household Digital Twins for Residential Energy Decision Support

面向住宅能源决策支持的基于物理的家庭数字孪生对话代理接口

Costas Mylonas, Titos Georgoulakis, Magda Foti

专题命中 其他Agent :agentic(title,abstract)

AI总结 提出一种对话代理框架,通过自然语言交互使基于物理的家庭能源模拟易于使用,结合家庭数字孪生与大型语言模型代理层,实现高可靠性的住宅能源决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29793 2026-07-01 cs.CL q-fin.GN 版本更新 57%

Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data

Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架

Suhwan Park, Hoyoung Lee, Zhangyang Wang, Alejandro Lopez-Lira, Young Cha, Chanyeol Choi, Jaewon Choi, Yongjae Lee

机构 * UNIST(蔚山科学技术院) LinqAlpha University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Florida(佛罗里达大学) Blackstone(黑石集团) Hanwha Life(韩华生命)

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。

Comments 17 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31755 2026-07-01 cs.CY cs.AI 新提交 57%

A Technical Typology of AI Systems in Public Administration

公共管理中AI系统的技术类型学

Jonathan Rystrøm, Chris Schmitz, Nathan Davies, Gerhard Hammerschmid, Albert Meijer, Chris Russell

机构 * University of Oxford(牛津大学) Hertie School(赫蒂学院) Utrecht University(乌得勒支大学) Harvard University(哈佛大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 针对公共管理研究将AI视为单一类别的问题,提出五类AI系统类型学(手编、玻璃箱、黑箱、通用、代理系统),通过分析91篇高引论文发现技术精度不足,并给出改进建议。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30653 2026-07-01 cs.CY cs.AI 新提交 57%

The Consistency Dilemma in LLMs: Generator-Evaluator Agreement and Vulnerability to Mistakes

LLMs中的一致性困境:生成器-评估器一致性与对错误的脆弱性

Marina Mancoridis, Zoë Hitzig

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 提出生成器-评估器自一致性度量,发现模型自一致性越高,在临床环境中对已验证错误的脆弱性越大,揭示LLMs中的一致性困境。

详情

展开后加载摘要…

URL PDF HTML 收藏