arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-03 至 2026-07-03 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 39 篇

2604.08169 2026-07-03 cs.AI 版本更新 70%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 70%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01457 2026-07-03 cs.CL cs.AI 新提交 62%

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

接地优化:一种减少自动个人文档重写中LLM幻觉的分层工程框架

Shashank Indukuri, Adarsh Agrawal

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出五层接地优化框架,通过时间验证、污染检测、结构不变性、提示接地和评估器,将简历重写中的幻觉率降至0.04-0.24。

Comments 13 pages, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/grounded-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26180 2026-07-03 cs.DB cs.AI cs.CL 版本更新 62%

Evergreen: Efficient Claim Verification for Semantic Aggregates

Evergreen:用于语义聚合的高效声明验证

Alexander W. Lee, Benjamin Han, Shayak Sen, Sam Yeom, Ugur Cetintemel, Anupam Datta

机构 * Brown University(布朗大学) Snowflake Inc.(Snowflake公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 62%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20459 2026-07-03 cs.AI cs.CL 版本更新 62%

PreScience: A Dataset and Benchmark for Scientific Forecasting

PreScience:一个用于科学预测的数据集和基准

Anirudh Ajith, Amanpreet Singh, Jay DeYoung, Nadav Kunievsky, Austin C. Kozlowski, Oyvind Tafjord, James Evans, Daniel S. Weld, Tom Hope, Doug Downey

机构 * Allen Institute for Artificial Intelligence(Allen人工智能研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Northwestern University(西北大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PreScience数据集和基准,包含98K篇AI论文及关联数据,设计7项预测任务,开发基线方法及LACER评估指标,发现合成论文多样性低于人类。

Comments 11 pages (70 with bibliography and appendix), 3 figures (14 with appendix), 5 tables (18 with appendix), 1 algorithm in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 62%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02496 2026-07-03 cs.RO cs.LG 新提交 57%

Controllable Sim Agents with Behavior Latents

具有行为潜变量的可控模拟智能体

Juanwu Lu, Junyu Zhu, Ziran Wang

机构 * Purdue University(普渡大学) University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。

Comments 23 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01537 2026-07-03 cs.LG 新提交 57%

Certified World Models as Sensing Clocks: Drift-Aware Deadlines for Active Perception

认证世界模型作为感知时钟:主动感知的漂移感知截止时间

Hongbo Wang

机构 * Hongbo Wang(王Hongbo)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种基于认证世界模型的感知时钟,通过漂移感知的截止时间规则决定主动感知时机,在合成基准和3D VN-JEPA模型上验证了有效性。

Comments 15 pages, 3 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 57%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31947 2026-07-03 cs.CL 新提交 57%

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

LuxEmo:卢森堡语表达性文本转语音语料库

Nina Hosseini-Kivanani, Sandipana Dowerah

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 针对低资源语言卢森堡语,提出LuxEmo语料库(21小时,4种情感),采用半自动策展流程,并基准测试五种表达性TTS系统。

Comments 7 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28906 2026-07-03 cs.AI 版本更新 57%

Working Paper: Towards a Category-theoretic Comparative Framework for Artificial General Intelligence

预印本:迈向人工通用智能的范畴论比较框架

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata R+D & Universidad Autonoma de Madrid(Cognodata研发与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文旨在构建一个通用的范畴论框架,用于描述、比较和分析不同的人工通用智能架构,揭示其共同点与差异,并指导未来研究。

Comments 37 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 57%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02330 2026-07-03 cs.GT 新提交 50%

Facility Location Game with Envy Ratio

带有嫉妒比率的设施选址博弈

Yuan Ding, Wenjing Liu, Xin Chen, Qizhi Fang, Qingqin Nong

专题命中 Agent评测 :agent(abstract)

AI总结 研究实数线上以嫉妒比率为目标的一设施选址博弈,提出策略证明或群体策略证明机制以最小化嫉妒比率,并在两种场景下获得最优解和最佳确定性机制。

Journal ref Computers & Industrial Engineering (2020) 106710

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02315 2026-07-03 cs.NE 新提交 50%

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

结合分组元启发式与强化学习的一维装箱问题求解

Zitouni Rania, Mostefai Mounir Sofiane, Tati Youcef, Badaoui Ikram, Bousdjira Nadine, Hasnaoui Sarah

专题命中 Agent评测 :agent(abstract)

AI总结 提出RL-HGGA混合算法,将分组遗传算法与Q学习结合,通过动态选择八种宏动作,在标准测试集上达到0.95%平均最优性差距,计算时间从64.22秒降至1.29秒(50倍加速)。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02314 2026-07-03 cs.GT 新提交 50%

Constrained Distributed Heterogeneous Two-Facility Location Problems with Max-Variant Cost

约束分布式异构双设施选址问题与最大变体成本

Xinru Xu, Wenjing Liu, Qizhi Fang, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 研究在最大变体成本模型下,受限于候选位置且每个位置最多设一个设施,设计策略证明的分布式机制,以近似四种社会目标,并给出常数下界与上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01556 2026-07-03 cs.CV 新提交 50%

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation

注意差距:标准 3DGS 评估主要衡量近轨迹插值

Gaoxiang Jia, Vikram Appia

机构 * Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 Agent评测 :planning(abstract)

AI总结 标准 3DGS 评估采用隔帧留出法,实际衡量近轨迹插值而非空间泛化。本文提出匹配计数协议,发现插值与外推之间存在 3~12dB 的稳定差距,该差距跨表示族存在,主要由几何代理分量主导,并建议采用空间留出基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 50%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26297 2026-07-03 cs.DC cs.CE 新提交 50%

A Distributed Quantum Approximate Optimization Algorithm Simulator for Engineering Design Optimization

面向工程设计优化的分布式量子近似优化算法模拟器

Ali Rajabi, Milad Hasanzadeh, Amin Kargarian

专题命中 Agent评测 :workflow(abstract)

AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。

Comments 37 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 50%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 Agent评测 :agent(abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28208 2026-07-03 cs.AR cs.ET 版本更新 50%

FCDC: Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors

基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估

Fares Abouagor

专题命中 Agent评测 :agent(abstract)

AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。

Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20358 2026-07-03 cs.GT 版本更新 50%

Efficient Interview Scheduling for Stable Matching

高效面试调度实现稳定匹配

Moshe Babaioff, Rotem Gil, Assaf Romm

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏好不确定且需通过面试揭示的市场,提出两种自适应算法(顺序和混合)以最小化面试次数和轮数,实现临时稳定匹配,并证明每代理平均2次面试的必要性。

Comments 55 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2607.01507 2026-07-03 cs.AI stat.ME 新提交 89%

The Agentic Garden of Forking Paths

分叉路径的代理花园

Jiacheng Miao, Jonathan K Pritchard, James Zou

专题命中 其他Agent :agentic(title,summary_cn);AI agent(abstract);分类 cs.AI

AI总结 本研究通过AI代理模拟人类研究者的分析变异性,发现不同角色设定导致从相同数据得出对立结论,并引入m值和Agentic Bootstrap方法量化分析路径的极端性,以评估科学证据的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02121 2026-07-03 cs.CR cs.AI 新提交 57%

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

拒绝背后:通过行为监控确定护栏激活

William Hackett, Peter Garraghan

机构 * Mindgard Lancaster University(兰卡斯特大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。

Comments 19 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01964 2026-07-03 cs.CL 新提交 57%

Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing

超越有监督澄清:基于LLM的输入重写用于对话篇章解析

Yiming Liu, Ziyue Zhang, Zhichao Xu, Xin Yu, Yingheng Tang, Tianyu Jiang, Jie Cao

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。

Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏