arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 462 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 462 篇

2606.07683 2026-06-09 cs.SE eess.SP 新提交 57%

Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review

审查代码,而非故事:代码优先同行评审的愿景与协议

Jienan Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。

Comments 17 pages, vision and protocol paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 56%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 软件智能体 :分类 cs.AI、cs.LG、cs.SE;agent(comments)

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13610 2026-08-17 eess.IV cs.MM 新提交 50%

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

LoopVSR:用于自动修复视觉语音识别推理流水线的循环工程框架

Fei Qin, Bowen Zhang, Chao Fan, Pengcheng Luo, Genke Yang

专题命中 软件智能体 :agent(abstract)

AI总结 LoopVSR是一种循环工程框架,可让代码智能体结合端到端执行证据自动修复VSR推理流水线,在CMLR VSR系统上的表现远优于静态防护,可实现100%平均修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13448 2026-08-14 cs.RO 新提交 50%

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

关注上下文:通过环境-社会解耦实现社会适配机器人动作的持续学习

Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

机构 * Utrecht University(乌得勒支大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对社交机器人在多样上下文场景下的持续学习问题,提出EDD框架解耦环境与社会知识,缓解遗忘,性能优于现有基线,相关代码已公开。

Comments Extended version of the paper accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13027 2026-08-14 cs.AR 新提交 50%

Why Do Prefetchers Fail? Let Agents Answer

预取器为何失效?让智能体来解答

Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 50%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11932 2026-08-13 math.OC 新提交 50%

Joint Identifiability and Conditioning in Finite-Horizon Continuous-Time Inverse LQR with Unknown Dynamics

未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束

Meiling Yu, Yuan-Hua Ni, Lei Jiang

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 50%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 软件智能体 :agent(abstract)

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08861 2026-08-11 math.OC 新提交 50%

Simultaneous Group-Envelope Bounds for $Γ$-Robust Multiple-Choice Knapsack Problems

Γ-鲁棒多选背包问题的 simultaneous 组-包络界

Zi Yuan Eric Shao

专题命中 软件智能体 :planning(abstract)

AI总结 本文针对Γ-鲁棒多选背包问题,提出 simultaneous 组-包络界方法,可同时界定阈值族,大幅加速松弛求解,在实验中实现2.37倍几何平均加速。

Comments 19 pages, 2 figures. Code and reproducibility materials: https://github.com/eric939/simultaneous-group-envelope-mckp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 50%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 软件智能体 :workflow(abstract)

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02834 2026-08-05 cs.RO cs.SY eess.SY 新提交 50%

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles

凸障碍物周围平滑最小时间轨迹的双凸优化

Peter Werner, Tobia Marcucci, Daniela Rus

机构 * Massachusetts Institute of Technology(麻省理工学院) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 软件智能体 :planning(abstract)

AI总结 本研究提出一种双凸优化方法,用于凸障碍物周围的最小时间运动规划,可保证收敛、支持任意阶导数约束,实验表明其轨迹质量高、鲁棒性强且计算效率与现有方法相当。

Comments 18 pages, 9 figures, 4 tables. Submitted to IEEE Transactions on Robotics. Project page: https://wernerpe.github.io/bmtp-website/ Code: https://github.com/wernerpe/pybmtp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00844 2026-08-04 cs.CY cs.HC 新提交 50%

BoilerSketch: A TA-Supervised, Diagram-First GenAI Practice for Structured Diagrams in CS1/Early CS2

BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践

Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

专题命中 软件智能体 :workflow(abstract)

AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。

Comments 9 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26283 2026-07-30 cs.CV cs.RO 新提交 50%

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework

HeteroPROPMT:一种实时且隐私保护的异构协同感知框架

Armin Maleki, Hayder Radha

机构 * Michigan State University(密歇根州立大学)

专题命中 软件智能体 :agent(abstract)

AI总结 HeteroPROPMT是一种实时隐私保护异构协同感知框架,通过模块化提示与轻量调优对齐异构智能体特征,在OPV2V-H等数据集上性能优于现有方法,且参数效率高、隐私性好。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19501 2026-07-23 astro-ph.SR astro-ph.GA astro-ph.IM 新提交 50%

A Probabilistic Framework for Population Studies of the Solar Neighborhood: Application to SDSS-V and Gaia

太阳邻域种群研究的概率框架:应用于SDSS-V和盖亚

Ilija Medan, Keivan G. Stassun, Zachary Way, Guy S. Stringfellow, Alexandre Roman-Lopes, Jiadong Li, Madeline Lucey, Andrew R. Casey, Bárbara Rojas-Ayala, Ricardo López-Valdivia, José G. Fernández-Trincado

专题命中 软件智能体 :planning(abstract)

AI总结 该研究针对SDSS-V太阳邻域普查样本选择效应问题,提出概率框架及正向建模方法,通过模拟数据集验证,利用盖亚数据发布19的数据展示其科学效用,公开代码为未来研究提供重要工具。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18176 2026-07-21 astro-ph.IM physics.flu-dyn 新提交 50%

Per Astronomix ad Astra: High-Order Differentiable (Magneto)hydrodynamics with Energy-Conserving Self-Gravity

从天文到星际:具有能量守恒自引力的高阶可微(磁)流体动力学

Leonard Storcks, Nils Thuerey, Tobias Buck

专题命中 软件智能体 :agentic(abstract)

AI总结 介绍用Python/JAX编写的可微(磁)流体动力学模拟器astronomix,利用自动微分实现逆建模等,在单GPU运行时表现良好且可扩展,还提出新自引力方案及相关智能技术提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15977 2026-07-20 cs.CR 新提交 50%

Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization

拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险

Yu Cui, Ruiqing Yue, Tingyu Li, Sicheng Pan, Zhuoyu Sun, Xufeng Zhang, Baohan Huang, Haibin Zhang, Cong Zuo

专题命中 软件智能体 :agent(abstract)

AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12959 2026-07-15 cs.CV 新提交 50%

ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models

ViCo3D:利用视觉基础模型增强基于激光雷达的协作式3D目标检测

Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract)

AI总结 研究针对V2X系统中基于激光雷达协作式3D感知的不足,提出ViCo3D框架。通过将点云投影为图像让VFM提取特征,引入融合模块及跨智能体融合策略,实现了先进的3D检测性能,提升了协作增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12490 2026-07-15 cs.PL 新提交 50%

When is LLM-Based Program Reasoning Correct? A Completion Semantics for LLM-Based Code Inference

基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义

Zhiyuan Liu, Yihe Li, Trevor E. Carlson, Huiyan Wang, Ruijie Meng, Gregory J. Duck

专题命中 软件智能体 :workflow(abstract)

AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。

Comments 28 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12220 2026-07-15 cs.RO 新提交 50%

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :agent(abstract)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11601 2026-07-14 cs.CR 新提交 50%

Cardano's Voltaire Governance: Complete Specification and Research Program

卡尔达诺的伏尔泰治理:完整规范与研究计划

Nimrod Talmon, Oghenekaro Elem

专题命中 软件智能体 :agent(abstract)

AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10948 2026-07-14 eess.SY cs.SY 新提交 50%

Reinforcement Learning versus Optimization for Optimal Transmission Switching: A Comparative Study

最优输电切换的强化学习与优化方法比较研究

Yuanrui Sang, Israel Abiala, Rachel Gerdes

专题命中 软件智能体 :agent(abstract)

AI总结 研究最优输电切换问题,比较强化学习框架与基于混合整数线性规划的优化方法,通过在IEEE RTS-96 24节点系统上的案例研究发现,强化学习智能体在低预算下能产生接近最优解,生成可行解速度比优化求解器快两到三个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10842 2026-07-14 cs.RO cs.SY eess.SY 新提交 50%

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions

D-SafeMPC:基于离散时间控制障碍函数的扩散驱动安全模型预测控制

Erdi Sayar, Ersin Daş, Joel W. Burdick, Alois Knoll, Erdal Kayacan

机构 * Paderborn University(帕德博恩大学) Illinois Institute of Technology(伊利诺伊理工学院) California Institute of Technology(加州理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 软件智能体 :planning(abstract)

AI总结 研究针对扩散模型用于机器人规划时无法保证安全和动态约束的问题,提出D-SafeMPC方法,通过控制障碍函数等引导扩散过程,结合迭代投影方案,经实验验证该方法能提升安全性、任务成功率和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10017 2026-07-14 cs.MS cs.GR 新提交 50%

AcadGIS: A Single-Import Python Package for Reproducible, Publication-Ready Academic Maps

AcadGIS:一个用于生成可重现、适合发表的学术地图的单导入Python包

Ripon Chandra Malo, Shatabdi Roy, Tong Qiu

专题命中 软件智能体 :workflow(abstract)

AI总结 研究针对学术地图制作流程零散的问题,提出AcadGIS这个免费开源Python包,它能在一个命名空间下从高级命令创建面向发表的研究地图,通过三个用例展示其可将常见地图表示为紧凑脚本,解决了可访问性和可重复性问题。

Comments 19 pages, 8 figures, 2 tables, and 6 code listings. AcadGIS v0.2.0: https://github.com/riponcm/AcadGIS/releases/tag/v0.2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05777 2026-07-08 cs.RO 新提交 50%

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 软件智能体 :workflow(abstract)

AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。

Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03028 2026-07-07 cs.IR 新提交 50%

HETERQA: Benchmarking Record Retrieval over Multiple Heterogeneous Sources

HETERQA:多异构源记录检索基准测试

Yaodong Su, Hanchang Li, Quanqing Xu, Chuanhui Yang, Yixiang Fang

专题命中 软件智能体 :agentic(abstract)

AI总结 研究新兴系统中多异构源记录检索问题,构建含857个问答对的HETERQA基准,采用答案驱动方式,经多步操作生成,验证基准并评估多种检索器,为异构源记录检索提供有效测试平台。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 50%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 软件智能体 :agentic(abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00213 2026-07-02 cs.CR 新提交 50%

Federated Sovereign Transport Protocol (FSTP): Verifiable Coordination Without Disclosure

联邦主权传输协议 (FSTP):无需披露的可验证协调

Ramón Soto C., Liz Soto

专题命中 软件智能体 :agent(abstract)

AI总结 提出联邦主权传输协议 (FSTP),通过编译时类型系统强制数据隔离、上下文无关身份模型和基于Blocklace的事件日志,实现无需暴露内部数据的可验证联邦协调。

Comments 26 pages, 4 figures, 3 tables. Reference implementation in Rust (fstp-core). Protocol specification and code to be linked from GitHub release v0.1.0 upon announcement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30884 2026-07-01 cs.HC 新提交 50%

Debugging as Evidence-Driven Reasoning: Visualization Opportunities in Data-Intensive Programming

调试作为证据驱动的推理:数据密集型编程中的可视化机会

Yongbo Chen, Yan Zhu, Rebecca Faust

专题命中 软件智能体 :workflow(abstract)

AI总结 通过半结构化访谈揭示数据密集型调试中的三个跨领域挑战,并转化为可视化设计需求,为未来研究奠定基础。

Comments 5 pages, 1 figure, submitted to IEEE VIS conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27231 2026-06-26 quant-ph physics.ins-det 新提交 50%

A hardware-safety-gated system for LLM-written native ARTIQ control code on a trapped-ion platform

基于硬件安全门控的LLM编写原生ARTIQ控制代码系统在离子阱平台上的应用

Duanyang Wang, Lu Qi, Yuanheng Xie, Norbert M. Linke, Kenneth R. Brown

专题命中 软件智能体 :agent(abstract)

AI总结 提出一种硬件安全门控系统,通过令牌授权机制确保LLM代理在离子阱实验中安全自主地编写和执行控制代码,并在实验中验证了其有效性和可移植性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25244 2026-06-25 cs.PL 新提交 50%

Reading AI Model Compilation in MLIR Through the Lens of Formal Theories

通过形式理论的视角解读MLIR中的AI模型编译

Javed Absar

专题命中 软件智能体 :agent(abstract)

AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏