arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-17 至 2026-03-17 共收录 270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 41 篇

2602.22680 2026-03-17 cs.AI 77%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 73%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15297 2026-03-17 cs.AI 70%

Evolutionary Transfer Learning for Dragonchess

进化迁移学习用于龙棋

Jim O'Connor, Annika Hoag, Sarah Goyette, Gary B. Parker

机构 * Computer Science Department, Connecticut College, New London, United States(康奈尔学院计算机科学系,新伦敦,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出利用进化迁移学习在龙棋中适应启发式评估函数,通过CMA-ES优化提升AI性能,展示了在复杂游戏领域中迁移学习的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 70%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 70%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 70%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 67%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13919 2026-03-17 cs.CV 67%

OpenCOOD-Air: Prompting Heterogeneous Ground-Air Collaborative Perception with Spatial Conversion and Offset Prediction

OpenCOOD-Air: 通过空间转换和偏移预测提示异构地面-空域协作感知

Xianke Wu, Songlin Bai, Chengxiang Li, Zhiyao Luo, Yulin Tian, Fenghua Zhu, Yisheng Lv, Yonglin Tian

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出OpenCOOD-Air框架,通过引入无人机作为扩展平台,解决V2V协作感知中的地面遮挡和传感器视角限制问题,采用迁移学习和跨域空间转换器提升感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21201 2026-03-17 cs.AI cs.CL cs.LG 67%

Aletheia tackles FirstProof autonomously

Aletheia 自主解决首个 FirstProof 挑战

Tony Feng, Junehyuk Jung, Sang-hyun Kim, Carlo Pagano, Sergei Gukov, Chiang-Chiang Tsai, David Woodruff, Adel Javanmard, Aryan Mokhtari, Dawsen Hwang, Yuri Chervonyi, Jonathan N. Lee, Garrett Bingham, Trieu H. Trinh, Vahab Mirrokni, Quoc V. Le, Thang Luong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Aletheia 基于 Gemini 3 Deep Think 自主解决 FirstProof 挑战中的 6 个问题,专家评估显示其在 10 个问题中表现突出,但问题 8 存在争议。

Comments 41 pages. Project page: https://github.com/google-deepmind/superhuman/tree/main/aletheia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14769 2026-03-17 cs.LG cs.AI 62%

POLCA: Stochastic Generative Optimization with LLM

POLCA:基于LLM的随机生成优化

Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出POLCA框架,通过生成语言模型作为优化器,结合数值奖励和文本反馈,解决复杂系统的随机生成优化问题,实现高效探索与利用的平衡,实验表明其在多种基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07112 2026-03-17 cs.CL cs.AI 62%

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

更多代理提升数学问题解决能力但对抗鲁棒性差距依然存在

Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多个代理在数学问答中的表现,发现协作提升准确性但对抗鲁棒性差距持续存在,人类错误仍是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 62%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15185 2026-03-17 cs.RO cs.AI cs.CV 57%

What Matters for Scalable and Robust Learning in End-to-End Driving Planners?

在端到端驾驶规划器中,可扩展性和鲁棒性学习中什么重要?

David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Max-Planck-Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文研究了端到端驾驶规划器中可扩展性和鲁棒性学习的关键因素,提出BevAD架构在Bench2Drive基准上达到72.7%的成功率,展示了纯模仿学习的数据扩展能力。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 57%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13773 2026-03-17 cs.CL 57%

LiveWeb-IE: A Benchmark For Online Web Information Extraction

LiveWeb-IE:一个在线网页信息提取的基准测试

Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出LiveWeb-IE基准测试,用于评估在线网页信息提取系统,通过活体网站和多阶段代理框架VGS,提升信息提取的准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13744 2026-03-17 cond-mat.mtrl-sci cs.AI 57%

Research Paradigm of Materials Science Tetrahedra with Artificial Intelligence

材料科学四面体与人工智能的研究范式

Shiyun Zhang, Yibo Yao, Haoquan Long, Dingwen Tao, Guangming Tan, Wei-Hua Wang, Yuan-Chao Hu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了经典材料四面体研究范式,并提出两个新的AI增强研究范式,旨在推动数据驱动和AI辅助的材料科学研究。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 57%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13263 2026-03-17 cs.LG 57%

Beyond Attention: True Adaptive World Models via Spherical Kernel Operator

超越注意力:通过球面核算子构建真正的自适应世界模型

Vladimer Khasia

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15493 2026-03-17 hep-ex 50%

LEP Data@EDM4hep: mitigating data loss risks by increasing data FAIRness, with a view on FCC-ee

LEP数据@EDM4hep:通过提高数据FAIR性来缓解数据丢失风险,展望FCC-ee

Jacopo Fanini, Gerardo Ganis, Marcello Maggi

专题命中 Agent评测 :workflow(abstract)

AI总结 本文探讨了通过提升数据FAIR性以保障LEP数据长期可用性,并提出利用EDM4hep格式迁移数据,以支持FCC-ee实验的物理潜力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14938 2026-03-17 cs.CV 50%

FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving

FAR-Drive:闭环自动驾驶中的帧自回归视频生成

Yaoru Li, Federico Landi, Marco Godi, Xin Jin, Ruiju Fu, Yufei Ma, Muyang Sun, Heyu Si, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出FAR-Drive,一种用于自动驾驶的帧级自回归视频生成框架,通过多视角扩散变换器实现几何一致的多摄像机生成,解决闭环模拟中的长时程一致性、自回归退化和低延迟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14449 2026-03-17 cs.HC 50%

Tap-to-Adapt: Learning User-Aligned Response Timing for Speech Agents

Tap-to-Adapt:学习用户对齐的语音代理响应时机

Zihong He, Hai-Ning Liang, Chen Liang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Tap-to-Adapt框架,通过用户点击交互实现在线学习标签,改进语音代理响应时机判断,结合Dilated TCN和序列重播策略,通过实验和用户研究验证有效性,并开发专用评估系统收集20,000个样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 50%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11255 2026-03-17 cs.GT 50%

Sequential Solution Concepts in Cooperative Games with Generalized Characteristic Functions

序贯解概念在具有广义特征函数的合作游戏中

Ashwin Goyal, Drashthi Doshi, Swaprava Nath

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了序贯解概念,针对时间合作游戏中的顺序敏感性,提出新的奖励分享机制,定义了序贯效率等核心贡献。

Comments 22 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11045 2026-03-17 eess.SY cs.SY 50%

Opinion Clustering under the Friedkin-Johnsen Model: Agreement in Disagreement

在Friedkin-Johnsen模型下进行意见聚类:在分歧中达成一致

Aashi Shrinate, Twinkle Tripathy

专题命中 Agent评测 :agent(abstract)

AI总结 研究在Friedkin-Johnsen模型中通过拓扑条件实现意见聚类,提出Locally Topologically Persuasive(LTP)代理的概念,展示如何通过放置LTP代理设计任意期望的意见聚类网络。

Comments Accepted for Presentation in the American Control Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18008 2026-03-17 cs.GT 50%

Ultra Efficient Contracts: Pushing the Boundaries of Tractable Contract Design

超高效合同:拓展可计算合同设计的边界

Michal Feldman, Liat Yashin

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在组合动作框架下最优合同问题,提出了一种新的Ultra奖励类,解决了可计算性边界问题,并扩展到非加性成本函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17295 2026-03-17 cond-mat.stat-mech 50%

Coarsening in the Persistent Voter Model: analytical results

持久投票模型中的粗化现象:分析结果

R. G. de Almeida, J. J. Arenzon, F. Corberi, W. G. Dantas, L. Smaldone

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了简化版持久投票模型的粗化动力学,分析了其与原模型的相似性,并推导了相关关联函数的方程,通过闭合方案和数值模拟验证了解析解的准确性。

Comments 11 pages, 12 figures

Journal ref Phys. Rev. E 111 (2025) 064313

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13597 2026-03-17 eess.IV cs.MM 50%

DQ-Ladder: A Deep Reinforcement Learning-based Bitrate Ladder for Adaptive Video Streaming

DQ-Ladder: 一种基于深度强化学习的比特率阶梯用于自适应视频流媒体

Reza Farahani, Zoha Azimi, Vignesh V Menon, Hermann Hellwagner, Radu Prodan, Schahram Dustdar, Christian Timmerer

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出DQ-Ladder,一种基于深度强化学习的自适应视频流媒体比特率阶梯,通过预测解码时间、质量评分和段级比特率来优化编码时间、解码效率和视频质量。

Comments Adaptive Video Streaming, Deep Reinforcement Learning, Q-Learning, Bitrate Ladder, Quality Prediction

详情

展开后加载摘要…

URL PDF HTML 收藏