arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 408 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 72 篇

2605.09930 2026-05-12 cs.GT 75%

Fair Allocation under Conflict Constraints

在冲突约束下公平分配

Sarfaraz Equbal, Rohit Gurjar, Ayumi Igarashi, Yatharth Kumar, Pasin Manurangsi, Swaprava Nath, Raghuvansh Saxena, Rohit Vaish, Hirotaka Yoneda

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究在冲突约束下如何公平高效分配不可分割物品,针对两agent和一般数量agent情况,探讨EF1和最大分配的存在性及计算复杂性。

Comments This article unifies and extends the results in arXiv:2402.04353 and arXiv:2506.14149

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08647 2026-05-12 cs.CL cs.AI cs.LG 75%

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

AgentCollabBench: 评估好代理为何会成为差合作者

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan

机构 * University of Utah(犹他大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Dhaka(达卡大学) Vellore Institute of Technology(韦洛雷理工学院) University of Virginia(弗吉尼亚大学) Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学) Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) BRAC University(BRAC大学) Islamic University of Technology(伊斯兰技术大学) Comilla University(科摩拉大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AgentCollabBench,通过900个经人类验证的任务评估多代理系统中四个行为风险:指令衰减、虚假信念传播、上下文泄露和追踪耐久性,揭示模型在多跳信息生存中的结构问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10114 2026-05-12 cs.CL 74%

SkillRAE: Agent Skill-Based Context Compilation for Retrieval-Augmented Execution

SkillRAE: 基于技能的上下文编译用于检索增强执行

Xiangcheng Meng, Shu Wang, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 SkillRAE提出一种两阶段检索增强执行方法,通过构建多级技能图和救援感知紧凑编译,提升技能证据组织效率,实验证明在SkillsBench上比SOTA方法提升11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 74%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06047 2026-05-12 cs.AI cs.CL 73%

DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments

DSGBench:一种多样化的战略游戏基准,用于评估基于大语言模型的代理在复杂决策环境中的能力

Wenjie Tang, Yuan Zhou, Erqiang Xu, Keyan Cheng, Minne Li, Liquan Xiao

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能博弈与决策实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 DSGBench通过六个复杂战略游戏评估LLM代理在复杂决策环境中的能力,采用细粒度评分系统和自动决策追踪机制,揭示不同LLM模型的优劣与系统限制。

Comments 43 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10782 2026-05-12 cs.AI 70%

TrajPrism: A Multi-Task Benchmark for Language-Grounded Urban Trajectory Understanding

TrajPrism:一种多任务基准,用于语言引导的城市轨迹理解

Lihuan Li, Wilson Wongso, Baiyu Chen, Hao Xue, Ruiyi Yang, Yifan Duan, Xiachong Lin, Yang Song, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) HKUST (GZ)(香港科技大学(广州))

专题命中 Agent评测 :tool use(abstract);planning(abstract);分类 cs.AI

AI总结 TrajPrism通过统一轨迹生成、语义轨迹检索和轨迹描述三个任务,评估语言与轨迹的对齐性,展示几何轨迹基线在语言引导任务中的不足。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09494 2026-05-12 cs.RO cs.AI 70%

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08687 2026-05-12 cs.ET 67%

Data Product MCP: Chat with your Enterprise Data

数据产品MCP:与企业数据对话

Marco Tonnarelli, Filippo Scaramuzza, Simon Harrer, Linus W. Dietz

专题命中 Agent评测 :AI agent(abstract);agentic(abstract)

AI总结 本文提出数据产品MCP,通过整合数据产品市场,实现企业数据的自动发现和访问,同时保障数据合同的实时执行,提升数据治理效率。

Comments Author Accepted Manuscript SummerSoc 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00149 2026-05-12 physics.comp-ph 67%

Towards Verifiable and Self-Correcting AI Physicists for Quantum Many-Body Simulations

迈向量子多体模拟的可验证和自校正人工智能物理学家

Ken Deng, Xiangfei Wang, Guijing Duan, Chen Mo, Junkun Huang, Runqing Zhang, Ling Qian, Zhiguo Huang, Jize Han, Di Luo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出QMP-Bench基准和PhysVEC框架,通过自验证和纠错机制提升AI在量子多体模拟中的可靠性与准确性,显著优于现有LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10876 2026-05-12 cs.LG cs.AI q-bio.QM 62%

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

AssayBench: 一个基于实验层面的虚拟细胞基准,用于LLMs和代理

Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

机构 * Genentech(基因泰克)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 AssayBench通过1920个公开CRISPR实验构建,用于评估LLMs和代理在预测表型筛选中的性能,引入调整后的nDCG指标,显示通用LLMs在任务中表现优于生物专用模型。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10529 2026-05-12 cs.AI cs.LG 62%

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 62%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 62%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09228 2026-05-12 cs.LG cs.AI 62%

ProactBench: Beyond What The User Asked For

ProactBench: 超出用户所要求的

Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 ProactBench研究对话主动性,通过三个阶段分解能力,设计代理对抗偏见,验证不同模型在恢复阶段的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 62%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10585 2026-05-12 cs.LG 57%

Controllability in preference-conditioned multi-objective reinforcement learning

偏好条件多目标强化学习中的可控性

Pau de las Heras Molins, Beyazit Yalcinkaya, Lasse Peters, David Fridovich-Keil, Georgios Bakirtzis

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) University of California, Berkeley(加州大学伯克利分校) TU Delft(代尔夫特理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新的评估指标,用于衡量偏好条件多目标强化学习中控制能力的可靠性,以解决现有指标无法准确反映偏好变化对智能体行为影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10447 2026-05-12 cs.MA cs.AI econ.GN q-fin.EC q-fin.ST 57%

Statistical Model Checking of the Keynes+Schumpeter Model: A Transient Sensitivity Analysis of a Macroeconomic ABM

凯恩斯+施穆埃特模型的统计模型检验:一个宏观经济ABM的暂态敏感性分析

Stefano Blando, Giorgio Fagiolo, Mauro Napoletano, Tania Treibich, Andrea Vandin

机构 * Institute of Economics L'EMbeDS Sant'Anna School of Advanced Studies, Pisa, Italy GREDEG, CNRS, Universit\'e C\ ote d'Azur Sophia Antipolis, France Maastricht University Maastricht, The Netherlands

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过MultiVeStA实现统计模型检验,对凯恩斯+施穆埃特模型进行暂态敏感性分析,展示其在宏观经济ABM中的应用,提供可重复且信息丰富的定量分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10170 2026-05-12 cs.LG 57%

Balancing Efficiency and Fairness in Traffic Light Control through Deep Reinforcement Learning

通过深度强化学习平衡交通灯控制的效率与公平性

Matteo Cederle, Giacomo Scatto, Gian Antonio Susto

机构 * University of Padova(帕多瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新型深度强化学习代理,通过整合公平性考虑平衡车辆和行人交通流,实验证明能有效减少拥堵并保障服务公平性。

Comments Paper accepted to the 2026 IFAC World Congress, held in Busan (KOR), August 23rd-28th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19792 2026-05-12 cs.AI cs.DC cs.MA cs.NE 57%

OpenCLAW-P2P v7.0-P2PCLAW: Resilient Multi-Layer Persistence, Live Reference Verification, and Production-Scale Evaluation of Decentralized AI Peer Review v7.0 -- Mathematical Corrections & Ecosystem Developments Edition

OpenCLAW-P2P v7.0-P2PCLAW:具有容错多层持久性、实时参考验证和生产规模评估的去中心化AI同行评审v7.0--数学修正与生态系统发展版

Francisco Angulo de Lafuente, Teerth Sharma, Vladimir Veselov, Seid Mohammed Abdu, Nirmal Tej Kumar, Guillermo Perry

机构 * Independent AI Researcher & Science Fiction Writer(独立AI研究员及科幻作家) Bachelor of Technology (AI)(人工智能技术学士) Moscow Institute of Electronic Technology (MIET)(莫斯科电子技术学院) Dept. of Computer Science, Woldia University(沃尔迪亚大学计算机科学系) University of Texas at Dallas (UTD)(德克萨斯大学达拉斯分校) Andex Enterprising Inc.(安德克斯企业公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文介绍OpenCLAW-P2P v7.0,一个去中心化集体智能平台的全面演进,允许自主AI代理发布、同行评审、评分并迭代改进科学论文。该版本包含数学修正和生态系统扩展。

Comments v7.0: Mathematical corrections (fixed-point condition Eq.4, dimensionally consistent tau-indicator Eq.7, fully specified reputation formula Eq.8 with quality terms q0 and q-bar, discrete-time PD Governor Eq.15, HSR parameter definitions Eq.16); ecosystem developments: CAJAL-4B/9B models, BenchClaw platform, 14 integrations. 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 57%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09818 2026-05-12 cs.LG 57%

Learning to Compress Time-to-Control: A Reinforcement Learning Framework for Chronic Disease Management

学习压缩时间到控制:一种用于慢性病管理的强化学习框架

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

机构 * Altitude

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种强化学习框架,通过结合偏好学习和强化学习,改进慢性病管理中的时间到控制(TTC)压缩,实验表明其在糖尿病管理中优于现有方法。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09698 2026-05-12 cs.AI 57%

Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

Ambig-DS:数据科学代理任务框架模糊度的基准测试

Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen

机构 * Novo Nordisk London, UK(诺和制药伦敦分公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Ambig-DS引入两个诊断套件,用于预测目标模糊度和评估目标模糊度,通过控制编辑生成模糊变体,发现任务框架模糊度是数据科学代理评估的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI 57%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09295 2026-05-12 cs.CL 57%

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

LEAF-SQL: 基于分层探索与自适应细化的文本到SQL骨架预测

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan

机构 * School of Computing(计算学院) Artificial Intelligence(人工智能) Jiangxi University of Finance(江西财经大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 LEAF-SQL通过分层探索与自适应细化方法,提升复杂SQL生成性能,实验表明其在BIRD基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11287 2026-05-12 cs.AR cs.SE 57%

Synthesis-in-the-Loop Evaluation of LLMs for RTL Generation: Quality, Reliability, and Failure Modes

LLM在RTL生成中的回路合成评估:质量、可靠性与故障模式

Weimin Fu, Zeng Wang, Minghao Shao, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu, Xiaolong Guo

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文评估32个语言模型在202个Verilog任务上的RTL生成能力,通过硬件质量指数衡量合成与实现质量,发现不同模型在HQI指标上的表现差异显著,揭示了专有模型与开源模型在合成故障上的系统性差异。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10356 2026-05-12 cs.CL 57%

Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents

自主持续学习用于计算机使用智能体的环境适应

Tianci Xue, Zeyi Liao, Tianneng Shi, Zilu Wang, Kai Zhang, Dawn Song, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16093 2026-05-12 q-fin.PM cs.AI math.PR 57%

Efficient Portfolio Selection through Preference Aggregation with Quicksort and the Bradley--Terry Model

通过快速排序和布拉德利-蒂尔模型进行高效投资组合选择

Yurun Ge, Lucas Böttcher, Tom Chou, Maria R. D'Orsogna

机构 * Department of Mathematics, California State University at Northridge(加州州立大学北岭分校数学系) Department of Computational Medicine, University of California, Los Angeles(加州大学洛杉矶分校计算医学系) Department of Computational Science and Philosophy, Frankfurt School of Finance and Management(法兰克福金融与管理学院计算科学与哲学系) Laboratory for Systems Medicine, University of Florida(佛罗里达大学系统医学实验室) Department of Mathematics, University of California, Los Angeles(加州大学洛杉矶分校数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于快速排序和布拉德利-蒂尔模型的高效投资组合选择方法,通过聚合个体评估以最大化总体收益,优于现有方法,并结合采样技术减少配对比较。

Comments 15pp, 4 figs

Journal ref J. Comput. Sci. 92, 102728 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08713 2026-05-12 cs.RO cs.AI 57%

REAP: Reinforcement-Learning End-to-End Autonomous Parking with Gaussian Splatting Simulator for Real2Sim2Real Transfer

REAP:基于高斯点扩散模拟器的端到端自主泊车强化学习

Changze Li, Zhe Chen, Shaoyu Chen, Lisen Mu, Yijian Li, Yuelong Yu, Qian Zhang, Qing Su, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics Technology Research and Development Co., Ltd.(地平线机器人技术研究与开发有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出REAP方法,通过高斯点扩散模拟器实现Real2Sim2Real迁移,利用SAC算法提升训练效率,结合行为克隆和软预测碰撞惩罚机制,解决极端场景下的泊车问题。

详情

展开后加载摘要…

URL PDF HTML 收藏