arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-16 至 2026-04-16 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2604.13452 2026-04-16 cs.CL 87%

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12213 2026-04-16 cs.AI cs.MA cs.SE 86%

Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension

代理到代理网络中的模态本原路由:一种多模态A2A协议扩展

Vasundra Srinivasan

机构 * AI Architect, Author—Data Engineering for Multimodal AI (O’Reilly)(人工智能架构师,作者—多模态AI的数据工程(O’Reilly)) Stanford School of Engineering (April 2026)(斯坦福大学工程学院(2026年4月))

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MMA2A架构,通过多模态本原路由提升任务准确率,其在跨模态任务中表现优于文本瓶颈基线,尤其在视觉依赖任务中效果显著,但增加了1.8倍的延迟。

Comments 14 pages, 4 figures (TikZ). PDFLaTeX. Supplementary code and experiment artifacts: https://github.com/vasundras/modality-native-routing-a2a-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12102 2026-04-16 cs.AI cs.CV cs.LG 84%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 82%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13954 2026-04-16 cs.LG cs.AI 81%

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

HINTBench:地平线代理内在非攻击轨迹基准

Jiacheng Wang, Jinchang Hou, Fabian Wang, Ping Jian, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究内在风险审计,提出HINTBench基准,包含629条轨迹,评估风险检测、风险步定位和内在故障识别,发现强LLM在风险步定位上表现差,揭示内在风险审计的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18436 2026-04-16 cs.OS cs.AI cs.FL cs.SE 81%

VeruSAGE: A Study of Agent-Based Verification for Rust Systems

VeruSAGE:Rust系统代理验证的研究

Chenyuan Yang, Natalie Neamtu, Chris Hawblitzel, Jacob R. Lorch, Shan Lu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM在Rust系统验证中的能力,提出VeruSAGE-Bench基准测试集,并设计不同代理系统以匹配不同LLM的特性,结果显示最佳组合能完成超过80%的验证任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13047 2026-04-16 cs.SI cs.AI cs.CY 79%

Integration of Deep Reinforcement Learning and Agent-based Simulation to Explore Strategies Counteracting Information Disorder

深度强化学习与基于代理的仿真整合以探索对抗信息紊乱的策略

Luigi Lomasto, Andrea Camoia, Alfonso Guarino, Nicola Lettieri, Delfina Malandrino, Rocco Zaccagnino

机构 * Department of Computer Science, University of Salerno(萨勒诺大学计算机科学系) National Institute for Public Policy Analysis (INAPP)(公共政策分析国家研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文整合深度强化学习与基于代理的仿真,研究如何通过科学模拟复杂假新闻动态及遏制策略,以对抗信息紊乱现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 79%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 78%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 Agent评测 :agent(title,abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13552 2026-04-16 cs.CL cs.AI 73%

Training-Free Test-Time Contrastive Learning for Large Language Models

无需训练的测试时对比学习用于大语言模型

Kaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出无需训练的测试时对比学习(TF-TTCL),通过动态'探索-反思-引导'循环提升冻结大语言模型的在线推理能力,优于零样本基线和代表性测试时适应方法。

Comments Accepted by Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13686 2026-04-16 cs.CL cs.AI cs.DB 62%

IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages

IndicDB -- 评估印度语言多语言文本到SQL能力的基准测试

Aviral Dawar, Roshan Karanth, Vikram Goyal, Dhruv Kumar

机构 * National Data and Analytics Platform(国家数据与分析平台) India Data Portal(印度数据门户) NDAP(国家数据与分析平台) ICRISAT(国际作物研究所) IHDS(印度家庭与育儿调查)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 IndicDB是一个多语言文本到SQL基准测试,用于评估跨语言语义解析能力,包含20个数据库和237张表,通过迭代三代理框架生成15617个任务,揭示了印度语言在SQL解析中的性能差距。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13059 2026-04-16 cs.CL cs.AI 62%

A Proactive EMR Assistant for Doctor-Patient Dialogue: Streaming ASR, Belief Stabilization, and Preliminary Controlled Evaluation

一种主动的电子病历助手:面向医生-患者对话的流式语音识别、信念稳定化和初步受控评估

Zhenhai Pan, Yan Liu, Jia You

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种主动电子病历助手,通过流式语音识别、标点恢复、状态提取、信念稳定化、对象化检索、行动规划和可回放报告生成,提升医生-患者对话中的病历记录效率与前瞻性支持。

Comments 10 pages, 1 figure, 6 tables. Companion systems manuscript. Preliminary controlled evaluation in a simulated pilot setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13381 2026-04-16 cs.HC cs.AI 57%

Young people's perceptions and recommendations for conversational generative artificial intelligence in youth mental health

青少年对对话生成人工智能在青少年心理健康中的认知与建议

Adam Poulsen, Ian B. Hickie, Carla Gorban, Zsofi de Haan, William Capon, Ebenezer Eyeson-Annan, Jalal Radwan, Elizabeth M. Scott, Frank Iorfino, Haley M. LaMonica

机构 * Brain and Mind Centre, The University of Sydney(悉尼大学脑与心灵中心) Uncapt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨青少年对生成式AI聊天机器人在心理健康中的看法及改进建议,揭示其态度与需求,为服务整合提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 57%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 57%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13049 2026-04-16 cs.SI cs.AI 57%

Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems

劫持在线评论:流行度偏向评分系统中的稀疏操控与行为缓冲

Itsuki Fujisaki, Kunhao Yang

机构 * College of Knowledge and Library Science, School of Informatics, Tsukuba University(知识与图书馆科学学院,信息学院,筑波大学) College of Engineering, Shibaura Institute of Technology(工学院,柏市技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨恶意评论者如何利用流行度偏向的评分动态,并分析用户行为异质性对损害的缓解作用,发现稀疏攻击比广泛攻击更具破坏性,且用户异质性能部分缓冲评分扭曲。

Comments 18page, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08230 2026-04-16 cs.AI 57%

Empowerment Gain and Causal Model Construction: Children and adults are sensitive to controllability and variability in their causal interventions

赋能增益与因果模型构建:儿童和成人对干预可控性和变异性敏感

Eunice Yiu, Kelsey Allen, Shiry Ginosar, Alison Gopnik

机构 * Department of Psychology, University of California, Berkeley(加州大学伯克利分校心理学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了赋能增益在因果学习中的作用,通过实验验证儿童和成人如何利用赋能信号推断因果关系并设计干预措施。

Comments Accepted to Philosophical Transactions A, Special issue: World models, AGI, and the hard problems of life-mind continuity. Expected publication in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 57%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 57%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 57%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13909 2026-04-16 quant-ph 50%

dqc_simulator: an easy-to-use distributed quantum computing simulator

dqc_simulator: 一个易于使用的分布式量子计算模拟器

Kenny Campbell

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出dqc_simulator,一个Python编写的新型模拟工具,自动化了分布式量子计算模拟的关键步骤,便于创建可靠的全栈测试和基准。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20515 2026-04-16 q-fin.CP econ.EM q-fin.RM 50%

Modeling Bank Systemic Risk of Emerging Markets under Geopolitical Shocks: Empirical Evidence from BRICS Countries

新兴市场银行系统性风险建模:地缘政治冲击下的实证研究——以金砖国家为例

Haibo Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出BRIDGES框架,通过动态图和事件模拟分析金砖国家银行系统性风险,揭示最大银行失败和地缘政治冲击对系统稳定性的影响。

Comments 22 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13159 2026-04-16 econ.EM 50%

Nonparametric mixed logit model with market-level parameters estimated from market share data

非参数混合逻辑模型:基于市场份额数据估计的市场级参数

Xiyuan Ren, Joseph Y. J. Chow, Prateek Bansal

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种非参数混合逻辑模型,利用市场级选择份额数据估计,通过多代理逆效用最大化问题解决现有市场级选择模型的参数估计局限。实证研究显示该模型在估计精度和预测准确性上优于传统模型。

Journal ref Transportation Research Part B 196 (2025) 103220

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13121 2026-04-16 cs.RO 50%

Olfactory pursuit: catching a moving odor source in complex flows

嗅觉追逐:在复杂的流体中捕捉移动的气味源

Maurizio Carbone, Lorenzo Piro, Robin A. Heinonen, Luca Biferale, Massimo Cencini, Antonio Celani

机构 * Istituto dei Sistemi Complessi, CNR(复杂系统研究所,国家研究 council) Department of Physics & INFN, Tor Vergata University of Rome(罗马 Tor Vergata 大学物理系及 INFN)

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出了一种基于部分可观测马尔可夫决策过程的嗅觉追逐方法,结合信息获取与贪心策略,有效应对目标持续运动的挑战,提升在信息贫乏环境中的搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07043 2026-04-16 cond-mat.mtrl-sci 50%

Uni2D: A Universal Machine Learning Interatomic Potential for Two-Dimensional Materials

Uni2D:一种适用于二维材料的通用机器学习交互势能模型

Haidi Wang, Yufan Yao, Haonan Song, Huimiao Wang, Xiaofeng Liu, Zhao Chen, Weiwei Chen, Weiduo Zhu, Zhongjun Li, Jinlong Yang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Uni2D,一种针对二维材料设计的交互势能模型,通过大规模数据训练实现了对能量、力和应力的可靠预测,支持高通量筛选和计算探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01858 2026-04-16 math.OC q-fin.PM 50%

Mean Field Game of Optimal Tracking Portfolio

均场博弈中的最优跟踪投资组合

Lijun Bo, Yijie Huang, Xiang Yu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了由大量基金管理人员竞争产生的均场博弈问题,引入了基于基准跟踪的相对绩效。通过连续代理模型,建立带有反射状态过程的均场博弈问题,并利用PDE方法证明了均场均衡的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10000 2026-04-16 q-bio.PE cond-mat.stat-mech nlin.CG 50%

Universal principles of cell population growth follow from local contact inhibition

细胞群体增长的普遍原理源于局部接触抑制

Gregory J. Kimmel, Sadegh Marzban, Mehdi Damaghi, Arne Traulsen, Alexander R. A. Anderson, Jeffrey West, Philipp M. Altrock

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过研究微观假设与接触抑制的联系,统一了五种经典肿瘤生长定律,揭示了接触抑制与其他假设对癌症细胞生长定量理解的影响。

Comments 41 pages, 6 main figures, 2 tables, 67 references, 4 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏