arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-30 至 2026-07-30 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2607.25987 2026-07-30 cs.CR cs.SE 版本更新 57%

IH-Benchmark: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications

\textsc{IH - 基准测试}:用于大语言模型应用中指令层次鲁棒性的以冲突为中心的基准测试

Conor McCauley, Zeliang Kan, Jason Martin

专题命中 Agent评测 :tool-use(abstract);分类 cs.SE

AI总结 研究大语言模型接收到不同优先级冲突指令时遵循哪个的问题,提出IH - 基准测试,基于人工分类法构建,用统一协议评估,涵盖多种设置。通过对37个模型评估发现指令层次鲁棒性非单一能力,需多方面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 57%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13317 2026-07-30 cs.CL 版本更新 57%

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30256 2026-07-30 cs.CV cs.CL cs.HC 版本更新 57%

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

VideoFDB: 评估对话代理中的全双工视觉-语音能力

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

机构 * NVIDIA David AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。

Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21033 2026-07-30 cs.CE cs.LG 版本更新 57%

TabPFN Extensions for Interpretable Geotechnical Modelling

TabPFN扩展在可解释地质建模中的应用

Taiga Saito, Yu Otake, Daijiro Mizutani, Stephen Wu

机构 * Department of Civil and Environmental Engineering, Tohoku University(东北大学土木环境工程系) Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所统计数学研究所) Department of Statistical Science, The Graduate University for Advanced Studies(高级研究大学统计科学系)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文评估了TabPFN及其扩展库在地质任务中的表现,通过土壤类型分类和参数迭代填补,展示了TabPFN在不确定性量化和可解释性方面的优势。

Journal ref Georisk: Assessment and Management of Risk for Engineered Systems and Geohazards (2026) 1-20

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24155 2026-07-30 cs.CY cs.AI cs.HC 版本更新 57%

The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers

对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧

Benjamin Minhao Chen, Xinyu Xie

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。

Comments ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15336 2026-07-30 cs.HC cs.AI 版本更新 57%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04480 2026-07-30 cs.AI cs.CE cs.SY eess.SY math.OC 57%

Prescriptive Artificial Intelligence: A Formal Paradigm for Auditing Human Decisions Under Uncertainty

规范性人工智能:一种用于在不确定性下审计人类决策的正式范式

Pedro Passos

机构 * Institute of Computing, Universidade Federal Fluminense (UFF)(联邦弗鲁米嫩塞大学计算研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出规范性人工智能作为高风险环境下的人类-人工智能决策协作范式,通过四个公理证明了其与预测系统的核心区别,并展示了在决策模仿中系统性偏差的限制。

Comments Preprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26731 2026-07-30 cs.HC 新提交 50%

Affective Tools for Thought: Towards Shared Attention and Affective Reorienting in AI-Supported Thinking

面向情感化思维工具:实现AI辅助思维中的共享注意力与情感重定向

Yifu Liu, Raffaele Andrea Buono, Nadia Bianchi-Berthouze

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有思维工具对情感的片面认知,提出情感是认知的构成要素,明确情感化思维工具的两大障碍,给出三种设计策略并基于相关实证研究为未来设计提供启发。

Comments 4 pages, 2-column ACM format. Accepted to the CHI 2026 Workshop on Tools for Thought: Understanding, Protecting, and Augmenting Human Cognition with Generative AI, April 16, 2026, Barcelona, Spain. Workshop website: https://ai-tools-for-thought.github.io/workshop/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27039 2026-07-30 math.OC q-fin.MF 新提交 50%

Forcing and duality-corrected contracts for volatility control

用于波动率控制的强制型和对偶修正型合约

Alessandro Chiusolo, Emma Hubert, Dylan Possamaï, Nizar Touzi

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对带漂移和波动率控制的连续时间委托代理问题,在指出现有方法最优性假设局限性的基础上,提出两类通用合约形式以修正对偶间隙,为波动率控制下的最优激励构建提供更通用方案。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26438 2026-07-30 quant-ph 新提交 50%

Quantum Optical Reinforcement Learning via Spectrum-Resolved Hong-Ou-Mandel Interference

基于光谱分辨Hong-Ou-Mandel干涉的量子光学强化学习

Shaojun Wu, Jiahua Xu, Shan Jin, Zhen Yang, Yifang Xu, Chenglong You, Guangwei Deng, Luyan Sun, Chang-Ling Zou, Xiaoting Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出光谱分辨Hong-Ou-Mandel干涉架构,构建光学Actor-Critic智能体,在5个连续控制基准任务中性能优于多层感知器基线,还成功实现Transmon量子比特可调耦合门的在线校准,保真度恢复效果优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12214 2026-07-30 cs.CV 版本更新 50%

Robust 4D Driving Scene Reconstruction from Imperfect Visual Priors

超越完美先验:用于野外4D驾驶重建的自适应高斯图

Xiaoyun Dong, Qian Xu, Yun Wang, Yang Lu, Jen-Ming Wu, Jianping Wang

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院)

专题命中 Agent评测 :agent(abstract)

AI总结 研究针对野外4D驾驶场景重建,现有方法依赖精确先验,噪声先验下有问题。提出自适应高斯图(AGG)框架,含语义引导策略和自适应拓扑进化模块。在KITTI和Wild-30实验验证,AGG在视觉保真度和鲁棒性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23321 2026-07-30 cs.IR 版本更新 50%

MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models

MMEB-V3: 多模态嵌入模型性能差距的测量

Haohang Huang, Xuan Lu, Mingyi Su, Xuan Zhang, Ziyan Jiang, Ping Nie, Kai Zou, Tomas Pfister, Wenhu Chen, Wei Zhang, Xiaoyu Shen, Rui Meng

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出MMEB-V3基准,评估文本、图像、视频、音频及基于代理的多模态嵌入,发现现有模型在跨模态检索中存在显著偏差和不足。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11509 2026-07-30 cs.GT cs.CC 版本更新 50%

On the Complexity of the Optimal Correlated Equilibria in Extensive-Form Games

扩展式博弈中最优相关均衡的复杂性

Vincent Cheval, Florian Horn, Soumyajit Paul, Mahsa Shirmohammadi

专题命中 Agent评测 :agent(abstract)

AI总结 该研究证明多人扩展式博弈中最优NFCE的阈值问题为PSPACE-难,AFCE的该问题为NP-难,确定了多类相关均衡阈值问题的NP-完全性,还将扩展式博弈中任意NE计算归入FixP。

Comments Technical report of paper published in The 26th ACM Conference on Economics and Computation (EC26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2607.26352 2026-07-30 cs.NI cs.AI cs.MA 新提交 57%

Pramana: A Composable, Domain-Specific Backend for Empirical Networking Research

Pramana:面向实证网络研究的可组合领域专用后端

Jaber Daneshamooz, Eugene Vuong, Alagappan Ramanathan, Manni Moghimi, Haarika Manda, Satyam Kumar, Snithik Thode, Satyandra Guthula, Sylee Beltiukov, Dongsu Han, Tarun Mangla, Sangeetha Abdu Jyothi, Walter Willinger, Arpit Gupta

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文提出面向实证网络研究的可组合领域专用后端Pramana,其通过单一意图规范实现跨载体运行,概念验证可满足34%的数据生成意图,为加速网络研究提供了支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏