arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-01 至 2026-06-01 共收录 187 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 38 篇

2605.30802 2026-06-01 cs.MA cs.AI 88%

Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution

用于预测市场决议的多智能体AI预言机系统的设计与评估

Tarun Kota

机构 * Yale University(耶鲁大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本研究设计并评估了多智能体LLM架构作为预测市场决议的预言机,通过独立聚合与协商共识两种机制,在KalshiBench数据集上对比单模型基线,发现置信度加权投票的独立聚合达到83.43%准确率,而协商共识因错误传播性能下降,并提出了混合AI-人类预言机的路由标准。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30653 2026-06-01 cs.CL 88%

Counterfactual Graph for Multi-Agent LLM Calibration

多智能体LLM校准的反事实图

Jiatan Huang, Mingchen Li, Ziming Li, Sunjae Kwon, Hong Yu, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 针对多智能体LLM系统中通信导致的相关失败和虚假共识问题,提出CAGE-CAL框架,通过比较观察到的通信后图与匹配的反事实无通信图来校准置信度,提升可靠性区分和拓扑选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01011 2026-06-01 cs.MA cs.AI 88%

Multi-Agent Teams Hold Experts Back

多智能体团队阻碍专家发挥

Aneesh Pappu, Batu El, Hancheng Cao, Carmelo di Nolfo, Yanchao Sun, Meng Cao, James Zou

机构 * stanford(斯坦福大学) apple(苹果公司) goizueta business school, emory(埃默里大学戈izueta商学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 研究自组织多智能体LLM团队在无约束协调下无法匹配专家性能,发现整合妥协行为是主要瓶颈,导致性能损失高达41.1%。

Comments Accepted at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30488 2026-06-01 cs.RO 88%

CoMo3R-SLAM: Collaborative Monocular Dense SLAM with Learned 3D Reconstruction Priors for Outdoor Multi-Agent Systems

CoMo3R-SLAM: 面向室外多智能体系统的协作式单目稠密SLAM与学习型3D重建先验

Zhihao Cao, Qi Shao, Shuhao Zhai, Feng Tian, Anh Nguyen, Hesheng Wang, Baoru Huang

机构 * ETH Zurich(苏黎世联邦理工学院) University of Liverpool(利物浦大学) Harbin Engineering University(哈尔滨工程大学) University of Ottawa(Ottawa大学) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 提出首个协作式单目稠密RGB SLAM系统CoMo3R-SLAM,利用学习的前馈3D重建先验实现室外多智能体地图构建,无需深度传感器即可生成全局一致的度量地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28175 2026-06-01 cs.IR 88%

Mixture-of-Experts Knowledge Graph Retrieval-Augmented Generation for Multi-Agent LLM-based Recommendation

基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统

Shijie Wang, Chengyi Liu, Yujuan Ding, Shanru Lin, See-Kiong Ng, Xu Xin, Wenqi Fan

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03012 2026-06-01 cs.CR cs.AI 85%

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

CVE-Factory:规模化专家级代码安全漏洞智能体任务

Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Jinyang Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Zeng, Wanxiang Che

机构 * Harbin Institute of Technology (HIT)(哈尔滨工业大学) Central South University (CSU)(中南大学) University of Science and Technology of China (UTSC)(中国科学技术大学)

专题命中 多智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出CVE-Factory多智能体框架,自动将稀疏CVE元数据转化为可执行的智能体任务,构建持续更新的基准LiveCVEBench和训练数据集,微调模型性能显著提升。

Comments Accepted by ICML2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31023 2026-06-01 cs.AI cs.LG cs.MA 85%

HADT: A Heterogeneous Multi-Agent Differential Transformer for Autonomous Earth Observation Satellite Cluster

HADT: 一种用于自主对地观测卫星集群的异构多智能体差分Transformer

Mohamad A. Hady, Muhammad Anwar Masum, Siyi Hu, Mahardhika Pratama, Jimmy Cao, Ryszard Kowalczyk

机构 * School of Computer Science and Information Technology, Adelaide University(计算机科学与信息科技学院,阿德莱德大学) School of Electrical Engineering, Computing and Mathematical Sciences (EECMS), Curtin University(电气工程、计算与数学科学学院(EECMS), Curtin大学) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

专题命中 多智能体 :agent(title);multi-agent(title);分类 cs.AI、cs.LG

AI总结 针对异构卫星集群自主对地观测任务,提出基于Transformer的架构,通过关系观测-动作令牌化和差分注意力机制实现自适应实时资源管理,性能显著优于基线。

Comments Accepted in ECML-PKDD 2026. arXiv admin note: text overlap with arXiv:2511.12792

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30539 2026-06-01 cs.MA 85%

A Theory-Guided LLM Pedagogical Agent for STEM+C Scaffolding Without Over-Reliance

理论引导的LLM教学代理:用于STEM+C支架式教学,避免过度依赖

Clayton Cohn, Surya Rayala, Siyuan Guo, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Ryan Li, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Ashwin T S, Meiyi Ma, Gautam Biswas

专题命中 多智能体 :agent(title,abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出基于证据-决策-反馈框架的多智能体协作代理Copa,结合社会认知理论与社会建构主义,通过自适应对话支持促进STEM+C学习,实验证明其能增强学生信心和概念表达能力而不导致依赖。

Comments Submitted to Computers & Education. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31387 2026-06-01 cs.CL cs.RO 84%

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

多轮多智能体对话用于协作重建仅略微提升VLM在空间推理上的性能

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(语言学计算系,语言学系 柏林洪堡大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 多智能体 :agent(title);multi-agent(title);分类 cs.CL

AI总结 研究通过多轮多智能体对话框架评估视觉语言模型在协作空间推理任务中的表现,发现视觉空间理解仍是主要瓶颈,文本表示和分解图像表示可部分提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31593 2026-06-01 cs.CR cs.AI 83%

Stateful Online Monitoring Catches Distributed Agent Attacks

有状态在线监控捕获分布式智能体攻击

Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对分布式智能体攻击中跨账户聚合的恶意行为难以被单上下文监控检测的问题,提出一种基于实时聚类的有状态在线监控方法,能够更早、更有效地捕获分布式攻击,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31264 2026-06-01 cs.AI cs.CL cs.LG 75%

COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation

COLLEAGUE.SKILL: 通过专家知识蒸馏实现自动化AI技能生成

Tianyi Zhou, Dongrui Liu, Leitao Yuan, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一个从异构痕迹到可检查、可修正、可代理使用的技能包的自动化蒸馏系统,用于生成基于人的AI技能。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30391 2026-06-01 cs.MA cs.AI cs.CL 73%

Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate

机器中的社会推理:探究大语言模型辩论中的集体求真动态

Tom Pecher

机构 * Department of Computer Science University of Bath(计算机科学系英国巴斯大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 通过多智能体辩论模拟论证推理理论,证明大语言模型集体辩论能显著提升基于问卷的求真任务性能,并提出利用辩论动态测量模型内在属性的新基准方法。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29511 2026-06-01 cs.MA cs.CL cs.LG 73%

DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

DynaGraph: 通过动态拓扑重构的轻量级多模型交互框架

Yanxing Guo, Zihao Zheng, Fangzhou Wu, Ling Liang, Lin Bao, Zongwei Wang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心) Beijing University of Posts and Telecommunications(北京邮电大学) Yanxin Co. Ltd(燕新有限公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 提出DynaGraph框架,通过动态拓扑重构和PEFT适配器复用,在单消费级GPU上实现多模型协作,接近72B单模型推理能力并大幅降低延迟和token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17826 2026-06-01 cs.LG cs.CL stat.ML 73%

Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch

跨张量并行大小的确定性推理,消除训练-推理不匹配

Ziyang Zhang, Xinheng Ding, Jiayi Yuan, Rixin Liu, Huizi Mao, Jiarong Xing, Zirui Liu

机构 * Independent Researcher(独立研究者) University of Minnesota, Minneapolis, Minnesota, USA(明尼苏达大学) Rice University, Houston, Texas, USA(里士满大学) NVIDIA Corp., Santa Clara, California, USA(NVIDIA公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 针对不同张量并行大小导致浮点运算非结合性引起的推理非确定性问题,提出基于树的核(TBIK)实现跨TP大小的比特级一致结果,消除RL训练中推理与训练引擎间的精度不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 73%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31330 2026-06-01 cs.GT cs.AI cs.MA math.OC nlin.AO 70%

Social welfare optimisation under institutional reward and punishment

制度奖惩下的社会福利优化

Van An Nguyen, Vuong Khang Huynh, Huu Loi Bui, Hai Anh Ha, Quang Dung Le, Tan Dat Nguyen, Ngoc Ngu Nguyen, Zhao Song, Manh Hong Duong, Le Hong Trang, The Anh Han

机构 * Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(胡志明市技术大学计算机科学与工程学院,越南) Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南胡志明市国家大学(VNU-HCM),越南) School of Computing, Engineering and Digital Technologies, Teesside University, United Kingdom(泰赛德大学计算、工程与数字技术学院,英国) School of Mathematics, University of Birmingham, Birmingham, United Kingdom(伯明翰大学数学学院,英国)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究在有限混合群体中,通过奖励合作者或惩罚背叛者来最大化社会福利的激励机制,推导出最优激励的显式表达式和相变条件,并比较奖励与惩罚的福利效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30459 2026-06-01 cs.CL 70%

Can LLM Teams Play What? Where? When?

LLM 团队能玩“什么?哪里?何时?”吗?

Anastasia Kotelnikova, Viktor Byzov, Maria Dolzhenkova, Evgeny Kotelnikov

机构 * Vyatka State University(维yatka国立大学) European University at St. Petersburg(圣彼得堡欧洲大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文研究基于团队的交互策略(投票、静默团队、健谈团队)能否提升大语言模型在“什么?哪里?何时?”问答游戏中的表现,实验表明团队策略优于单模型基线,准确率最高提升20个百分点,最佳团队达到44.23%,接近人类水平。

Comments Accepted for Dialogue-2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15706 2026-06-01 cs.LG 70%

Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models

可微分的混合智能体激励大型语言模型的群体智能

Xingjian Wu, Junkai Lu, Siyu Yan, Xiangfei Qiu, Jilin Hu, Chenjuan Guo, Bin Yang

机构 * East China Normal University(华东师范大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出可微分的混合智能体(DMoA)框架,通过可微分的上下文感知路由机制动态激活智能体,实现推理过程中的弹性协作,并在9个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12386 2026-06-01 cs.MA cs.GT cs.LG 70%

Provably Convergent Actor-Critic for MARL through Risk-aversion

通过风险厌恶实现可证明收敛的MARL演员-评论家算法

Yizhou Zhang, Eric Mazumdar

机构 * caltech(加州理工学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 针对无限时域一般和马尔可夫博弈,提出基于风险厌恶分位数响应均衡(RQE)的单时间尺度演员-评论家算法,利用RQE的正则性证明全局收敛并给出有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 70%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30930 2026-06-01 cs.HC cs.AI cs.CL cs.CY 62%

TUX: Measuring Human--AI Tacit Understanding

TUX:衡量人机默契理解

Yueshen Li, Hanyi Min, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 多智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31594 2026-06-01 cs.LG math.OC 57%

A Tight Theory of Error Feedback Algorithms in Distributed Optimization

分布式优化中误差反馈算法的紧致理论

Daniel Berg Thomsen, Adrien Taylor, Aymeric Dieuleveut

机构 * Inria, D.I. ENS, CNRS, PSL Research University, Paris, France(法国国家信息与自动化研究所、巴黎综合理工学院、法国国家科学研究中心、巴黎高等师范学院、法国巴黎)

专题命中 多智能体 :agent(abstract);分类 cs.LG

AI总结 本文针对分布式优化中的两种主流误差反馈算法(EF和EF21),通过确定最优步长和构造最优Lyapunov函数,给出了紧致的收敛性分析,结果与智能体数量无关且恢复单智能体情形下的已知最优保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30976 2026-06-01 stat.ML cs.IT cs.LG math.IT 57%

Batched Stochastic Linear Bandits with 1-Bit Communication Constraints

具有1比特通信约束的批量随机线性赌博机

Ivan Lau, Daniel McMorrow, Kevin Jamieson, Jonathan Scarlett

机构 * National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学)

专题命中 多智能体 :agent(abstract);分类 cs.LG

AI总结 研究在批量大小B和每批仅1比特反馈的通信约束下,随机线性赌博机的遗憾最小化问题,提出了两种基于G-最优设计和1比特均值估计的相位消除算法,实现了接近无约束线性赌博机的最优遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30522 2026-06-01 physics.soc-ph cs.SI q-bio.NC 50%

Private Noise and Public Error in Collective Information Acquisition

集体信息获取中的私人噪声与公共错误

Mohammad Salahshour, Sumanth Bhargava, Kajal Kumari, Niccolo Pescetelli, Yasser Roudi, Bahador Bahrami, Iain D. Couzin

专题命中 多智能体 :agent(abstract)

AI总结 通过在线实验和模型分析,研究了通信噪声类型(理解噪声与生产噪声)对集体信息获取的影响,发现生产噪声通过产生共同错误信号导致群体更持久地收敛于错误值。

Comments 48 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26430 2026-06-01 cs.RO 50%

Multi-Robot Box Transport over Different Surfaces with Decentralized Role-based Proportional Control

多机器人在不同表面上的基于去中心化角色比例控制的箱子运输

Aditya Bhatt, Himavarshini Yarragangu, Urvish Shah, Venkata Sai Yaswanth Mohan Thota, Souma Chowdhury

机构 * Mechanical & Aerospace Eng., University at Buffalo, Buffalo, NY(机械与航空航天工程系,布法罗大学,布法罗,纽约)

专题命中 多智能体 :planning(abstract)

AI总结 提出一种异步去中心化任务与运动规划方法R2P2,通过角色分配和比例控制实现多机器人在不同倾斜和摩擦表面上的协作箱子运输,在仿真和物理实验中验证了其泛化性和成功率优于标准虚拟领导者-跟随者方法。

Comments Accepted for presentation at the 2026 ASME IDETC-CIE

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 14 篇

2603.08721 2026-06-01 cs.AR cs.LG cs.SE 86%

KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware

KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试

Jiayi Nie, Haoran Wu, Yao Lai, Zeyu Cao, Cheng Zhang, Binglei Lou, Erwei Wang, Jianyi Cheng, Timothy M. Jones, Robert Mullins, Rika Antonova, Yiren Zhao

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 工作流自动化 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.LG、cs.SE

AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30667 2026-06-01 cs.CR cs.AI 79%

Automatically Attacking Software Reverse Engineering AI Agents

自动攻击软件逆向工程AI代理

Brian Crawford, Justin Phillips, Patrick McClure

机构 * Naval Postgraduate School(海军学院)

专题命中 工作流自动化 :AI agent(title);agentic(abstract);分类 cs.AI

AI总结 提出基于遗传算法的对抗性提示生成技术(AutoDAN变体),通过注入无关字符串变量欺骗LLM驱动的反汇编与反编译系统,导致其错误分析二进制可执行文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30400 2026-06-01 cs.CL 79%

Protocol for evaluating ChatGPT in biomedical association generation and verification using a RAG-enabled, cross-model majority voting workflow

使用RAG支持的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

Ahmed Abdeen Hamed, Luis M. Rocha

专题命中 工作流自动化 :workflow(title,abstract);分类 cs.CL

AI总结 提出一个协议,通过RAG和跨模型多数投票工作流评估ChatGPT生成疾病中心生物医学关联的能力,并验证其可靠性。

Comments Main Manuscript and Supplementary Information. Both are equally important

Journal ref STAR Protocols, 2026; 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31066 2026-06-01 cs.RO 67%

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

空中VLA模型能协作吗?基于CARLA-Air的闭环空地协调评估

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 工作流自动化 :agent(abstract);planning(abstract)

AI总结 本文通过构建CARLA-Air仿真环境,评估空中视觉-语言-动作模型在空地协作任务中的表现,发现当前模型难以将单智能体能力转化为稳定协作行为,并指出零样本协作需要伙伴状态显式感知、低延迟动作协调和团队目标对齐三个关键组件。

Comments Code at https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG 62%

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏