arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-26 至 2026-06-26 共收录 158 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 11 篇

2606.26511 2026-06-26 cs.CL cs.AI cs.ET cs.LG 新提交 82%

Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge

检索记忆中的时间有效性:消除AI智能体在知识演化中的过时事实错误

Neeraj Yadav

机构 * MemStrata.dev — Called It Inc. (Enterprise)(MemStrata.dev — Called It Inc.(企业))

专题命中 记忆与上下文管理 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对RAG无法处理知识演化导致过时事实错误的问题,提出MemStrata,通过确定性替换规则维护时间有效性,在演化知识上准确率达0.95-1.00,过时事实错误率降至~0%。

Comments 21 pages, 5 tables. Code, prompts, and evaluation datasets included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26793 2026-06-26 cs.CR cs.AI cs.LG 新提交 81%

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG

Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) Fujitsu Limited, Japan(日本富士通有限公司)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。

Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21649 2026-06-26 cs.CL 新提交 79%

EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory

EvoEmbedding: 面向长上下文检索与智能体记忆的可演化表示

Chang Nie, Chaoyou Fu, Junlan Feng, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL

AI总结 提出EvoEmbedding模型,通过持续更新的潜在记忆生成可演化嵌入,实现基于动态上下文的检索,在长上下文基准上超越更大规模模型,并泛化到下游任务。

Comments Project Page: https://clare-nie.github.io/EvoEmbedding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26573 2026-06-26 cs.CY cs.HC 新提交 78%

Pingquanqi (Equalizer): A Cross-Domain Sociotechnical Framework for Human-Agent Interaction Governance

Pingquanqi(均衡器):人机交互治理的跨领域社会技术框架

Yu Wang

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 提出Pingquanqi框架,通过用户状态区分、贝叶斯止损、可控摩擦和透明度度量等组件,优化LLM代理交互成本,保护用户时间资源,兼顾企业经济效益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27032 2026-06-26 cs.LG cs.AI 新提交 62%

State Representation Matters in Deep Reinforcement Learning: Application to Energy Trading

状态表示在深度强化学习中至关重要:应用于能源交易

Jesper Klicks, Sander Vržina, Vincent François-Lavet

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究深度强化学习中状态表示对抽水蓄能交易策略的影响,发现结合绝对价格、相对价格和预测特征能显著提升跨市场迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15877 2026-06-26 cs.AI cs.CL cs.MA 版本更新 62%

Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents

经验压缩光谱:在LLM代理中统一记忆、技能和规则

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM代理长期多会话部署中经验管理效率问题,提出经验压缩光谱框架,统一记忆、技能和规则的压缩轴,解决压缩适应性和跨层级压缩缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02652 2026-06-26 cs.SD cs.AI cs.MM 版本更新 57%

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

Pianist Transformer:通过可扩展的自监督预训练实现富有表现力的钢琴演奏渲染

Hong-Jie You, Jie-Jing Shao, Xiao-Wen Yang, Lin-Han Jia, Lan-Zhe Guo, Yu-Feng Li

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI

AI总结 提出Pianist Transformer,通过统一MIDI表示进行大规模自监督预训练,结合非对称Transformer和音符级压缩,实现高效且富有表现力的钢琴演奏生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26503 2026-06-26 cs.FL cs.CC 新提交 50%

Order-2 bygone-state opacity of labeled finite-state automata

标记有限状态自动机的二阶过往状态不透明性

Kuize Zhang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出二阶过往状态不透明性概念,描述一个代理无法确定另一代理能否根据当前及过去观测唯一确定自动机状态,并通过并发组合和经典观察器在双指数时间内验证该性质。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02465 2026-06-26 econ.TH 50%

(Robust) Information Acquisition Design

(鲁棒) 信息获取设计

Eric Gao, Daniel Luo

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究信息获取博弈的设计,分析可实施分配的激励属性,并证明鲁棒性等价于机制的实验中性。通过一般物品分配和学校选择应用,展示鲁棒分配的广泛适用性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 29 篇

2603.09448 2026-06-26 cs.CV cs.AI 版本更新 89%

A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation

一种遵循指南的AI智能体用于零样本靶区自动勾画

Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Jae Myung Noh, Kyungmi Yang, Dongryul Oh, Jin Sung Kim

机构 * Oncosoft Inc.(Oncosoft公司) Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine(放射肿瘤科,三星医疗中心,成均馆大学医学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出OncoAgent框架,将文本临床指南转化为三维靶区轮廓,无需训练即可实现零样本勾画,在食管癌病例中达到与监督方法相当的Dice系数,且医生更偏好其指南依从性和临床可接受性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26524 2026-06-26 cs.CR 新提交 88%

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

VIGIL:AI代理技能中行为规范的运行时执行

Ying Li, Yanju Chen, Hongbo Wen, Bosi Zhang, Hanzhi Liu, Peiran Wang, Yu Feng, Yuan Tian

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract)

AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26327 2026-06-26 cs.LG cs.AI 新提交 84%

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

EVOM:用于强化学习的演员-评论家架构的智能体元进化

Boyun Zhang, Chao Wang, Kai Wu

机构 * Xidian University(西安电子科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26552 2026-06-26 cs.CV cs.AI 新提交 83%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 79%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14397 2026-06-26 cs.LG 新提交 77%

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

Running the Gauntlet: 重新评估智能体在陌生环境中的能力

Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi

机构 * University of Oxford(牛津大学) SoftServe Massachusetts Institute of Technology(麻省理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) UK AI Security Institute(英国人工智能安全研究所) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 提出GauntletBench基准,通过20个视觉密集型任务评估智能体在时间感知、图形理解和3D推理等未被充分探索的能力,发现最先进智能体成功率仅19.1%,远低于人类80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26294 2026-06-26 cs.LG cs.AI cs.MA cs.NE 新提交 76%

The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

红皇后哥德尔机:共同进化的智能体及其评估者

Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);分类 cs.AI、cs.LG;multi-agent(comments)

AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。

Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17554 2026-06-26 cs.AI cs.LG 版本更新 73%

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准

Tanmay Asthana, Aman Saksena, Divyansh Sahu

机构 * Deccan AI Research(德克南人工智能研究所)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。

Comments Updating the paper with more data. Will resubmit

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06078 2026-06-26 cs.CY cs.AI cs.CL 73%

Simulating Students with Large Language Models: A Review of Architecture, Mechanisms, and Role Modelling in Education with Generative AI

用大型语言模型模拟学生:生成式AI在教育中的架构、机制与角色建模综述

Luis Marquez-Carpintero, Alberto Lopez-Sellers, Miguel Cazorla

机构 * Institute for Computer Research University of Alicante(计算机研究所阿利坎特大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了利用大型语言模型模拟学生行为在教育中的应用,探讨了其在学习者建模、教学评估和教师培训中的潜力与挑战。

Journal ref Computer Science Review 62 (2026) 101008

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23293 2026-06-26 physics.soc-ph 版本更新 67%

Partial exploiters sustain cooperation: the hump-shaped strategy stably coexists with unconditional cooperators

部分利用者维持合作:驼峰策略稳定共存于无条件合作者

Kai Otsubo, Yuta Kido, Ryutaro Mori

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 研究揭示驼峰策略在中间规模群体中适应性强,能与无条件合作者共同维持大规模合作,通过稳定均衡排除自由搭车者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 62%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26406 2026-06-26 cs.LG cs.AI math-ph math.MP 新提交 62%

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统

A. S. Ushakov, Yu. N. Berdinsk

机构 * Saint Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 57%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 57%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 57%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26158 2026-06-26 cs.AI 新提交 57%

Life After Benchmark Saturation: A Case Study of CORE-Bench

基准测试饱和之后:CORE-Bench 案例研究

Nitya Nadgir, Sayash Kapoor, Kangheng Liu, Peter Kirgis, Matilda Orona, Stephan Rabanser, Tilman Bayer, Abhishek Shetty, Yue Ling, Derrick Chan-Sew, Rumi Nakagawa, Saiteja Utpala, Zachary S. Siegel, Arvind Narayanan

机构 * Independent(独立机构) Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对基准测试准确率饱和问题,提出从构造效度、泛化性、效率、可靠性、模型与脚手架相对重要性及人机协作提升六个维度评估智能体,以CORE-Bench Hard为案例展示饱和后仍可获得有意义见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 57%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07980 2026-06-26 cs.LG 57%

Realistic Urban Traffic Generator using Decentralized Federated Learning for the SUMO simulator

基于SUMO模拟器的去中心化联邦学习的城市交通生成器

Alberto Bazán-Guillén, Carlos Beis-Penedo, Diego Cajaraville-Aboy, Pablo Barbecho-Bautista, Rebeca P. Díaz-Redondo, Luis J. de la Cruz Llopis, Ana Fernández-Vilas, Mónica Aguilar Igartua, Manuel Fernández-Veiga

机构 * Networking Engineering Department, Universitat Politècnica de Catalunya (UPC)(西班牙巴塞罗那理工大学网络工程系) atlanTTic Research Center (I&C Lab), University of Vigo(西班牙奥维多大学atlanTTic研究中心) Department of Electrical, Electronic and Telecommunications Engineering, University of Cuenca(厄瓜多尔库恩卡大学电气、电子与电信工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出DesRUTGe框架,结合深度强化学习与SUMO模拟器生成真实交通模式,通过去中心化联邦学习提升准确性和隐私保护。

Comments 21 pages, 7 figures

Journal ref IEEE Open Journal of the Communications Society, Volume 6 (2025) 6627 - 6649

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 50%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 Agent评测 :planning(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏