arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-29 至 2026-07-29 共收录 117 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2607.24748 2026-07-29 cs.IR cs.AI cs.CL 新提交 86%

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成

Seonok Kim

专题命中 工具调用 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25816 2026-07-29 cs.AI 新提交 85%

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

推理时进行推测:通过联合智能体-推测器强化学习教智能体预测其下一个工具调用

Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Linkedin Inc(领英公司)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对大型语言模型智能体等待工具调用结果时间长的问题,提出联合智能体-推测器强化学习方法,统一智能体和推测器为自推测智能体,复用缓存,提升了Qwen不同模型下一个工具调用的Hit@1指标及任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25883 2026-07-29 cs.MA 新提交 82%

Towards a Systems Foundation for Agentic Cloud Management

迈向智能云管理的系统基础

Minghao Li, Ziqian Liu, Ziyu Mao, Daqian Ding, Yu Kang, Qingwei Lin, Tianyin Xu, Yiming Qiu

专题命中 工具调用 :agentic(title,abstract);agent(abstract)

AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25565 2026-07-29 cs.CV 新提交 82%

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

ReDesign:通过智能分解从图像中恢复可编辑设计结构

Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Helmholtz Munich(慕尼黑亥姆霍兹中心) Korea University(韩国大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract)

AI总结 研究旨在从图像恢复可编辑设计文件,提出ReDesign智能框架,通过跨模态选工具生成层层次结构,引入优雅验证与评估基准,在视觉保真度和编辑性上表现出色,超越基线和管道。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25297 2026-07-29 cs.CR cs.AI 新提交 79%

Hybrid Analysis for Secure MCP Tool Use in LLM Agents

用于大语言模型智能体中安全MCP工具使用的混合分析

Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 研究LLM智能体中MCP工具使用的安全问题,提出基于混合分析的MTGuard框架,利用生命周期感知的静态 - 动态协同分析,有效减轻有害工具使用,保持良性任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25415 2026-07-29 cs.AI 新提交 77%

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法

Debjyoti Paul

机构 * Meta AI

专题命中 工具调用 :tool-use(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。

Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25208 2026-07-29 gr-qc astro-ph.HE astro-ph.IM 新提交 71%

GSpyNetTree-O4: an event validation tool used in the fourth LIGO-Virgo-KAGRA observing run

GSpyNetTree - O4:第四次LIGO - Virgo - KAGRA观测运行中使用的事件验证工具

Sofia Alvarez-Lopez, Man Leong Chan, Franz S. Herbst, Dhatri Raghunathan, Airene Ahuja, Annudesh Liyanage, Julian Ding, Alejandro Garcia-Varela, Raymond Ng, Jess McIver

专题命中 工具调用 :tool use(title)

AI总结 研究针对引力波探测器数据中的毛刺问题,在第四次LIGO - Virgo - KAGRA观测运行中部署GSpyNetTree - O4工具。通过新架构、扩充训练集及校准校正等方法,该工具在毛刺识别和无毛刺样本判断上表现良好,提高了引力波事件验证工作流程的自动化。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25590 2026-07-29 cs.CL 新提交 57%

PILA: Plug-and-Play Insertion for LLM-native Advertising

PILA:用于大语言模型原生广告的即插即用插入法

Zhaowei Zhang, Yuhan Fu, Yihang Zhang, Xiaohan Liu, Ceyao Zhang, Xiaoyuan Zhang, Yipeng Kang, Tonghan Wang, Yaodong Yang

专题命中 工具调用 :workflow(abstract);分类 cs.CL

AI总结 研究如何通过自然整合赞助内容实现大语言模型盈利的问题,提出PILA方法,将广告插入重构成条件响应重写问题并解耦为轻量级边车模块,实验证明该方法能在保持回复质量的同时提高广告效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25554 2026-07-29 cs.AI 新提交 57%

Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis

提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型

Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan LongCat Team(美团龙猫团队)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25342 2026-07-29 astro-ph.EP astro-ph.IM 新提交 50%

GRaTer-JAX: An Accelerated Package for Debris Disk Modeling

GRaTer-JAX:用于碎屑盘建模的加速软件包

Mihir Kondapalli, Briley L. Lewis, Jaren N. Ashcraft, Maxwell A. Millar-Blanchaer

专题命中 工具调用 :workflow(abstract)

AI总结 GRaTer-JAX是用于碎屑盘建模的Python软件包,结合GRaTer框架与JAX的高性能计算能力,提供强大高效的建模框架,能统一正向建模等工作流程,还能进行更高级建模,推动相关研究发展。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 36 篇

2607.24768 2026-07-29 cs.AI cs.CL cs.CY cs.ET 新提交 86%

PATHFinder Agent for Tailored Prenatal Care

用于定制产前护理的PATHFinder智能体

Vaibhav Balloli, Carissa Samuel, Samia Abdelnabi, Alex Peahl, Elizabeth Bondi-Kelly

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对产前护理,提出PATHFinder智能体这一端到端对话系统,通过结构化对话收集信息并制定个性化计划,展示社区资源。经评估前沿大语言模型,GPT-5.2平均分最高,还发现检测建议差距,将开展人体研究和随机对照试验验证。

Comments Accepted as demo at ACM Interactive Health 2026. https://realize-lab.github.io/PATHFinder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25145 2026-07-29 quant-ph cs.AI 新提交 85%

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

用于自主量子传感实验中科学推理的智能体人工智能

Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro

专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。

Comments 11 pages, 4 figures + Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25388 2026-07-29 cs.RO 新提交 85%

SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

SGTP:基于采样的博弈论实时多车辆自主赛车规划

Zhouheng Li, Fangguo Zhao, Mattia Piccinini, Baha Zarrouki, Yuan Gao, Zitong Shan, Johannes Betz, Chen Lv, Lei Xie

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Technical University of Munich(慕尼黑工业大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 针对自主多车辆赛车中平衡战略多样性与计算效率的难题,提出基于采样的博弈论规划(SGTP)框架,结合博弈论推理与GPU加速采样,经可行性选择确保安全过渡,模拟显示其在多智能体场景表现良好,还开源代码及基准促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25090 2026-07-29 cs.AI cs.LG 新提交 84%

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering

套娃智能体:展开子智能体以进行长期机器学习工程

Rushi Qiang, Changhao Li, Haotian Sun, Yuchen Zhuang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对机器学习工程长期决策难题,提出套娃智能体框架,将问题解决分解为协调层次结构,高级协调器发指令,低级子智能体执行,开发有效训练范式,实验证明该方法有效且可扩展,能提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24770 2026-07-29 cs.AI cs.HC 新提交 83%

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架

Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25405 2026-07-29 cs.HC 新提交 82%

Agentic AI Autonomy Assessment: A Decision-Support Framework Towards Governed Supply Chain Systems

智能体人工智能自主性评估:面向受治理供应链系统的决策支持框架

Lennart Trumpler, Rodrigo Furlan de Assis, Elias Ribeiro da Silva, Luis Antonio de Santa-Eulalia, Christian Hendriksen

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 本文针对智能体人工智能在供应链决策中应用但治理不足的问题,提出AAAA框架,基于用户委托等三维度衡量任务自主性,经模拟游戏测试结构效度,揭示自主性与层级成本关系,为供应链智能体风险评估等提供基础。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 81%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25066 2026-07-29 cs.AI cs.CL 新提交 81%

Addressable Recall Compaction for Long Context-Window Control in AI Agents

用于人工智能代理中长上下文窗口控制的可寻址召回压缩

Thang Dang, Yuma Ichikawa, Sakina Fatima, Koichi Shirahata

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对长时程语言模型代理上下文窗口超界问题,提出ARC框架,将存档与活动上下文分离,以ID可寻址日志存储工具观察结果,压缩时替换旧观察结果。实验表明该方法能提高信息保留和服务效率。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25369 2026-07-29 cs.AI 新提交 79%

ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning

ODYSSE:用于个性化智能体推理的逐情节策略优化

Jiaqi Zhang, Tong Chen, Junliang Yu, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 研究个性化智能体推理问题,提出基于强化微调框架ODYSSE,核心方法是逐情节GRPO,通过情节级奖励机制等解决长动作跨度等问题,经实验验证其在个性化GUI推理任务中优于其他模型,有效提升个性化智能体推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25236 2026-07-29 cs.CL cs.RO 新提交 79%

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

视觉补丁世界:作为规划潜在结构化表示的代码世界模型

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25881 2026-07-29 cs.CL astro-ph.CO astro-ph.IM cs.HC gr-qc 新提交 79%

AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology II: Project Planning and Proposal Evaluation

人工智能在协助物理、天体物理和宇宙学科学研究中的能力II:项目规划与提案评估

Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 研究大语言模型在科学项目规划与提案评估中的作用,人类和三个当代模型生成计划,再由人类与前沿模型盲评,结果显示当前模型能产出类似人工的计划,但人工智能评审员更青睐人工智能生成的提案,部署时需谨慎。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25482 2026-07-29 eess.SY cs.SY 新提交 78%

Integrated Framework for Long-term Elective Surgery Management under Uncertainty: From Strategic to Tactical Planning

不确定性下长期择期手术管理的集成框架:从战略规划到战术规划

Joao P. F. da Silva, Lucas Bortoletto, Rafael C. S. Schouery, Edilson F. Arruda, Fabricio F. Santos, Ana Paula C. I. Alves

专题命中 规划决策 :planning(title,abstract)

AI总结 针对公共医疗系统中择期手术等候名单管理难题,提出集成框架,通过闭环控制策略、考虑加班取消风险模型及混合整数线性规划公式,将战略与战术决策相联,经案例研究验证可稳定名单、控风险并支持透明分配决策,计算高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25397 2026-07-29 cs.RO 新提交 78%

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations

分解与重组:利用从示范中学到的原语和视觉运动策略进行规划

Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) JD.com (JingDong)(京东) Nanyang Technological University (NTU)(南洋理工大学) Southern University of Science and Technology (SUSTech)(南方科技大学) Huawei Technologies(华为技术有限公司) The Chinese University of Hong Kong (CUHK)(香港中文大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究如何使机器人灵巧、长视野操作自动化,提出DR-LfD框架,将视觉运动策略集成到TAMP决策系统,基于接触关系分解示范为原子技能,经实验验证该框架在多类任务中性能强大。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25235 2026-07-29 eess.SY cs.SY 新提交 78%

Progressive Replacement Sequence Planning for Laser-Enhanced BeiDou Navigation Constellations

激光增强北斗导航星座的渐进式替换序列规划

Huan Yan, Juan A. Fraire, Ziqi Yang, Kanglian Zhao, Wenfeng Li, Jinjun Zheng, Ziyu Wang, Changgang Zheng

专题命中 规划决策 :planning(title,abstract)

AI总结 研究北斗卫星系统早期卫星接近寿命末期,用激光卫星替换微波卫星的序列规划问题,通过建立整数线性规划模型和优先级感知搜索启发式算法,实现更优混合网络演变,为北斗替换规划提供决策支持和工程指导。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25056 2026-07-29 cs.RO 新提交 78%

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning

用于实时 AUV 路径规划的混合人工势场与时空变压器

Khadija Rais, Abdelmadjid Benmachiche, Imene Soualmia

机构 * Echahid Cheikh Larbi Tebessi University(艾哈西德·谢赫·拉尔比·泰贝西大学) Chadli Bendjedid University(查德利·本杰迪德大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究 AUV 在复杂水下环境的路径规划,比较 13 种算法,提出混合人工势场与时空变压器的方法。该方法性能平衡,平均路径短、碰撞率低、计算高效,优于其他算法,为实时 AUV 导航提供强大解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24779 2026-07-29 cs.AI cs.LG 新提交 73%

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:用于自适应在线广告的分层策略性投标代理

Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。

Comments 10pages,accepted by KDD 2026 ads track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25447 2026-07-29 cs.MA 新提交 71%

CoRenew: A large language model agent-based policy simulation platform for multifamily residential redevelopment

CoRenew:一个基于大语言模型智能体的多户住宅重建政策模拟平台

Yudi Zhang, Yuming Lin, Li Tian, Yu Wang, Jianghao Yu

专题命中 规划决策 :agent(title)

AI总结 多户住宅重建政策设计面临集体行动难题,CoRenew平台基于大语言模型智能体,整合地理人口数据,能模拟多利益相关者谈判,评估政策组合效果,支持多种输入与可视化导出,经案例验证,可用于不同背景政策评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25138 2026-07-29 cs.RO math.OC 新提交 71%

Reactive 3D Motion Planning for a Franka Arm via Star-World Workspace Reshaping

通过星型世界工作空间重塑实现 Franka 手臂的反应式 3D 运动规划

Gia Dcosta, Saayuj Deshpande, Samhitha Vedire

专题命中 规划决策 :planning(title)

AI总结 研究通过星型世界工作空间重塑实现 Franka 手臂的反应式 3D 运动规划,核心方法是聚类并替换相交膨胀障碍物、用零空间人工势场项避障,对比重塑与未重塑表示,结果显示有前景但也有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 70%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 67%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 规划决策 :tool-use(abstract);planning(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏