arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04140 2026-07-02 cs.AI cs.CL 版本更新 62%

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

选择性专家引导实现强化学习中有效且多样的探索

Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MENTOR框架,仅在关键决策点提供专家引导,平衡探索的有效性与多样性,提升LLM在可验证奖励强化学习中的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00454 2026-07-02 cs.AI cs.MA 新提交 57%

Agri-SAGE: Simulation-Grounded Multi-Agent LLM for Context-Aware Agricultural Advisory Generation

Agri-SAGE:基于模拟的多智能体LLM用于上下文感知的农业咨询生成

Vedant Balasubramaniam, Geetha Charan, Manojkumar Patil, Rohit P Suresh, V Priyanka, Kodur Sai Vinay Sathvik, Y. Narahari

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) BNM Institute of Technology, Bengaluru(BNM理工学院,班加罗尔)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Agri-SAGE框架,结合检索增强的多智能体LLM推理与APSIM生物物理模拟,生成并验证农艺建议;通过十年回顾分析,三种推理方法均优于静态基线,其中思维树实现最高产量,反思法以较低计算成本达到相当效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00339 2026-07-02 cs.CL 新提交 57%

TRACE: State-Aware Query Processing over Temporal Evidence Graphs for Conversational Data

TRACE:面向对话数据的时间证据图状态感知查询处理

Maolin Wang, Yu Wang, Zichun Liu, Baiyuan Qiu, Chenbin Zhang, Jiguang Shen, Haoran Yang, Hao Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学香港人工智能科学研究院) Independent Researcher(独立研究者) Central South University(中南大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出TRACE框架,通过构建时间证据图并维护有效性标注,实现对话数据中状态感知的查询处理,提升时间推理和多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27669 2026-07-02 cs.CL 新提交 57%

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

搜索代理何时应提问:面向澄清感知的深度搜索的DiscoBench基准

Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu

机构 * Hunyuan, Tencent(腾讯混元) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出DiscoBench基准,评估大语言模型搜索代理在深度搜索中主动识别歧义、提出有效澄清问题并恢复正确推理路径的能力,实验表明歧义检测与有效澄清是不同能力,且盲目搜索不如直接猜测。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18372 2026-07-02 cs.HC cs.AI cs.CY cs.ET 57%

The Hidden Cost of Contextual Sycophancy: an AI Literacy Intervention in Human-AI Collaboration

上下文谄媚的隐性成本:人类-人工智能协作中的AI素养干预

Cansu Koyuturk, Sabrina Guidotti, Dimitri Ognibene

机构 * Università degli Studi di Milano-Bicocca(米兰-比科卡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了在人类-人工智能协作中上下文谄媚现象的成因,并通过干预提升AI素养和提示能力以减轻其影响,发现AI反馈质量受用户错误传播影响显著,提示需系统层面改进以促进批判性参与。

Comments SPRINGER AIED 2026: Accepted for LBR, poster presentation at the 27th International Conference on Artificial Intelligence in Education, 27 Jun - 3 Jul 2026, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17406 2026-07-02 cs.AI 版本更新 57%

EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale

EvoMaster:一种用于大规模代理科学的基础进化代理框架

Xinyu Zhu, Yuzhu Cai, Zexi Liu, Cheng Wang, Fengyang Li, Wenkai Jin, Wanxu Liu, Zehao Bing, Bingyang Zheng, Jingyi Chai, Shuo Tang, Rui Ye, Yuwen Du, Xianghe Pang, Yaxin Du, Tingjia Miao, Yuzhi Zhang, Ruoxue Liao, Zhaohan Ding, Linfeng Zhang, Yanfeng Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) SciLand DP Technology(DP技术)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 EvoMaster通过持续自我进化机制,使代理能迭代优化假设并积累知识,实现跨学科的高效科学发现,其易用性与性能在多个基准测试中均表现优异。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 50%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00440 2026-07-02 cs.CR 新提交 50%

Minos: A Multi-Agent Collaborative Framework for Provenance-Based Backward Tracking

Minos:一种基于溯源的反向追踪多智能体协作框架

Jiahui Wang, Zhenyuan Li, Zhengkai Wang, Xiangmin Shen, Fan Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 提出多智能体框架Minos,利用LLM驱动推理进行基于溯源的反向追踪,通过分层上下文管理、检索增强推理和有限状态机协调四个智能体,有效缓解依赖爆炸,在5个数据集上平均召回率0.92、精确率0.64,攻击子图压缩49%。

Comments 20 pages,7 figures, accepted by ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00420 2026-07-02 cs.HC 新提交 50%

A Simple Solution to Improving Human Supervision of Algorithms: Evidence from Smart Vending

改善人类对算法监督的简单解决方案:来自智能售货机的证据

Minda Zhao, Brian Rongqing Han, Xin Chen, Tao Zhu

专题命中 规划推理 :planning(abstract)

AI总结 通过限制人工干预次数,让工人优先选择高价值干预,在减少库存的同时不损害销售,为人类监督AI提供低成本可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00604 2026-07-02 math.OC 新提交 50%

Vehicle Routing Problem Meets Large Language Models: An Overview and Perspectives

车辆路径问题遇上大语言模型:综述与展望

Xianchao Xiu, Chong Shen, Yanjiao Zhu, Wanquan Liu

专题命中 规划推理 :reasoning(abstract)

AI总结 综述大语言模型在车辆路径问题中的应用,涵盖模型构建、算法设计、协调工具等角色,并讨论基准测试与实验。

Comments working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30524 2026-07-02 cs.SE 版本更新 50%

The Illusion of Agentic Complexity in README.md Generation: Evaluating Single-Agent vs. Multi-Agent RAG Systems

README.md生成中的代理复杂性幻觉:评估单代理与多代理RAG系统

Abu Saleh, Tesfay Welegebreal Tesfay, Phuong T. Nguyen, Juri Di Rocco, Muhammad Umar Zeshan, Davide Di Ruscio

专题命中 规划推理 :planning(abstract)

AI总结 通过对比单代理、多代理和开发者引导规划三种RAG架构生成GitHub仓库README文件,发现单代理管道在词汇质量相当的情况下,令牌消耗降低86%、速度提升一倍,而多代理系统结构一致性达98%但存在规划瓶颈,开发者引导规划获得最佳文档质量。

Comments The paper has been peer-reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31483 2026-07-02 cs.RO 新提交 50%

A Large-Language-Model Supported Personalized Driving Framework for Lane Change in Highway Scenarios

大语言模型支持的高速公路换道场景个性化驾驶框架

Dong Bi, Yongqi Zhao, Paul Kovacevic, Tomislav Mihalj, Ji Zhou, Jiayuan Gong, Arno Eichberger

机构 * Hubei University of Automotive Technology(湖北汽车工业学院) Graz University of Technology(格拉茨技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出一种LLM支持的个性化驾驶框架,通过映射自然语言指令到Apollo规划参数,结合聚类和风格强度排序生成可区分的换道行为,并利用检索增强生成解释隐式指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02114 2026-07-02 physics.soc-ph 版本更新 50%

AI-Driven Stabilization in Power Grids through Controlling Line Admittances

通过控制线路导纳实现电网的AI驱动稳定

Sangjoon Park, Hoyun Choi, Yongsun Lee, Seungchan Jo, Jürgen Kurths, B. Kahng

专题命中 规划推理 :planning(abstract)

AI总结 提出自适应导纳控制器(AAC)算法,通过实时调整导纳调节器位置稳定电网,在真实英国电网上显著降低频率偏差并快速恢复运行,同时降低系统复杂性和成本。

Comments 13 pages, 10 figures

Journal ref Chaos, Solitons & Fractals 210, Part 2, 118672 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 11 篇

2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交 81%

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交 79%

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 79%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01191 2026-07-02 cs.CV 新提交 78%

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

感知到推理:解耦感知与推理用于细粒度视觉推理

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。

Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00881 2026-07-02 cs.CV 新提交 78%

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

OmniView-Space: 通过多视角空间映射增强空间推理

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Tencent Youtu Lab(腾讯优图实验室) Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出OmniView-Space框架,通过多视角空间映射、工具引导的自我中心推理和认知图蒸馏,解决多模态大模型在多步空间推理中的参考框架动态重锚问题,在单/多图像基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01654 2026-07-02 cs.CV cs.AI cs.MM 版本更新 57%

Moiré Video Authentication: A Physical Signature Against AI Video Generation

摩尔视频认证:一种对抗AI视频生成的物理签名

Yuan Qing, Kunyu Zheng, Lingxiao Li, Boqing Gong, Chang Xiao

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01079 2026-07-02 cs.RO 新提交 50%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00255 2026-07-02 cs.IT math.IT 新提交 50%

SLM, LLM or Agentic AI? Toward Intelligent UAV-Enabled WPT Systems in Low-Altitude Economy Networks

SLM、LLM 还是 Agentic AI?面向低空经济网络中智能无人机赋能WPT系统

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Xianbin Wang, Abbas Jamalipour

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究在资源受限动态环境下,利用小语言模型(SLM)和基于大语言模型(LLM)的Agentic AI框架优化无人机无线充电(WPT)路径与能量,实现低复杂度、低延迟和高能效。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 50%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 50%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19326 2026-07-02 cs.CV 版本更新 50%

MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation

MonoMSK: 单目3D肌肉骨骼动力学估计

Farnoosh Koleini, Hongfei Xue, Ahmed Helmy, Pu Wang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MonoMSK混合框架,结合数据驱动与物理仿真,从单目视频估计生物力学真实的3D人体运动(运动学与动力学),通过ODE仿真和逆动力学实现高精度运动与力估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2607.00685 2026-07-02 cs.MA 新提交 80%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00461 2026-07-02 cs.CV 新提交 78%

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

非对称互变分学习实现多模态连续推理

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交 78%

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00502 2026-07-02 cs.CL 新提交 70%

A Task-State Representation for Long-Horizon Mobile GUI Agents

面向长时程移动GUI代理的任务状态表示

Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。

Comments Preprint. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00013 2026-07-02 cs.IR cs.AI 新提交 57%

GRACE-RAG: Governed Retrieval Architecture for Canonical Evidence Synthesis, Enabling Lightweight Deployment in Closed-Domain Institutional Settings

GRACE-RAG:用于规范证据合成的受控检索架构,实现封闭领域机构环境中的轻量级部署

Asit Desai, Aman Kumar, Prashant Devadiga

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出GRACE-RAG架构,通过图增强检索将结构推理外化到检索层,在轻量级模型上实现高质量问答,中规模模型质量提升达20%。

Comments 15 pages, 5 figures, 4 tables. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏