2607.00685 2026-07-02 cs.MA 新提交 80% M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化 Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu 专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract) AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.00461 2026-07-02 cs.CV 新提交 78% Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning 非对称互变分学习实现多模态连续推理 Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu 机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团) 纠错 专题命中 测试时计算 :reasoning(title,abstract) AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.00060 2026-07-02 cs.CV 新提交 78% Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence 协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础 Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng 机构 * Huazhong University of Science and Technology(华中科技大学) ; Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Anhui University(安徽大学) 纠错 专题命中 测试时计算 :reasoning(title,abstract) AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。 Comments Accepted by MICCAI 2026 (Early Accept, Top 9%) 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.00502 2026-07-02 cs.CL 新提交 70% A Task-State Representation for Long-Horizon Mobile GUI Agents 面向长时程移动GUI代理的任务状态表示 Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen 机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; School of Software, Beihang University(北京航空航天大学软件学院) 纠错 专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。 Comments Preprint. 9 pages, 3 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.00013 2026-07-02 cs.IR cs.AI 新提交 57% GRACE-RAG: Governed Retrieval Architecture for Canonical Evidence Synthesis, Enabling Lightweight Deployment in Closed-Domain Institutional Settings GRACE-RAG:用于规范证据合成的受控检索架构,实现封闭领域机构环境中的轻量级部署 Asit Desai, Aman Kumar, Prashant Devadiga 专题命中 测试时计算 :reasoning(abstract);分类 cs.AI AI总结 提出GRACE-RAG架构,通过图增强检索将结构推理外化到检索层,在轻量级模型上实现高质量问答,中规模模型质量提升达20%。 Comments 15 pages, 5 figures, 4 tables. Submitted to COLM 2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2511.07397 2026-07-02 cs.CL 版本更新 57% Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents 边说话边思考:面向响应式与智能对话语音代理的推理时知识迁移 Vidya Srinivas, Zachary Englhardt, Vikram Iyer, Shwetak Patel 机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院) 纠错 专题命中 测试时计算 :reasoning(abstract);分类 cs.CL AI总结 提出对话填充方法,通过小型说话者模型即时生成上下文响应以隐藏推理模型延迟,并在推理中无缝整合流式知识,在保持毫秒级响应速度的同时将准确度差距缩小至前沿推理模型的6.3%以内。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图