GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning
GLaQ:基于视觉证据的潜在查询定位用于多模态推理
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
GLaQ:基于视觉证据的潜在查询定位用于多模态推理
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。
面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法
机构 * E3A Healthcare(E3A医疗公司)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。
Comments 20 pages, 3 figures. Also archived at doi: https://doi.org/10.5281/zenodo.21563213
再循环
机构 * Google DeepMind(谷歌DeepMind) ; University of Texas, Austin(德克萨斯大学奥斯汀分校)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。
Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG
AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。
基于跨难度优化动力学的大语言模型课程学习理解
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析不同课程调度的优化动力学,提出衡量跨难度知识迁移的Relative Transfer指标,据此推导TDCS方法,经多推理基准实验证明其性能优于代表性调度策略,为课程学习提供统一优化解释。
LZ惩罚:一种用于自回归语言模型的信息论重复惩罚项
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LZ惩罚,基于LZ77压缩算法,可让开源推理模型用贪婪解码时无退化重复,优于现有频率、重复惩罚。
Comments Post-publication corrections (minor calculation mistakes)
编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 本研究提出WER多阶段框架,通过冻结执行器、程序验证器打分及混合轨迹优化训练技能优化器,在BFCL v4和tau2-bench上显著提升智能体工具使用性能,4B优化器表现优于通用模型。
SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版
机构 * VinUniversity ; FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) ; VNU University of Engineering and Technology(VNU工程技术大学) ; Aalborg University(奥尔堡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。
Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。
下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) ; Southeast University(东南大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。
DominoTree:使用Domino进行条件树结构草稿的推测性解码
机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。
Comments 32 pages, 2 figures, 16 tables. Code: this https URL (https://github.com/slin-zhq/Domino-Tree)
面向视觉-语言-动作驾驶模型的推理时注意力引导
机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。
Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention
智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用
专题命中 测试时计算 :reasoning(abstract)
AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。