MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
自进化视觉语言模型用于图像质量评估:基于投票与排序
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。
Comments Published as a conference paper at ICLR 2026
通过逐步偏好调优的多模态智能体迭代工具使用探索
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) ; Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 测试时计算 :verifier(abstract)
AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。
Comments 24 pages
CoT-Space: 一种通过强化学习实现内部慢思考的理论框架
机构 * Zeyu Gan, Yi Hao, Yong Liu(GAN 赵毅、LIU 刘永)
专题命中 复杂问题求解 :CoT(title_cn,summary_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CoT-Space理论框架,通过强化学习将推理过程从离散的token预测任务转化为连续的推理层面语义空间中的优化过程,揭示了测试时扩展中最优CoT长度的收敛是欠拟合与过拟合基本权衡的自然结果。
Comments Preprint Edition
CAP-CoT:用于提升大语言模型推理中思维链的循环对抗提示
机构 * Department of Electronic Engineering, Kyung Hee University(韩国庆熙大学电子工程系) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) ; Henan Polytechnic University(河南理工大学) ; School of Computing, Kyung Hee University(韩国庆熙大学计算机学院)
专题命中 复杂问题求解 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 CAP-CoT通过循环对抗提示框架提升LLM推理的准确性和稳定性,通过生成候选推理链、构造有缺陷的链并对比反馈,优化推理过程。
Self-Correction Bench:揭示并解决大语言模型中的自校正盲点
机构 * Independent Researcher(独立研究者)
专题命中 复杂问题求解 :self-correction(title,title_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出Self-Correction Bench框架,发现大语言模型存在64.5%的自校正盲点,经微调或添加“Wait”可显著降低该盲点,揭示了自校正能力未激活的机制。
Comments Accepted to COLM 2026
层次化思维链提示:提升大语言模型推理性能与效率
机构 * Huawei Technologies Canada, Canada(华为技术加拿大公司,加拿大)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);planning(abstract)
AI总结 本文提出层次化思维链提示方法,通过分层步骤规划与执行提升复杂多步推理的准确率和效率,实验显示在多种模型和任务中平均准确率提升6.2%。
LLMs 作为 ASP 程序员:自我纠正实现任务无关的非单调推理
机构 * Arizona State University(亚利桑那州立大学) ; Samsung Research(三星研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.AI
AI总结 提出 LLM+ASP 框架,通过自我纠正循环将自然语言转化为回答集程序,实现无需任务特定工程的非单调推理,在多个基准上优于 SMT 方法。
Comments 30 pages
适应性推理的推理模式对齐融合
机构 * The University of Queensland(昆士兰大学) ; City University of Hong Kong(香港城市大学) ; Griffith University(格里菲斯大学)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RPAM,通过融合长链式思考和短链式提示模型,实现高效的查询自适应推理,减少推理成本并保持高性能。
Comments Accepted to CIKM 2026
步骤级稀疏自编码器用于推理过程解释
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG
AI总结 提出步骤级稀疏自编码器(SSAE),通过条件稀疏化形成信息瓶颈,将推理步骤中的增量信息与背景信息分离为稀疏特征,用于解释大语言模型的推理过程。
LASAR:潜在自适应语义对齐推理用于生成推荐
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。
混合潜在推理与解耦策略优化
机构 * Tencent PCG(腾讯PCG) ; Tencent CSIG(腾讯CSIG)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。
Comments Accepted to ECCV 2026
Journal ref ECCV 2026
能思考、对话更出色的语言模型
机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) ; Princeton University(普林斯顿大学)
专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型
Comments COLM 2026; we release our code, data, and artifacts publicly at https://github.com/princeton-pli/RLMT
REFACT:用于紧凑且忠实的思维链推理的自适应事实重述
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL
AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。
RankGuide: 张量秩引导的路由与引导以实现高效的推理
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Intel Labs(英特尔实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。
通过群体相对策略优化在结构因果模型中 grounding 多跳推理
机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) ; Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) ; Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI
AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。
MatSciBench: 基准测试大型语言模型在材料科学中的推理能力
机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) ; University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) ; Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI
AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。
通过置信度动态实现大推理模型的早停
机构 * University of Maryland(马里兰大学) ; University of Southern California(南加州大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究推理过程中中间答案的置信度,提出CoDE-Stop方法利用置信度动态决定早停,无需额外训练,提升准确率与效率,减少25-50%的token使用。
通过分步置信度归因诊断黑盒大语言模型的多步推理失败
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。
Comments Accepted by ICML 2026
ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。
Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
自我修正错觉:LLM 纠正他人但不纠正自己
机构 * National Taiwan University(国立台湾大学)
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。
Comments 15 pages, 3 figures, 15 tables
广义离散扩散与自校正
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出自校正离散扩散模型(SCDD),通过显式状态转移和离散时间学习,简化训练噪声调度,消除冗余重掩码步骤,在GPT-2规模上实现高效并行解码并保持生成质量。
Comments 40 pages, 3 figures, 6 tables
模型说走:表面启发式如何覆盖LLM推理中的隐式约束
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Independent Researcher(独立研究者)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。
回答之前先解释:组合视觉推理综述
机构 * Monash University(墨尔本大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Griffith University(格里菲斯大学) ; Princeton University(普林斯顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。
Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey
协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理
机构 * Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。
Comments 9 pages, 5 figures, Findings of ACL 2026
NarrativeTrack: 评估实体中心推理在叙事理解中的表现
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。
Comments Project Page: https://github.com/apple/ml-NarrativeTrack
何时重新规划:分层潜在推理中的子目标持久性
机构 * Independent Researcher(独立研究者)
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究分层潜在推理中稳定性与适应性的权衡,通过封建式管理-工人接口控制子目标持久周期,发现中等周期(3-6步)最优,内在对齐权重存在窄最优值(约0.05)。
Comments Accepted at the Workshop on Compositional Learning: Safety, Interpretability, and Agents (CompLearn), ICML 2026. 10 pages, 2 figures
基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。
Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/
轻量语言模型在复杂计算表型任务中易出现推理错误
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)
AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。
LexKairos:评估大型语言模型的法律时间能力基准
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究提出LexKairos基准,评估LLMs的中文法律时间能力,经多设置测试发现Gemini-3-Flash表现最优,但现有模型在时间敏感任务上仍存局限,相关能力待提升。
Comments 15 pages, 5 figures