Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference
拒绝、重采样、重复:理解语言模型推理中的并行推理
专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
拒绝、重采样、重复:理解语言模型推理中的并行推理
专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。
路由、检索、反思、修复:一种自改进的代理框架,用于医学影像中的视觉检测和语言推理
机构 * 1 Center for Computational \& Data Sciences (CCDS), Independent University, Bangladesh (IUB)
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 R^4框架通过路由、检索、反思和修复四个代理提升医学影像分析的准确性和可靠性。
解锁金融数据价值:关于蒸馏和难度感知训练的研究
机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。
揭示大型语言模型中的行为可塑性:基于令牌条件的视角
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ToCoRL框架,通过令牌条件强化学习使LLM在推理时实现稳定的行为适应,从而实现精确的行为控制。
Comments Work done during an internship at the Qwen Team, Alibaba Group
对幻觉的对齐:人类和AI反馈中的选择盲区
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。
Comments 16 pages, 6 figures, 2 tables
最佳尾部:在推理时间对齐中弥合乐观与悲观
机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BoT框架,通过Tsallis分歧作为正则化器,在推理时间对齐中平衡乐观与悲观,提升对齐性能。
共识并非验证:为何众智策略在LLM诚实性上失效
机构 * stanford(斯坦福大学) ; amazon(亚马逊)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究发现,扩展计算量无法提升LLM在无验证领域的诚实性,因模型错误高度相关,聚合方法反而放大误解。
ReDepth Anything: 通过自监督重照明进行测试时深度细化
机构 * Bielefeld University(比勒菲尔德大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。
Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything
并非所有查询都需要深度思考:CoFiCot用于自适应粗到细状态细化
机构 * Xi’an Jiaotong University(西安交通大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Institute of Automation CASIA(中国科学院自动化研究所)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 CoFiCot通过自适应粗到细框架,利用多指标分类器和状态依赖传播过程,提升大语言模型在不同任务上的推理能力与上下文一致性。
奖励在攻击下:分析过程奖励模型的鲁棒性和可hack性
机构 * UC Berkeley(加州大学伯克利分校) ; Transmute AI ; ICSI(国际计算机科学研究所) ; LBNL(劳伦斯伯克利国家实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究揭示了过程奖励模型在对抗性攻击下的脆弱性,指出其更像流畅性检测器而非推理验证器,并提出PRM-BiasBench用于评估模型鲁棒性。
LLM-FK:多智能体LLM推理用于大规模复杂数据库中的外键检测
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract)
AI总结 LLM-FK通过多智能体框架解决大规模复杂数据库中外键检测的三大挑战,实现高精度和高效搜索。
Comments 28 pages, 13 figures
Ares: 为高效LLM代理的自适应推理努力选择
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Accenture(埃森哲)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Ares通过动态选择推理努力级别,有效降低LLM代理的推理成本,同时保持任务成功率。
CyclicReflex: 通过循环反思标记调度提升推理模型
专题命中 复杂问题求解 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL
AI总结 CyclicReflex通过循环反思标记调度提升推理模型性能,采用动态三角波调节反思标记logits,无需额外计算成本。
Comments Accepted to ICLR 2026
GraphSkill: 基于文档的分层检索增强编码用于复杂图推理
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Michigan State University(密歇根州立大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GraphSkill通过分层检索增强编码框架和自我调试代理,提升复杂图推理任务的准确性和效率。
Comments Under review
一个简单的‘动机’可以增强大推理模型的强化微调
机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University, Singapore(生成式人工智能实验室,计算与数据科学学院,南洋理工大学,新加坡) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出MeRF,通过在强化微调中引入任务动机,提升大模型在复杂任务中的推理性能。
FinSheet-Bench:从简单查找至复杂推理,LLMs在金融表格中表现不佳
机构 * Qubera AG(Qubera公司) ; University of Zurich(苏黎世大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 FinSheet-Bench通过合成数据评估LLM在复杂财务表格任务中的表现,揭示了LLM在结构化数据处理上的局限性。
EmoOmni:弥合情感理解与表达在多模态大语言模型中的鸿沟
机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) ; University of Surrey, Guildford, United Kingdom(萨里大学,Guildford,英国)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 EmoOmni通过引入情感链式思维机制,提升多模态情感对话中的理解与表达能力,构建了评估基准并验证了其有效性。
逐步挖掘外部知识以实现隐式复杂问题回答
专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种渐进式知识挖掘框架,通过迭代获取外部知识并动态调整策略,提升开放领域复杂问题回答的准确率和效率。
Comments 13 pages, 3 figures, EMNLP findings 2023
CCR-Bench:一个全面的评估基准,用于评估大语言模型在复杂约束、控制流和现实世界案例中的能力
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CCR-Bench是一个用于评估大语言模型在复杂约束、控制流和现实世界案例中表现的全面基准,通过现实工业场景的样本揭示了当前模型在复杂指令理解上的不足。
一种新型多智能体架构以减少大型语言模型在多步骤结构建模中的幻觉
机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) ; HBC Engineering Company(HBC工程公司) ; College of Civil Engineering, Hunan University(湖南大学土木学院) ; Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) ; Department of Civil and Environmental Engineering, Lehigh University(莱斯利大学土木与环境工程系) ; School of Architecture, University of Miami(迈阿密大学建筑学院)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出了一种新型多智能体架构,通过并行代理协同工作,利用OpenSeesPy实现多步骤结构建模自动化,有效减少幻觉并提高计算效率。
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
MAS-ZERO:无需监督设计多智能体系统
机构 * Salesforce AI Research(Salesforce AI研究院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MAS-ZERO通过元层面设计实现无需监督的多智能体系统自动设计,提升推理、编程和代理任务的性能。
Comments SEA@NeurIPS (Oral) 2025
基于基础模型的自动奖励机制:用于组合强化学习的自动化奖励机
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ARM-FM通过基础模型实现自动化奖励设计,利用自然语言生成奖励机并实现跨任务泛化,提升强化学习的通用性和效率。
Comments Published at ICLR 2026
一种模块化感知人工智能的皮层启发架构
机构 * Independent Researcher(独立研究者)
专题命中 复杂问题求解 :reasoning(abstract,comments);分类 cs.AI
AI总结 本文提出了一种受皮层启发的模块化感知人工智能架构,通过分解感知为专门模块,提升可解释性和推理透明度。
Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)"
DualTurn: 从双通道生成式语音预训练中学习轮流对话
机构 * Anyreach AI
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 DualTurn通过双通道生成式语音预训练,实现了更自然的轮流对话处理,优于现有方法在代理动作预测和词级轮流预测上的表现。
Comments Submitted to Interspeech 2026
Helix:基于进化强化学习的开放性科学问题求解
机构 * Bosch (China) Investment Co., Ltd.(博世(中国)投资有限公司) ; Tsinghua-Bosch Joint Center for ML, Tsinghua University(清华大学-博世联合人工智能中心,清华大学) ; Dept. of EE, Tsinghua University(清华大学电子工程系) ; Dept. of Comp. Sci. & Techn., Tsinghua University(清华大学计算机科学与技术系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 HELIX通过分层进化强化学习框架,在开放性科学问题求解中实现了先进解决方案的发现,其在圆圈装箱任务中取得state-of-the-art结果,并在机器学习基准测试中超越GPT-4o。
Comments Accepted at ICLR 2026
AutoChecklist: 用于检查表生成和评分的可组合流水线
机构 * University of Chicago(芝加哥大学)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL
AI总结 AutoChecklist通过可组合的流水线实现检查表生成与评分,支持多种LLM提供者,并展示了在领域适应中的灵活性。
Comments Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist
视频-EM:面向长视频理解的事件中心型片段记忆
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Tianjin University(天津大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。
Comments 14 pages, 6 figures
VISTA:面向无训练股票时间序列分析的视觉-语言推理
机构 * University of Southern California(南加州大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.LG
AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。
Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers
EFT-CoT:一种针对情感导向治疗的多智能体链式思考框架
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL
AI总结 EFT-CoT提出一种基于情感导向治疗的多智能体框架,通过三个阶段工作流程提升心理健康问答的共情深度和专业性。