J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
机构 * FAIR at Meta(Meta 公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 13 tables, 14 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * FAIR at Meta(Meta 公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 13 tables, 14 figures
机构 * National Taiwan University(国立台湾大学) ; Apple(苹果公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Walmart Global Tech(沃尔玛全球科技)
专题命中 复杂问题求解 :chain-of-thought(abstract,comments);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Keywords: text-to-SQL LLM, fine-tuning, meta-aware leanring, metadata, chain-of-thought, BigQuery SQL, business database
TDD-Agent:用于代码生成的测试驱动推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
SheetCompass:面向智能体电子表格推理的分层关系图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。
Intern-S2-Mobius:知识与推理解耦的基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。
局部验证无法检测不可迁移性:智能体推理中上下文保持的上同调理论
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出智能体推理上下文保持的上同调理论,证明局部验证无法检测不可迁移性,提出Ksetra方法并通过外汇市场验证了所提检验的有效性。
Comments 17 pages, 10 figures. Includes an exact F-test for non-transportability with verified size and power, its precision-whitened generalisation, and a foreign-exchange case where the null hypothesis is known analytically rather than estimated
CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。
LaViT:对齐潜在视觉思维以进行多模态推理
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Utrecht University(乌特勒支大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。
REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。
Comments 26 pages and 22 figures
ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; CITIC Securities(中信证券) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。
ReflectRL:通过反思到直接推理从优质负轨迹中学习
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。
Comments Project page: https://github.com/bibisbar/ReflectRL
共享前缀,更优信用:面向多智能体推理的自适应路由
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。
HyperGuide: 用于大型语言模型高效多步推理的双曲引导
机构 * Department of Computer Science(计算机科学系) ; Stony Brook University(石英布鲁克大学) ; Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Yale University(耶鲁大学) ; Department of Data Science(数据科学系) ; New Jersey Institute of Technology(新泽西理工学院) ; Department of Biomedical Informatics(生物医学信息学系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578
SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理
机构 * University of British Columbia(英属哥伦比亚大学) ; Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI
AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。
哪些模型在继承推理中表现更好?
机构 * Paris Dauphine University(巴黎多芬纳大学) ; University of Abou Bekr Belkaïd(阿布·贝克尔·贝尔卡伊德大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文比较了商业和开源大语言模型在伊斯兰继承推理任务中的表现,发现商业模型在识别继承人、应用排除规则和保持推理一致性方面更优,其中Gemini 2.5 Flash表现最佳。
提示引导的多样化策略优化用于大语言模型推理
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Ant Group(蚂蚁集团)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 提出提示引导的多样化策略优化(HDPO),通过“提出-选择-思考”轨迹激励模型生成多样且可靠的解决方案,提升推理能力、候选方案多样性和可靠方案识别能力。
RECON:用于长上下文组合推理的智能体内存基准测试
机构 * RV College of Engineering(RV工程学院) ; Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究引入RECON基准测试,用于评估长上下文组合推理,跨越三个领域24个案例文件,测试智能体六个内存密集型任务,揭示当前架构在内存相关任务上存在重大局限,非预言机系统准确率低,检索和推理有挑战。
Comments 25 pages
TSRouter:用于时间序列推理的动态模态-模型选择
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 研究针对时间序列推理中不同模型能力互补及特性差异问题,提出基于图的TSRouter动态路由框架,通过构建异构图并将路由设为候选评分问题来选择最优模态-模型对,在多任务评估中性能显著提升,还具备零样本泛化等优势。
Comments Accepted to COLM 2026
DisarmRAG:以检索器为中心的隐秘中毒攻击,以禁用检索增强生成中的自我纠正(扩展版)
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL
AI总结 研究针对实际部署中LLMs自我纠正能力削弱RAG攻击效果的问题,提出DisarmRAG这一专注检索器的新型中毒范式,构建含迭代协同优化与对比学习技术的攻击框架,经多模型和基准测试验证其有效性及隐秘性。
Comments This paper is an extended version of our original paper accepted by ACM CCS 2026
思维策略:通过在线策略进化扩展大语言模型推理的测试时训练
机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) ; Shanghai University of Finance and Economics(上海财经大学) ; South China Normal University(华南师范大学) ; LMU Munich(慕尼黑大学) ; Wuhan University(武汉大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。
Comments Under Review, preprint
基于规则对齐的小语言模型和多智能体自我校正的闭环控制
专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.AI
AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。
Comments Accepted by IEEE CCTA 2026
思想有基因组:科学谱系推理与基于谱系的思想生成基准测试
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出IG-Bench基准测试,用于科学谱系推理与基于谱系的思想生成。围绕IdeaGene框架构建,支持两种评估。通过对14个基于大语言模型的科学家实验,发现存在组合瓶颈,最强系统谱系推理精确准确率低,结构化谱系上下文改变系统排名。
使用前沿模型进行反应网络推理以获得实验证实的催化剂选择性假设
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 研究复杂反应中催化剂选择性问题,利用前沿语言模型开发人机协同思考框架,通过识别控制途径竞争的物理杠杆发现新型催化剂,指导合成的催化剂使乙酸盐选择性提高三倍,转变计算范式,提供材料发现蓝图。
你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理
机构 * Goethe University, Frankfurt(法兰克福歌德大学) ; HTW Berlin(柏林工业大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。
使用开源药物发现引擎进行折叠、推理和扩展
机构 * Aureka AI(奥雷卡人工智能)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 介绍开源全原子生物分子基础模型OpenDDE,以共折叠为切入点构建可扩展AI驱动药物发现引擎,整合多方面进展实现一定精度,还指出共折叠模型扩展方向,推动药物发现发展。
从推理轨迹到可复用模块:理解语言模型推理中的组合泛化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Institute of Foundation Models(基础模型研究院) ; University of Michigan(密歇根大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 本文通过层次化潜在选择模型形式化组合泛化,理论证明SFT提供原子模块,RL分解轨迹实现组合泛化,实验验证RL能从复合轨迹中提取原子模块并重组解决新配置。
Comments ICML2026