Reasoning Boosts Opinion Alignment in LLMs
推理提升大语言模型中的观点一致性
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。
Comments Accepted at ICLR 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
推理提升大语言模型中的观点一致性
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。
Comments Accepted at ICLR 2026
DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理
机构 * University of Zurich(苏黎世大学) ; University of Pennsylvania(宾夕法尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; HKUST (GZ)(香港科技大学(广州))
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL
AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。
Comments 13 pages, 6 figures
理论物理研究能否从语言代理中受益?
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。
Comments 8+2 pages + references
逐步验证数学问题
机构 * Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。
基于结构化思维链的知识蒸馏用于文本到SQL
专题命中 代码与定理证明 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Struct-SQL框架,通过结构化思维链知识蒸馏提升小型语言模型在文本到SQL任务中的性能,实现8.1%的准确率提升。
Comments Accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026). This is the extended version containing additional details and appendices omitted from the camera-ready proceedings due to space constraints
TopoBench:在复杂拓扑推理上对LLM进行基准测试
机构 * Intercom Research(Intercom研究院) ; University College Dublin(都柏林大学) ; University of Galway(Galway大学) ; Salk Institute(Salk研究所) ; Dublin City University(都柏林城市大学) ; Trinity College Dublin(都柏林三一学院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,comments);分类 cs.CL、cs.AI
AI总结 TopoBench通过测试LLM在复杂拓扑推理任务上的表现,揭示了模型在提取空间约束方面的瓶颈,并提出缓解策略。
Comments Accepted, Workshop on Logical Reasoning of Large Language Models at ICLR 2026
LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。
自动驾驶系统推理的综述:开放挑战与新兴范式
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。
Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn
解耦感知与推理以实现抗幻觉的视频理解
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 本文提出DPL模型,通过解耦感知与推理以提升视频理解的抗幻觉能力,引入感知奖励和FAE评估器,有效提高训练后性能和数据效率。
Comments 17 pages, 8 figures
DocSage:一个多文档多实体问答的信息结构代理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。
大语言模型能否帮助解决带有归纳定义的约束?
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种神经符号方法,利用大语言模型生成辅助引理,提升求解涉及归纳定义的约束的能力,实验表明其在证明任务上的有效性。
Comments Accepted by the 27th Symposium on Formal Methods (FM 2026)
Critique-Coder: 通过批判强化学习增强Coder模型
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 Critique-Coder通过批判强化学习提升Coder模型性能,优于传统强化学习方法。
Sema: 一种高性能的基于大语言模型的语义查询处理系统
专题命中 逻辑推理 :reasoning(abstract)
AI总结 Sema 是一种基于 DuckDB 构建的高性能语义查询引擎,通过 SemaSQL 实现自然语言表达与 SQL 的无缝集成,提升语义查询的性能和结果质量。
LaMoGen:通过LLM引导的符号推理实现语言到动作生成
机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。
Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/
AutoVeriFix+: 通过轨迹感知因果修复和语义冗余剪枝实现高正确性的RTL生成
专题命中 逻辑推理 :reasoning(abstract)
AI总结 AutoVeriFix+通过轨迹感知因果修复和语义冗余剪枝,提升Verilog代码生成的功能正确性与设计效率。
Comments arXiv admin note: text overlap with arXiv:2509.08416
PuzLM:利用序列到序列语言模型解决拼图问题
机构 * Ben-Gurion University of the Negev(贝内-加里翁内盖夫大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 PuzLM通过将拼图重组视为序列到序列问题,利用离散符号推理实现高效拼图求解,提升了复杂拼图的重建性能。
通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应
机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Austrian Institute of Technology GmbH(奥地利技术研究所)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。
SVLL:分阶段视觉-语言学习用于物理基础的具身任务规划
机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,CUHKSZ) ; SSE, CUHKSZ(SSE,CUHKSZ) ; SAI, CUHKSZ(SAI,CUHKSZ) ; Shenzhen University(深圳大学) ; University of Sydney(悉尼大学) ; Harbin Engineering University(哈尔滨工程大学) ; Ising AI
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 SVLL 通过分阶段学习和 Bias-DPO 对齐目标,实现稳健的物理基础具身任务规划,提升任务成功率并减少物理约束违规。
Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。
Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project
从辩论到 deliberation:基于类型化认知行为的结构化集体推理
机构 * Indian School of Business(印度管理学院)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出DCI框架,通过结构化集体推理提升复杂任务决策质量,但指出其成本较高,需在过程问责性与效率间权衡。
Comments 26 pages, 6 tables, 2 figures, 2 listings
MedEyes: 学习动态视觉聚焦以进行医学逐步诊断
专题命中 规划推理 :reasoning(abstract,comments);chain-of-thought(abstract,comments);CoT(abstract,comments);分类 cs.AI
AI总结 MedEyes通过动态视觉聚焦和双模式探索策略,提升医学逐步诊断的准确性与临床相关性。
Comments AAAI 2026, Medical Chain-of-Thought (CoT), Reinforcement Learning with Verifiable Rewards (RLVR), Multimodal Grounded Reasoning
通过扩散模型实现自动驾驶的安全且风格化的轨迹规划
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出SDD Planner,通过结合多源风格感知编码器和风格引导动态轨迹生成器,实现自动驾驶中安全与风格化轨迹规划的平衡,实验表明其在多个基准测试中表现优异。
Comments 12 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems
面向低空经济网络的具身增强型波束预测的代理AI
机构 * School of Electronic Science and Engineering, South China Normal University(南方科技大学电子科学与工程学院) ; School of Intelligent Engineering, Shaoguan university(韶关大学智能工程学院) ; School of Automation, Guangdong University of Technology(广东工业大学自动化学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出了一种基于多代理协作推理的混合波束预测模型,通过整合时序建模、视觉编码和多模态融合,提升低空经济网络中UAV通信的波束预测精度与鲁棒性。
通过持续经验驱动执行进行深度表格研究
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出深度表格研究(DTR)框架,通过闭环决策过程解决复杂表格分析问题,利用分层元图和期望感知策略实现持续优化,验证了战略规划与低层执行分离的重要性。
Comments 23 pages, 6 tables, 6 figures
KnowVal: 一种知识增强且价值引导的自动驾驶系统
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) ; University of California, Merced(加州大学默塞德分校)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。
Comments Accepted to CVPR 2026
高效迭代基于大语言模型的神经架构搜索与反馈记忆
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于大语言模型的高效迭代神经架构搜索方法,通过反馈记忆机制和双LLM专业化,在单块消费级GPU上实现高效模型搜索,提升图像分类性能。
从劳作到思考:在系统文献综述中设计战略探索和负责任的AI
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ARC系统,通过多数据库整合、透明搜索和可验证AI辅助筛选,帮助学者从管理行政负担转向战略探索,提升知识综合的透明度和可验证性。
Comments Accepted at IUI 26
从相预测到相设计:一种用于高熵合金发现的ReAct代理框架
机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究院) ; Department of Physics and Materials Science, University of Luxembourg(卢森堡大学物理与材料科学系)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ReAct代理框架,通过推理与行动实现高熵合金设计,显著提升相发现效率与准确性。
移动代理-RAG:通过上下文知识增强驱动智能多代理协调以实现长周期移动自动化
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出Mobile-Agent-RAG框架,通过双层检索增强实现智能多代理协调,提升长周期移动自动化任务的完成率和效率。
从单张图像高效构建隐式表面模型用于运动生成
机构 * Department of Electrical Engineering, Stanford University, USA(美国斯坦福大学电气工程系) ; Aurora Innovation, USA(美国Aurora Innovation公司) ; School of Computer Science, The University of Sydney, Australia(澳大利亚悉尼大学计算机科学学院) ; Australian Centre for Robotics, The University of Sydney, Australia(澳大利亚悉尼大学机器人中心) ; College of Connected Computing, Vanderbilt University, USA(美国范德比尔特大学连接计算学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出FINS框架,通过单张图像高效重建高保真表面和SDF场,提升机器人运动生成的效率和精度。
Comments 9 pages, 6 figures, 2026 IEEE International Conference on Robotics and Automation (ICRA)