When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO
当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
当正确与错误相遇:基于奖励-信心校正的双侧上下文条件化GRPO
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BICC和RCC机制,通过对比正确与错误推理轨迹提升GRPO性能,无需额外采样或辅助模型,实验证明在数学推理基准上表现更优。
DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶
专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。
Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)
AI心理测量学:通过心理测量效度评估大型语言模型的心理推理能力
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 本文通过心理测量学方法评估四个主流LLM的心理推理能力和整体效度,发现高性能模型在效度上优于其 predecessors,验证了AI心理测量学的应用价值。
Comments Accepted for publication in the Proceedings of the 58th Hawaii International Conference on System Sciences (HICSS), 2025
Journal ref Proceedings of the 58th Hawaii International Conference on System Sciences (HICSS), January 2025, pp. 5189-5197
分子科学的多任务大规模推理模型
机构 * Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出多任务大规模推理模型,结合科学逻辑与深度学习,通过强化学习提升分子推理能力,在10项任务中实现50.3%的性能提升,验证了显式推理机制的有效性。
Delta1与LLM:符号与神经整合用于可信且可解释的推理
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出Delta1与LLM结合的框架,通过符号推理与神经网络整合,实现可信且可解释的推理,适用于医疗、合规和监管领域。
Comments 12 pages, 1 figure, 3 tables, accepted oral presentation at AAAI2026 Bridge Program on Logic & AI
面向神经元的数据选择用于大语言模型的指令微调
机构 * NLP ; CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) ; Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Provable Responsible AI and Data Analytics Lab, KAUST(可证明责任AI与数据分析实验室,卡尔斯兰大学) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 本文提出NAIT框架,通过分析神经元激活模式相似性选择高效指令微调数据,提升大语言模型特定或通用能力,实验证明其在多种任务中优于其他方法。
HCP-DCNet:一种用于自我改进因果理解的分层因果原语动态组合网络
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HCP-DCNet,通过分层因果原语动态组合网络实现因果理解的自我改进,提升因果发现、反事实推理和组合泛化能力。
Comments 17 pages, 2 figures, submitted to a journal and under review
模态逻辑神经网络用于金融AI
机构 * Lawrence Berkeley National Lab(伯克利国家实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出模态逻辑神经网络,结合模态语义与神经网络,解决金融AI中深度学习与符号逻辑的矛盾,通过监管护栏、市场压力测试等应用提升合规性与鲁棒性。
Comments 4 pages, 1 figure, Accepted at ICLR 2026 FinAI
评估VLMs在机器人运动中的空间推理能力:迈向具有运动偏好的机器人规划的一步
机构 * King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 本文评估了四种先进VLMs在机器人运动中的空间推理能力,探讨了运动偏好(如物体接近性和路径风格)的处理,并分析了准确率与计算成本的权衡。
Comments Accepted to the First Workshop on Efficient Spatial Reasoning at ICLR 2026
一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划
机构 * Clemson University(克莱姆森大学)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)
AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。
Comments Under review. 16 pages, 2 figures
不只是终点,而是旅程:推理痕迹因果地塑造泛化行为
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 研究探讨推理痕迹对模型泛化行为的因果影响,通过设计控制实验发现不同推理类型导致不同行为模式,证明推理本身具有独立信号。
Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。
基于大语言模型的网络代理的AI规划框架
机构 * Faculty of Computer and Information Science, University of Haifa(计算机与信息科学学院,海法大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种将网络任务视为序列决策过程的AI规划框架,通过将现代代理架构映射到传统规划范式,提出五种新的评估指标,验证了全计划提前代理在技术指标上的优势。
ToolTree: 通过双反馈蒙特卡洛树搜索与双向剪枝实现高效的LLM代理工具规划
机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息学院) ; School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出ToolTree,一种基于蒙特卡洛树搜索的工具规划方法,通过双阶段LLM评估和双向剪枝机制,提升工具使用序列的适应性和效率,实验表明其在多种基准测试中性能提升约10%。
Comments ICLR 2026
CarPLAN: 基于动态场景感知的上下文自适应与鲁棒规划
机构 * Department of Artificial Intelligence, Hanyang University(翰林大学人工智能系) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) ; Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) ; Department of Automotive Engineering, Hanyang University(翰林大学汽车工程系)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 CarPLAN通过位移感知预测编码和上下文自适应多专家解码器,提升自动驾驶在复杂场景中的鲁棒性和适应性规划能力。
Comments 10 pages, 6 figures. Under review at IEEE Transactions on Intelligent Transportation Systems
FAPE-IR:面向全场景图像修复的频率感知规划与执行框架
机构 * Tianjin University(天津大学) ; University of Macau(澳门大学) ; City University of Hong Kong(香港城市大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。
基于资源优先的路线碎片化方法用于农业环境中高效多机器人路径规划
机构 * Lincoln Centre for Autonomous Systems, University of Lincoln, UK(林肯自主系统中心,林肯大学,英国) ; Lincoln Institute for Agri-food Technology, University of Lincoln, UK(林肯农业食品技术研究所,林肯大学,英国)
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出基于资源优先的路线碎片化方法,用于农业环境中高效多机器人路径规划,通过部分路线进展减少二进制等待影响,提升任务吞吐量。
Comments This work has been submitted to the IEEE for possible publication
基本手术动作的通用识别促进技能评估和基于视觉-语言模型的手术规划
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出包含10种基本手术动作的大型数据集,开发了新的基础模型以实现基本动作的通用识别,并展示了其在手术技能评估和手术规划中的应用。
Comments 34 pages, 8 figures
CalliMaster:通过布局引导的空间规划掌握页面级中文书法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) ; Xiamen University(厦门大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。
NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测
机构 * Alibaba Group(阿里巴巴集团)
专题命中 规划推理 :planning(title,abstract)
AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。
大语言模型作为配送骑手:利用LLM代理框架生成即时食品配送骑手的路线决策
专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出LLM-DR框架,通过基于经验的骑手人设和基于推理的路线过程,模拟配送骑手的异质决策,以研究骑手劳动力战略对系统出行模式的影响。
Comments Proceedings of the 3rd International Conference on Urban Science and Intelligence
迈向人工智能搜索范式
机构 * Baidu Search(百度搜索)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。
构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。
Comments Work in progress, new versions will be updated continuously
大语言模型在人类迁移中的应用:机遇、挑战与未来方向
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 本文探讨大语言模型在人类迁移研究中的应用,总结了五个任务中的核心挑战与LLM解决方案,并提出未来研究方向。
少花钱,多思考:基于预算的值树搜索用于大语言模型代理
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种无需训练的推理时框架,通过单个LLM骨干模型将多跳推理建模为动态搜索树,并引入预算条件的节点选择机制,以在预算耗尽时实现从广度探索到贪婪利用的平稳过渡。
TRACE: 基于知识图谱的时序规则锚定证据链的可解释股票走势预测
机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; Aily Labs(Aily实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 TRACE通过结合符号关系先验、动态图探索和LLM引导决策,实现股票预测的可解释性,实验表明其在S&P 500基准上取得优于基线的准确率和F1分数。
测试时策略用于更高效和准确的代理RAG
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出测试时改进Search-R1流程,通过上下文模块和去重模块提升RAG系统在复杂多跳问题中的效率和准确性,实验表明在HotpotQA和Natural Questions数据集上EM得分提高5.6%,检索次数减少10.5%。
部分可观测多智能体强化学习与信息共享
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 本文研究了在部分可观测随机游戏框架下可证明的多智能体强化学习问题,提出利用智能体间的信息共享来解决计算复杂性问题,并设计了具有准多项式时间复杂度的算法,扩展至合作部分可观测马尔可夫决策过程。
Comments Final journal version of the ICML 2023 conference paper, accepted to SIAM Journal on Control and Optimization (SICON)
团队多样性促进软件公平性:一项关于公平意识需求优先级排序的实验
专题命中 规划推理 :reasoning(abstract)
AI总结 研究探讨了软件团队多样性对需求优先级排序中公平意识行为的影响,发现多样性团队更一致地拒绝存在公平风险的故事,且决策理由更强调包容性和伦理责任。
PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。