Experience Augmented Policy Optimization for LLM Reasoning
经验增强策略优化用于大语言模型推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
经验增强策略优化用于大语言模型推理
专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG
AI总结 提出经验增强策略优化(EAPO),通过将先验RL优化策略作为动作级经验先验并在关键决策点选择性注入,配合自适应重要性采样,解决RLVR中采样成本高和经验利用不足问题,在多个基准上提升推理性能。
词汇丢弃:LLM共同进化中的课程多样性
机构 * Arizona State University(亚利桑那州立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对LLM共同进化中问题多样性崩溃的问题,提出词汇丢弃机制,通过在策略训练和课程生成时随机掩码输出logits维持多样性,在数学推理任务上提升求解器性能平均+4.4点。
Comments Accepted to COLM 2026
FlexNGIA 2.0:利用智能AI重新设计互联网——由AI设计、部署和管理的协议、服务和流量工程
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 面对沉浸式通信需求等带来的契机,FlexNGIA 2.0利用基于大语言模型的AI智能体自主编排、配置和演进网络,可动态调整多种网络方案。通过初步实验证明其能力,为新型智能AI驱动网络奠基,也指出了相关关键研究挑战。
AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理
机构 * Hunan University, Changsha, China(湖南大学) ; Wuhan University of Technology, Wuhan, China(武汉理工大学) ; Huazhong University of Science and Technology, Wuhan, China(华中科技大学)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。
基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划
机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) ; National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) ; School of Mechanical Engineering, Southeast University(东南大学机械工程学院)
专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract)
AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。
用于有效规划和工具使用的流内智能体系统优化
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; UC San Diego(圣地亚哥大学) ; Lambda Website(Lambda网站)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。
Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/
不要愚弄我两次:通过经验驱动推理在野外适应逆境
机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.LG
AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。
Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
HALO:科学假设生成中的交互式协同溯因推理
专题命中 规划推理 :reasoning(title,abstract)
AI总结 该研究针对科学假设生成效率低的问题,提出协同溯因框架,构建HALO系统用于药物发现中的分子假设生成,经专家研究验证,此系统能促进溯因推理,帮助产生更高质量、更多样的候选分子。
Comments 22 pages
AdaHome:一种使用本地小语言模型的自适应智能家居助手
机构 * University of Southampton(南安普顿大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。
基于多视角语音特征的LoRA微调大语言模型用于痴呆检测
机构 * NAVER Cloud(NAVER云) ; Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。
Comments Accepted at INTERSPEECH 2026
提示编程用于大型语言模型的文化偏差与对齐
机构 * Information Systems and Modeling, Los Alamos National Laboratory(信息系统与建模,洛斯阿拉莫斯国家实验室) ; Advanced Research in Cyber Systems, Los Alamos National Laboratory(网络安全系统高级研究,洛斯阿拉莫斯国家实验室) ; Center for National Security and International Studies(国家安全与国际研究中心) ; Analytics Division, Los Alamos National Laboratory(分析部门,洛斯阿拉莫斯国家实验室)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过提示编程优化大型语言模型的文化对齐,利用DSPy框架系统调整治文化偏差,实验表明提示优化优于传统手动提示工程,提升模型响应的可转移性与稳定性。
Comments 10 pages, pre-print
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。
循环代码取证:面向图像伪造检测的代理工具使用
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。
Comments 18 pages, 7 figures
PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统
机构 * GigaAI(字节跳动人工智能实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Leeds(利兹大学) ; Cornell University(康奈尔大学) ; Tsinghua University(清华大学) ; Nanjing University of Science and Technology(南京理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; FAWTD(一汽技术开发部)
专题命中 测试时计算 :verifier(abstract)
AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。
Comments WebPage: https://open-gigaai.github.io/Zero2Skill
减少复杂问答中的幻觉:使用基于简单图的检索增强生成(长版)
机构 * National Innovation Centre for Data(数据创新研究中心)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出一种轻量级图结构支持的检索增强生成系统,通过结合向量搜索和图查询工具,在复杂问答任务中将幻觉答案数量减半,并显著提升事实正确性的精确率和召回率。
Comments 25 pages; expanded limitations section, corrected typos throughout and missing values in appendix table 1
Prober.ai:基于LLM约束人设的门控探究式反馈用于论辩写作发展
机构 * Florida State University(佛罗里达州立大学) ; New York University(纽约大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Prober.ai通过约束LLM生成结构化JSON输出,提供探究式问题反馈,帮助学生提升论辩写作能力,其双阶段交互架构通过强制反思提升认知能力。
Comments Prototype awarded second place at the NYEdTech Hackathon (March 2026) https://www.nyedtechhackathon.com/2026-submissions
学习多智能体系统的延迟感知编排
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对多智能体系统推理延迟高的问题,提出延迟感知多智能体系统(LAMaS)。训练时通过约束优化学习延迟感知执行图,推理时用轻量级控制器补充。实验显示其在降低端到端延迟超50%的同时保持精度,且具模块化可移植性。
Comments This submission was intended to be an updated version of arXiv:2601.10560. Any subsequent updates will appear there
DocShield:通过证据导向的智能代理推理实现AI文档安全
机构 * Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学) ; CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。
Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482
生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。
联邦感知系统部署前复杂度估计
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Purdue University Northwest(普渡大学西北校区) ; Purdue University(普渡大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。
Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA
在冲突软件构件中衡量LLM的信任分配
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; IQVIA Inc.(IQVIA公司)
专题命中 推理评测 :reasoning(abstract_cn);分类 cs.AI
AI总结 研究探讨LLM在处理冲突软件构件时的信任分配问题,提出TRACE框架评估不同构件的质量、不一致性和信任校准,发现模型在检测文档错误时表现优于实现错误,但对实现漂移而文档无误的情况检测率下降,且信任校准不佳。
RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。
Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973
VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?
机构 * Dalian University of Technology(大连理工大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。
Comments 32 pages, 16 figures
迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准
机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) ; Nagoya University, Japan(名古屋大学,日本) ; AIST, Japan(日本国家先进工业技术研究院) ; VinUniversity, Vietnam(文园大学,越南) ; NVIDIA, USA(NVIDIA,美国) ; Griffith University, Australia(格里菲斯大学,澳大利亚) ; Hanoi Medical University, Vietnam(河内医学院,越南) ; Military Central Hospital, Vietnam(越南108中央军医院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks
逐字块胜过提取的人工制品:长LLM对话中记忆表征的控制消融研究
机构 * Hawaii Pacific University(夏威夷太平洋大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过控制消融实验,发现逐字对话块在长对话记忆检索中比LLM提取的结构化人工制品(事实、决策等)准确率高15.9-22.0点,原因是提取过程丢失了逐字细节,而结构化记忆应作为逐字文本的补充而非替代。
Comments v4: title and abstract aligned with ARR August 2026 submission; six confound controls; 34 pages, 6 figures. Code: https://github.com/tao-hpu/cog-canvas
一种用于智能电视内容发现的由大语言模型驱动的智能推荐系统
机构 * Meta
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对推荐系统整合上下文信号的挑战,提出用于智能电视内容发现的大语言模型驱动的智能推荐系统,利用其推理能力处理多样信号,采用智能架构协调组件,克服大语言模型用于推荐的实际限制。
Comments 13 pages, 3 figures
KoRe: 为大型语言模型设计的紧凑知识表示
机构 * University of Trento(特伦托大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出KoRe方法,通过将知识图谱的1跳子图编码为紧凑离散知识标记,并注入到LLM中,从而提升模型的知识推理能力并减少token使用量。
利用AI代理的信息聚合
机构 * Department of Economics, University of Durham(杜伦大学经济学系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究通过交易和观察价格波动,探讨大型语言模型能否聚合分散的私人信息,发现信息聚合在信息结构复杂时显著下降,且更智能的AI代理在聚合和盈利方面表现更好。
Comments 62 pages