SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination
SCOPE:基于耦合策略的端到端协调供应链运营
机构 * Dingdong(叮咚)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SCOPE:基于耦合策略的端到端协调供应链运营
机构 * Dingdong(叮咚)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。
GLM-RAG:面向基于图的检索增强生成的图语言模型
机构 * Institute of Computational Linguistics, Heidelberg University(海德堡大学计算语言学研究所) ; Aleph Alpha Research(Aleph Alpha 研究院)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出GLM-RAG的GLM基检索器,对比三类检索器性能,发现微调GLM检索器跨域泛化更优且在多跳基准达SOTA,GNN与向量搜索各有优势。
Comments 10 pages, 19 figures
大型语言模型能否执行父订单?
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。
MemHarness:记忆是被重构的,而非被重放的
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对现有记忆增强LLM智能体的逐字重放范式缺陷,提出MemHarness框架,通过GRPO训练实现记忆重构,在ALFWorld、WebShop等任务中性能优于基线,提升了智能体推理与分布外鲁棒性。
Comments 20 pages, 13 figures
超越改写:书籍级组织提升训练中合成教科书数据的质量
机构 * Peking University(北京大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。
Comments 31 pages, 3 figures, 11 tables
基于特权自蒸馏的对比强化策略优化
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
规模化的记忆解码器:一种预训练的参数化长期记忆
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。
SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控
机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。
SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。
Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany
深度研究可靠吗?误导性知识会导致错误结论
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究深度研究代理在开放信息环境中的可靠性,引入MisKnow-Agent框架生成误导性实例,通过实验发现其易因误导知识得出错误结论,验证与实际证据使用脱节,评估防御措施效果,强调需提升模型和框架层面的证据验证及纠正能力。
了解你的来源:用于媒体背景核查的公共知识库
机构 * Cardiff University(卡迪夫大学) ; Queen Mary University of London(伦敦大学女王学院)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。
Comments Code and Data: https://github.com/nedjmaou/mediaref
运用心智理论在社会学习与非社会学习之间进行仲裁
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究提出理性心智化模型,通过推理智能体目标与行动信息性权衡社会、非社会学习的效用,用新游戏验证其可定量捕捉人类学习策略的权衡,揭示选择性社会学习受心智理论指导以实现效用最大化。
Comments 35 pages, includes supplementary information
捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝
机构 * Xiamen University(厦门大学) ; Xiamen Ocean Vocational College(厦门海洋职业技术学院) ; Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。
借助图像外信息思考:由时空信息增益驱动的农田分割智能体
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。
AgenticER:实体解析的下一个前沿领域
专题命中 规划推理 :reasoning(abstract)
AI总结 针对现有实体解析被动范式无法适配异构流数据场景的问题,提出Agentic ER新范式,将其建模为自主智能体的序列决策过程,构建参考架构并明确研究挑战,开拓数据管理与智能体交叉的新研究方向。
Comments Vision paper submitted to VLDB, 6 pages
劳动力之后是什么资本?预测人机时代的人才ROI转型
专题命中 规划推理 :planning(abstract)
AI总结 针对AI增强打破劳动时间与贡献的会计关联,本文构建从时间到产出的人才ROI预测框架,核心定理为ROI反转,并利用韩国52小时工作制案例验证了前期压力信号,预测产出型企业在2032年TFP增长领先1.5-2.0个百分点。
Comments 86 pages, 6 figures
MusicWeaver: 作曲家风格的结构编辑与分钟级连贯音乐生成
机构 * The University of Sydney(悉尼大学)
专题命中 规划推理 :planning(abstract)
AI总结 MusicWeaver通过结构化计划和全局-局部扩散变换器实现作曲家风格的音乐生成与编辑,具备分钟级连贯性和高保真度。
Comments 15 pages, 3 figures
Beacon:智能体何时及如何执行智能体视觉推理
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; THU(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。
Comments 33 pages
多模态空间推理的视觉信用审计
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。
Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA
Arm2Air:用于三维中继组网的跨 embodiments 骨架迁移
专题命中 视觉空间推理 :planning(abstract);分类 cs.AI
AI总结 Arm2Air 实现跨 embodiments 骨架迁移,高效优化无人机中继部署,在规划速度、中继性能及数据效率上均优于基线方法,为异构 embodied 任务结构先验迁移提供新方案。
Comments 9 pages, 4 figures
仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。
Comments 34 pages, 14 figures
幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码
专题命中 测试时计算 :verifier(title,abstract)
AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
Orchard:一个开源的智能体建模框架
机构 * Microsoft Research(微软研究院) ; Columbia University(哥伦比亚大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。
基于动作中心图的推理时缩放与情景记忆的衔接
机构 * Florida International University(佛罗里达国际大学) ; Stanford University(斯坦福大学) ; NEC Laboratories America(美国NEC实验室) ; Singapore Management University(新加坡管理大学)
专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出GAMER框架,通过动作中心图衔接推理缩放与情景记忆,采用双流时间差分学习优化决策,在多基准上较普通基线提升了20.81%的成功率与6.17%的进度率。
以源为中心的状态演化循环Transformer
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG
AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。
Comments 24 pages, 5 figures
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
提示词为何构成图:提示词图工程的充要条件
机构 * Federal Institute of Goiás(戈亚斯联邦学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。
超越KV重建:推测解码中MLA草稿模型的功能重建
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。