Loop the Loopies!
循环循环者!
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
循环循环者!
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
作为编码智能体基础模型中间训练的函数感知中间填充
机构 * University of Waterloo(滑铁卢大学) ; University of British Columbia(英属哥伦比亚大学) ; NVIDIA(英伟达公司) ; Verdent AI(Verdent人工智能公司) ; Vector Institute(向量研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。
通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。
Comments ICML 2026
ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Waterloo(滑铁卢大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。
模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型
机构 * Emory University(埃默里大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。
排除谬误以确认正确:面向医疗问答的对比假设检索
机构 * Asan Medical Center(峨山医疗中心) ; Yonsei University(延世大学) ; University of Ulsan College of Medicine(蔚山大学医学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出对比假设检索框架CHR,通过生成正确和错误假设来提升医疗问答系统检索效果,实验显示在多个基准测试中优于现有方法,有效减少硬负样本污染。
MAPS:在多智能体认知对话中建模共存的主观视角和共享意义
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对当前AI对话系统问题,提出MAPS框架,通过领域加权配置文件、动态GRU记忆和令牌级注意力,让智能体保持个性化推理并趋向共享意义,在多数据集评估中支持语义对齐且不损主观性,为可解释对话系统发展提供路径。
构建用于多模态来源科学数据提取的智能体框架
机构 * Microsoft Research(微软研究院) ; University of California, Davis(加州大学戴维斯分校) ; Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。
MolReFlect:迈向分子与文本之间细粒度对齐的研究
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出MolReFlect框架,通过教师-学生机制实现分子与文本的细粒度对齐,提升LLM对分子的理解与可解释性,实验显示其在分子-文本翻译任务中达到最优性能。
Comments Accepted by TKDE, To appear. Codes are available at: https://github.com/phenixace/MolReFlect
联邦基础模型与智能电力电网的协同作用
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。
Journal ref IEEE Electrification Magazine, 2026
Inverse-LLaVA:通过文本到视觉映射重新思考多模态对齐
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究重新审视多模态学习中传统映射方向,提出Inverse-LLaVA架构,通过文本到视觉映射反转方向。该架构无需对齐预训练,在多模态基准测试中展现强大学习效率,为多模态架构设计开辟新方向,解耦表示结构与监督方式。
Comments 19pages, 3 figures
多任务少资源:针对基于大语言模型系统中资源优化的路由策略综述
机构 * Wikit ; Laboratoire Hubert Curien, UMR CNRS 5516(劳尔贝尔特·库尔尼恩实验室,CNRS UMR 5516) ; INSA Rouen Normandie(里昂-诺曼底理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了基于大语言模型系统的路由策略,旨在通过优化资源利用提高效率和性能。
大语言模型是上下文分子学习者
机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ICMA通过上下文分子微调使LLMs无需额外训练即可实现分子-文本对齐,证明LLMs具备上下文分子学习能力。
Comments Accepted by IEEE TKDE
更少专家,更快解码:用于专家混合模型的成本感知推测解码
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大规模专家混合模型推理效率受专家激活模式影响的问题,提出成本感知推测解码框架EcoSpec,通过纳入预测的边际专家激活成本进行草稿选择,在多个模型和基准测试中减少活跃专家足迹、提高解码速度。
基于简洁的与机器无关的迹进行语言识别
机构 * Stanford University(斯坦福大学) ; Cornell University(康奈尔大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文受大语言模型启发,针对语言识别的Gold-Angluin模型相关问题,解决能否用小字母表迹及能否直接从语言定义迹的问题,给出肯定答案,展示了如何定义计算迹实现极限识别,所用字母表与语言定义字母表大小成线性关系且与语言其他属性无关。
MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略
机构 * Independent Researcher(独立研究者)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。
通过自适应目标重述实现稳定的在线策略蒸馏
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Veto方法,通过在logit空间构建几何桥梁,解决传统在线策略蒸馏中的分布不匹配问题,提升训练稳定性与输出多样性。
Comments 10 pages, 5 figures, Accepted to Findings of ACL 2026
马赫思维-4-闪技术报告
机构 * Li Auto Inc(理想汽车公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 马赫思维-4-闪是含3B激活参数的35B参数专家混合智能体模型,通过训练后优化及可扩展交互环境提升性能。其流程含三个阶段,在多个基准测试中成绩优异,以低推理成本领先或匹配数倍激活规模模型。
RSF-GLLM:通过循环软流和去耦语言模型生成弥合多跳知识图谱问答中的语义鸿沟
机构 * Adobe Research(Adobe研究院) ; Adobe Systems(Adobe系统公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究多跳知识图谱问答中传统方法的语义鸿沟问题,提出RSF-GLLM框架,通过循环软流模块传播分数、引入正则化保证收敛,提取路径微调LLM,实验证明该方法性能优且推理效率高。
Comments Accepted for publication in ICML 2026 as a full research paper; 21 pages
大多数大语言模型的从众现象无需说话者:在同伴压力基准测试中测量无说话者底线
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Amazon(亚马逊)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型从众现象,发现多数从众在去除同伴后仍存。因标准提示混杂线索致现有基准无法分辨。引入无来源条件测试,发现其在多数案例中致有害修正,还揭示来源框架对底线的调节作用及相关问题,强调从众基准测试应先测无说话者底线。
CCBENCH:通过健康查询使用隐式信号规范评估大语言模型的文化能力
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :CoT(abstract);分类 cs.CL、cs.AI
AI总结 该研究引入CCBENCH框架,以健康领域为案例创建CCBENCH-Health评估大语言模型文化能力。通过60个角色、3120次互动对五个领先模型进行基准测试,发现模型文化恰当回应比例低,提示关注文化线索能适度提升性能,还揭示了模型与文化线索互动的一些特点。
Comments 34 pages
TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队
机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。
Comments 20 pages, 2 figures, 10 tables
通用算法隐式学习
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。
Comments Accepted at ICML 2026
基础模型知道如何推理,思维模型在训练中学习时机
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究思维语言模型训练中比基础模型多学到了什么,提出无监督方法和建设性模型差异分析,通过九个基础/思维模型对实验发现强化学习教编排基础机制启发式,监督微调蒸馏装新机制,为训练范式及推理模型开发提供新视角。
Comments Accepted as a Spotlight at the International Conference on Machine Learning 2026
为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究
机构 * Sage.is AI-UI(Sage.is人工智能用户界面)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。
Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings
一种用于副作用感知药物重新设计的先例引导协同科学家
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。
Comments Accepted at the ICML 2026 Workshop on AI for Science
通过轨迹自蒸馏实现少步扩散语言模型
机构 * Rutgers University(罗格斯大学) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。
对大语言模型有限元认知能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。
Comments 26 pages, 25 figures
Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026
学习何时关注:为长上下文LLM的条件记忆访问
机构 * Department of Electrical and Computer Engineering, Purdue University, USA(电子工程系,普渡大学,美国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出L2A方法,通过条件性长程记忆访问提升长上下文LLM性能,使Qwen 2.5和Qwen 3模型的有效上下文长度从32K扩展到128K,同时提升训练效率并减少内存消耗。
Comments 26 pages, 11 Tables, 18 Figures. Accepted at ICML 2026
面向大语言模型的神经元感知主动少样本学习
机构 * University of Pittsburgh, USA(匹兹堡大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出NeuFS框架,利用神经元激活模式从模型内部动态选择最具价值的少样本示例,提升大语言模型在专业领域的适应性和性能。