Do AI weather models miss extremes?
AI气象模型是否遗漏极端天气?
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究验证11种物理与AI气象模型,发现极端天气下相对技能缺失是特定模型的特性而非AI气象模型整体的问题,部分AI模型在极端场景表现优于数值模型。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AI气象模型是否遗漏极端天气?
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究验证11种物理与AI气象模型,发现极端天气下相对技能缺失是特定模型的特性而非AI气象模型整体的问题,部分AI模型在极端场景表现优于数值模型。
SPORK:自我推测性分叉以加速智能体大语言模型推理
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。
Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork
LLM 谄媚中权威层级的机制性视角
机构 * Independent Research(独立研究)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。
模型取证:调查令人担忧的行为是否反映对齐失败
机构 * MATS
专题命中 其他推理 :CoT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。
Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Cornell University(康奈尔大学) ; Intel(英特尔) ; Amazon AGI(亚马逊AGI)
专题命中 其他推理 :CoT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。
基于SAM3的关键帧推理:第8届LSVOS挑战赛MeViS-Text赛道第三名解决方案
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 其他推理 :reasoning(title)
AI总结 该研究提出两阶段无训练方案,依托Gemini-3.1 Pro分解视频事件选关键帧,用SAM3-agent生成掩码并双向传播,获第8届LSVOS挑战赛MeViS-Text赛道第三名。
TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理
机构 * Clark Atlanta University(克拉克亚特兰大大学) ; United International University(国际大学) ; North South University(北南大学)
专题命中 其他推理 :reasoning(title)
AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。
理性中的混沌:思维链大语言模型(LLMs)如何探寻答案
专题命中 其他推理 :chain-of-thought(title)
AI总结 本研究将非线性动力学与混沌理论工具应用于思维链LLMs,证实其存在混沌标志性特征,明确各Transformer子模块对扰动的作用,揭示其与典型混沌系统的结构相似性及分形特性,指出注意力机制诱导的非线性耦合是混沌行为的关键驱动因素。
Comments 16 pages 17 figures
ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合
机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)
专题命中 其他推理 :reasoning(title)
AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。
Comments 6 pages, 4 tables
瞬态储备、汇阻尼器以及注意力传播器中特征值推理的失效
专题命中 其他推理 :reasoning(title)
AI总结 研究因果变压器注意力矩阵非正规性,通过预解式观点测试其对已训练变压器的预测。利用掩码和投影器分析,发现学习到的非正规性有符号,路由少数群体有瞬态储备,汇多数群体起阻尼作用,特征值预测误差大,预解式特征对相关特性至关重要。
Comments 17 pages, 8 figures. Companion paper: arXiv:2607.06621
REAP:面向基于大语言模型的闭卷知识库构建的关系感知引出与解析
机构 * VNU University of Engineering and Technology(VNU工程技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 该研究提出REAP系统,基于Mistral-Small-24B-Instruct-2501模型,结合结构化思维链推理等技术,在2026年AKBC共享任务闭卷知识库构建任务中取得宏F1值0.62,相关代码已公开。
激活探针:挖掘模型输出遗漏的表面代码安全信号
专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。
Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026
用于跨语言立场检测的基于理由引导的知识蒸馏
机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Hefei Institute of Technology(合肥学院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。
Comments 23 pages, 7 figures, 3 tables
比较BERT句子对分类与少样本LLM提示在检测德国气候新闻中的威胁和解决方案框架
机构 * University of Graz(格拉茨大学) ; Technical University of Graz(格拉茨技术大学)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对德语气候新闻句子级框架检测,比较了微调BERT(句子对分类)与少样本LLM提示(Llama 4)方法,BERT在F1上达到0.83,优于LLM的0.78。
Comments 15 pages
Sakana Fugu 技术报告
机构 * Sakana AI
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.LG
AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。
AI后训练AI缺失了什么?一项实证分析
机构 * Tsinghua University(清华大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Renmin University of China(中国人民大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实证分析发现,LLM智能体后训练时存在策略锁定问题,其缺失的是执行过程中自发重新评估训练策略的机制,而非经验、指导或推理计算。
基于图结构在线难度估计的高效RLVR调度
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
用于可组合非结构化知识编辑的混合策略自编辑
机构 * University of Tennessee(田纳西大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; University at Albany(奥尔巴尼大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。
将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。
微型Transformer中的原型推理
机构 * Fin AI Research(Fin AI研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。
自动填充:使用专业语言模型准确预测缺失值
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。
Comments VLDB 2026
以知识为中心的自我改进
机构 * Caltech(加州理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。
通过对比信念更新来衡量奖励寻求行为
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。
Comments 101 pages, 66 figures
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
CausalMix: 数据混合作为语言模型训练的因果推断
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。
Comments 22 pages, 3 figures
机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。
Comments 13 pages, 15 figures
从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述
机构 * School of Computer Science, Sichuan University(四川大学计算机学院) ; School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。
晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由
机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。
Comments 18 pages, 4 figures. Submitted to Pattern Recognition