When Can LLMs Learn to Reason with Weak Supervision?
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
高校专区
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
在RLVR中对LLM推理进行语义空间探索与利用
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Shenzhen Technology University(深圳技术大学)
AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。
Comments Accepted as an ACL 2026 Findings paper
思维概率程序
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; Allen Institute for AI(Allen人工智能研究所)
AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。
Comments 26 pages
OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型
机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)
AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。
Comments code at: https://github.com/uclanlp/openvlthinker
当更多词语说更少:在图像描述评估中解耦长度与特异性
机构 * Stanford University(斯坦福大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。
交互链基准(COIN):当推理遇见具身交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) ; Xidian University(西安电子科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 COIN基准通过设计日常场景下的50个交互任务,评估机器人在部分可观测环境下进行因果依赖推理的能力,揭示现有方法在交互推理任务中的局限性。
FM-CAC:通过时间序列基础模型实现电池缓冲的边缘AI碳感知控制
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本文提出FM-CAC框架,利用电池作为时间缓冲,通过时间序列基础模型进行碳预测,减少碳排放同时保持高服务质量。
超越事实:大型语言模型分布式阅读理解基准测试
机构 * National Taiwan University(国立台湾大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Academia Sinica, Taiwan(台湾“中央研究院”) ; NTU AI-CoRE(国立清华大学AI研究中心)
AI总结 本文提出Text2DistBench基准测试,评估LLM从自然语言中推断分布知识的能力,通过真实YouTube评论数据,测试模型在估计评论比例和识别高频主题方面的表现,揭示LLM在分布式阅读理解中的能力和局限。
认证矛盾源于脱同步的溯源与水印
机构 * Case Western Reserve University(凯斯西储大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 研究揭示了溯源和水印验证层之间的矛盾,通过元数据清洗流程生成伪造内容,提出跨层审计协议实现100%准确分类。
Comments Accepted at CVPR 2026 Workshop Authenticity & Provenance in the Age of AI (APAI)
LiveCLKTBench: 向多语言大语言模型中跨语言知识转移的可靠评估迈进
机构 * National Taiwan University(国立台湾大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Academia Sinica, Taiwan(台湾“中央研究院”) ; NTU AI-CoRE(国立清华大学AI研究中心)
AI总结 本文提出LiveCLKTBench,通过自动化生成流程评估多语言大语言模型的跨语言知识转移,发现语言距离和方向对转移影响显著,且模型规模越大收益越小。