arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2509.23542 2026-04-21 cs.CL cs.AI cs.LG 67%

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 67%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11012 2026-04-14 cs.AI cs.CL cs.LG 67%

Min-$k$ Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics

Min-k Sampling: 通过相对Logit动态解耦截断与温度缩放

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang

机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Min-k采样,通过分析排序后的Logit分布局部形状,识别语义悬崖,动态确定截断边界,实现严格温度不变性,并在多个任务中提升文本质量。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07794 2026-04-14 cs.CL cs.AI cs.LG 67%

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

HiPRAG:分层过程奖励用于高效代理检索增强生成

Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Inc.(Adobe公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiPRAG通过引入细粒度的知识引导过程奖励,优化代理检索增强生成的推理过程,提升搜索效率并减少无效搜索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23850 2026-04-07 cs.AI cs.CL cs.LG 67%

The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models

向下钻探与伪造测试(DDFT):一种衡量语言模型认知鲁棒性的协议

Rahul Baxi

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DDFT协议,用于评估语言模型在语义压缩和对抗性伪造下的认知鲁棒性,发现鲁棒性与传统设计无关,且错误检测能力是关键瓶颈。

Comments This version strengthens the theoretical and empirical grounding of the CI metric, including explicit analysis of structural dependencies and ranking stability under ablations (e.g., excluding Turn 4). Claims regarding scale and robustness are revised to avoid overgeneralization. The evaluation protocol, jury methodology, and limitations are expanded to clarify assumptions and boundary conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 67%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02776 2026-04-06 cs.SE 67%

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

评估使用SLMs和提示工程进行代码生成的环境影响

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了基于SLMs的代码生成中不同提示策略对准确性和可持续性的影响,发现可持续性与准确性脱钩,提示工程可实现环保与性能的平衡。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10079 2026-03-31 cs.LG cs.AI cs.CL 67%

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts

稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈

Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05825 2026-03-31 cs.LG cs.AI cs.CL stat.ML 67%

Mitigating Premature Exploitation in Particle-based Monte Carlo for Inference-Time Scaling

缓解粒子基蒙特卡洛在推理时间扩展中的过早利用

Giorgio Giannone, Guangxuan Xu, Nikhil Shivakumar Nayak, Rohan Mahesh Awhad, Shivchander Sudalairaj, Kai Xu, Akash Srivastava

机构 * Core AI, IBM(IBM核心人工智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ePF算法,通过熵退火和前瞻性调节技术缓解粒子退化问题,提升粒子过滤在复杂数学推理任务中的性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG 67%

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22446 2026-03-25 cs.CL cs.AI cs.LG 67%

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

稀疏但关键:RLVR微调中LLMs分布偏移的token级分析

Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过token级分析揭示RLVR微调中分布偏移的机制,发现微调导致稀疏且针对性强的token分布变化,通过交叉采样实验验证了少量token决策对性能提升的关键作用。

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG 67%

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17832 2026-03-19 cs.CL cs.AI cs.LG 67%

Text-to-Stage: Spatial Layouts from Long-form Narratives

文本到舞台:从长篇叙述中生成空间布局

Jefferson Hernandez, Swarnadeep Saha, Chenxi Whitehouse, Sanjeel Parekh, Calvin Murdock, Yuliang Li, W. Owen Brimijoin, Vamsi Krishna Ithapu, Ishwarya Ananthabhotla

机构 * Rice University(里士大学) Meta FAIR Meta Reality Labs Research(Meta现实实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何通过语言模型从无结构文本推断戏剧舞台布局,提出确定性评估体系和结合拒绝SFT与RL的训练方法,在多个指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 67%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25084 2026-03-16 cs.CL cs.AI cs.IR cs.LG 67%

Scaling Generalist Data-Analytic Agents

放大通用数据分析代理

Shuofei Qiao, Yanqiu Zhao, Zhisong Qiu, Xiaobin Wang, Jintian Zhang, Zhao Bin, Ningyu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataMind,通过细粒度任务分类和递归易难任务组合机制,解决开源数据分析代理的数据不足、训练策略不当和代码多轮滚动不稳定问题,构建出性能优异的DataMind-14B和DataMind-7B代理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10195 2026-03-12 cs.CL cs.AI cs.LG 67%

Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models

适应性激活取消:用于大语言模型幻觉抑制的适应性激活取消

Eric Yocam, Varghese Vaidyan, Gurcan Comert, Paris Kalathas, Yong Wang, Judith L. Mwakalonge

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出适应性激活取消方法,通过实时干预减少大语言模型的幻觉问题,同时保持模型性能和生成质量。

Comments 19 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09052 2026-03-11 cs.AI cs.CL cs.LG 67%

From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring

从天到分钟:一个自主AI代理在远程患者监测中实现可靠的临床分诊

Seunghwan Kim, Tiffany H. Kung, Heena Verma, Dilan Edirisinghe, Kaveh Sedehi, Johanna Alvarez, Diane Shilling, Audra Lisa Doyle, Ajit Chary, William Borden, Ming Jack Po

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sentinel通过自主AI代理实现远程患者监测的高效分诊,超越个体医生的灵敏度,提供可扩展且临床可行的解决方案。

Comments 46 pages, 11 figures, Abstract in metadata is shortened to meet arXiv character limits; see PDF for full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08398 2026-03-10 cs.CL cs.AI cs.LG 67%

Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective

揭示大型语言模型中的行为可塑性:基于令牌条件的视角

Liyuan Mao, Le Yu, Jing Zhou, Chujie Zheng, Bowen Yu, Chang Gao, Shixuan Liu, An Yang, Weinan Zhang, JunYang Lin

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToCoRL框架,通过令牌条件强化学习使LLM在推理时实现稳定的行为适应,从而实现精确的行为控制。

Comments Work done during an internship at the Qwen Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22623 2026-02-27 cs.LG cs.AI cs.CL 67%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22207 2026-02-26 cs.CL cs.AI cs.LG 67%

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

译回翻译:高效管道用于自动翻译基准和数据集

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种高效自动化框架,用于高质量翻译多语言基准和数据集,以提升多语言AI评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21222 2026-02-26 cs.CL cs.AI cs.LG 67%

Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases

基于向量数据库相似性检索的任务感知LoRA适配器组合

Riya Adsul, Balachandra Devarangadi Sunil, Isha Nalawade, Sudharshan Govindan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于向量数据库相似性检索的LoRA适配器组合框架,通过动态合并适配器实现多任务学习,线性合并方法在PIQA和RTE任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20532 2026-02-25 cs.LG cs.AI cs.CL 67%

Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training

Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习

Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Caltech(加州理工学院) RPI(罗切斯特理工学院) MBZUAI(澳门大学人工智能研究院) University of Chicago(芝加哥大学) NEC Laboratories America(NEC美国实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACTOR-CURATOR通过策略改进带状机实现RL后训练的联合适应课程学习,有效提升训练稳定性和效率。

Comments 37 pages, 8 figures, 1 table. Preprint under review. Equal contribution by first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20332 2026-02-25 cs.CL cs.AI cs.LG 67%

No One Size Fits All: QueryBandits for Hallucination Mitigation

并非万能一种:用于缓解幻觉的QueryBandits

Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 QueryBandits通过在线学习优化查询重写策略,有效缓解闭源模型中的幻觉问题,优于传统静态策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08783 2026-02-24 cs.LG cs.AI cs.CL cs.NA math.NA 67%

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

CodePDE:基于LLM的PDE求解器生成推理框架

Shanda Li, Tanya Marwah, Junhong Shen, Weiwei Sun, Andrej Risteski, Yiming Yang, Ameet Talwalkar

机构 * Carnegie Mellon University(卡内基梅隆大学) Flatiron Institute(Flatiron研究院) Polymathic AI(多学科人工智能) Datadog

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CodePDE通过大语言模型生成PDE求解器,展示了LLM在复杂数学问题中的强大能力及潜在应用价值。

Comments TMLR. Code available at https://github.com/LithiumDA/CodePDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13035 2026-02-16 cs.LG cs.AI cs.CL 67%

Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL

向内看,向外探:通过分层强化学习从LLM内部状态学习温度策略

Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Introspective LLM通过分层强化学习从LLM内部状态学习温度策略,提升数学推理任务中的探索效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10329 2026-02-12 cs.CL cs.AI cs.LG 67%

Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality

更多令牌是否理性?语言模型推理时的扩展作为适应性资源理性

Zhimin Hu, Riya Roshan, Sashank Varma

机构 * Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过变量归因任务探讨语言模型在推理时扩展对资源理性的影响,发现模型能根据任务复杂性调整策略,即使无显式成本奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07276 2026-02-10 cs.AI cs.CL cs.LG 67%

Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs

Steer2Adapt:动态组合转向向量引发LLM高效适应

Pengrui Han, Xueqiang Xu, Keyang Xuan, Peiyang Song, Siru Ouyang, Runchu Tian, Yuqing Jiang, Cheng Qian, Pengcheng Jiang, Jiashuo Sun, Junxia Cui, Ming Zhong, Ge Liu, Jiawei Han, Jiaxuan You

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STEER2ADAPT通过动态组合转向向量实现LLM高效适应,适用于需要多协调能力的复杂任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20295 2026-02-06 cs.CL cs.AI cs.LG stat.ML 67%

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

SelfReflect: LLMs能否传达其内部答案分布?

Michael Kirchhof, Luca Füger, Adam Goliński, Eeshan Gunesh Dhekane, Arno Blaas, Seong Joon Oh, Sinead Williamson

机构 * Apple(苹果公司) Independent Researcher(独立研究者) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SelfReflect通过评估LLM内部信念分布与总结之间的信息论距离,发现现代LLM无法有效传达其不确定性,但通过多输出采样可生成忠实的不确定性总结。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18795 2026-02-04 cs.LG cs.AI cs.CL 67%

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

机构 * Meta Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏