arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2605.08011 2026-05-11 cs.AI stat.CO 86%

Abductive Reasoning with Probabilistic Commonsense

基于概率常识的归纳推理

Joseph Cotnareanu, Chiara Roverato, Han Zhou, Didier Chetelat, Yingxue Zhang, Mark Coates

机构 * International Laboratory on Learning Systems(学习系统国际实验室) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PACS算法,通过LLM和形式求解器结合,建模常识认知的个体差异,提升大语言模型的归纳推理能力。

Journal ref Proceedings of the International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07568 2026-05-11 cs.CV cs.CL 86%

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

追踪时间之箭:诊断视频大语言模型中的时间信息流

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa

机构 * The University of Osaka(大阪大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(信息与通信技术国家研究所) Kyoto University(京都大学) NII LLMC(日本信息处理学会LLMC)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究视频大语言模型(Video-LLMs)中时间信息流的瓶颈问题,通过分析编码器、投影器和LLM的结构,发现视频中心编码器能有效编码时间信息,但投影器设计影响信息传递,改进后模型在时间推理任务中表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 86%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 86%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 84%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 84%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07600 2026-05-11 cs.LG cs.AI cs.CL 83%

Mathematical Reasoning via Intervention-Based Time-Series Causal Discovery Using LLMs as Concept Mastery Simulators

通过基于干预的时间序列因果发现进行数学推理:利用LLMs作为概念掌握模拟器

Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CIKA框架,利用LLM自身作为干预模拟器,通过干预能力探针区分因果相关概念,提升数学推理能力。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22831 2026-05-11 cs.LG cs.AI cs.CL cs.CV cs.CY 83%

Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs

反向影响审计揭示大语言模型道德选择中的隐藏结构

Phil Blandfort, Tushar Karayil, Alex McKenzie, Urja Pawar, Robert Graham, Dmitrii Krasheninnikov

机构 * Predictably Weird Independent AE Studio

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向影响审计发现,短上下文提示使LLM道德选择率变化12-18个百分点,揭示基线评分遗漏的结构,且部分显著效应出现反向效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07307 2026-05-11 cs.CL 83%

Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts

重新审视密集顺序链:推理语言模型可以从稀疏、顺序打乱的思维链中提取答案

Yi-Chang Chen, Feng-Ting Liao, Da-shan Shiu, Hung-yi Lee

机构 * MediaTek Research(联发科技研究) Artificial Intelligence Center of Research Excellence, National Taiwan University(台湾大学人工智能研究中心)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文挑战了密集顺序思维链的假设,通过系统干预发现顺序不重要、信息不全且结构鲁棒,为并行化和高效推理生成开辟了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL 83%

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21839 2026-05-11 cs.CY cs.AI cs.GT cs.LG 82%

Test-Time Compute Games

测试时计算博弈

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·普拉特纳研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型作为服务市场的社会效率问题,提出反第二种价格拍卖机制以减少计算量浪费,通过实验验证了该机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07776 2026-05-11 cs.LG cs.AI cs.CL 82%

Tracing Uncertainty in Language Model "Reasoning"

追踪语言模型推理中的不确定性

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Frellsen

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根技术大学数据科学部门) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心MaiNLP) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过不确定性量化分析语言模型推理轨迹,发现其不确定性特征可预测最终答案正确性,且早期即可检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 81%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 81%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16130 2026-05-11 cs.HC cs.AI 81%

Replicating Human Motivated Reasoning Studies with LLMs

用LLMs复制人类动机性推理研究

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究通过复制四项政治动机性推理研究,发现基础LLM行为与人类行为不一致,且不同模型在回避回答和整合论点方面有相似表现,表明基础LLM可能不模拟人类动机性推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06859 2026-05-11 cs.LG cs.AI 81%

Exact Is Easier: Credit Assignment for Cooperative LLM Agents

精确更简单:合作大语言模型代理的信用分配

Yanjun Chen, Yirong Sun, Hanlin Wang, Jinghan Wang, Xinming Zhang, Xiaoyu Shen, Wenjie Li, Wei Zhang

机构 * Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07260 2026-05-11 cs.LG cs.CL 81%

When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

专家误路由何时发生?混合专家语言模型中的反事实路由分析

Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了混合专家模型中路由选择的质量评估,发现标准路由在自信 token 上表现良好,但在脆弱 token 上存在误分配问题,通过更新路由层可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI 79%

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :post-training(title);LLM(abstract);分类 cs.AI

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO 78%

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL 77%

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09782 2026-05-11 cs.LG cs.AI cs.CL 75%

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

在RLVR中采用梯度保持视角实现灵活熵控制

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。

Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13351 2026-05-11 cs.CL cs.AI cs.LG 75%

Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks

直接推理优化:基于推理反射的令牌级推理与评分门控用于不可验证任务

Yifei Xu, Tusher Chakraborty, Srinagesh Sharma, Leonardo Nunes, Swati Sharma, Kate Drakos Demopulos, Emre Kıcıman, Songwu Lu, Ranveer Chandra

机构 * Microsoft(微软公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种约束强化学习框架,通过令牌级推理反射奖励和评分门控优化不可验证任务的推理质量与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08057 2026-05-11 cs.CL cs.AI 73%

CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation

CA-SQL:基于探索与计算预算分配的文本到SQL推理方法

James Petullo, Nianwen Xue

机构 * Brandeis University(布雷纳大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 CA-SQL通过动态扩展探索广度和自定义提示种子方法,提升文本到SQL任务在Bird-Bench基准中的表现,达到51.72%的挑战性问题得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07654 2026-05-11 stat.ML cs.CL cs.LG 73%

Reliable Chain-of-Thought via Prefix Consistency

通过前缀一致性提升可靠性的链式思维

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

机构 * Nagoya University(名古屋大学) Nara Institute of Science and Technology(奈良科学技術大學) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP(理化学研究所(AIP))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过前缀一致性来提升链式思维的可靠性,利用再生过程中答案的重复频率作为权重,无需访问token对数概率或自我评价提示,在多个模型和基准测试中表现出色,减少至21倍的token使用量。

Comments See our project page at https://naoto-iwase.github.io/prefix-consistency-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI 73%

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09629 2026-05-11 cs.AI cs.LG 73%

End-to-end PDDL Planning with Hardcoded and Dynamic Agents

端到端PDDL规划与硬编码和动态智能体

Emanuele La Malfa, Ping Zhu, Samuele Marro, Sara Bernardini, Michael Wooldridge

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Oxford(牛津大学工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个端到端框架,通过验证器支持规划。协调器接收自然语言规范,转换为PDDL模型,子模块(智能体)迭代优化规划需求。支持硬编码和动态智能体,最终计划转换为自然语言。

Comments Code: https://github.com/EmanueleLM/MultiAgentPlanning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07248 2026-05-11 cs.CL cs.LG 73%

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04850 2026-05-11 cs.CL cs.AI 73%

Detecting Distillation Data from Reasoning Models

从推理模型中检测蒸馏数据

Hengxiang Zhang, Hyeong Kyu Choi, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于输出token概率偏差的检测方法,用于识别推理模型蒸馏数据中的问题,通过量化生成token与高置信度参考概率的偏差,提升检测性能,实验表明在蒸馏数据集上AUC提升达31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV 71%

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

专题命中 推理与问题求解 :foundation model(title)

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08070 2026-05-11 cs.AI 70%

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏