arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 38 篇

2605.07123 2026-05-11 cs.LG 70%

Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought

基于思维链的上下文强化学习的收敛与涌现

Zixuan Xie, Xinyu Liu, Rohan Chandra, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文探讨了思维链如何增强上下文强化学习的能力,通过线性Transformer分析证明思维链生成等同于时间差分学习更新,并展示策略评估误差随思维链长度减少而收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06997 2026-05-11 cs.LG 70%

Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators

Echo:无KV缓存的关联回忆与谱Koopman算子

Anupama Sridhar, Alexander Johansen

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 Echo通过谱Koopman算子实现无KV缓存的关联回忆,解决了传统Transformer的内存瓶颈问题,在多个基准测试中展现出卓越的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 67%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 67%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 推理评测 :reasoning(abstract,abstract_cn)

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22831 2026-05-11 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs

反向影响审计揭示大语言模型道德选择中的隐藏结构

Phil Blandfort, Tushar Karayil, Alex McKenzie, Urja Pawar, Robert Graham, Dmitrii Krasheninnikov

机构 * Predictably Weird Independent AE Studio

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向影响审计发现,短上下文提示使LLM道德选择率变化12-18个百分点,揭示基线评分遗漏的结构,且部分显著效应出现反向效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07305 2026-05-11 cs.CL cs.AI 62%

MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs

MedAction:迈向主动多轮临床诊断LLMs

Hsin-Ling Hsu, Zizheng Wang, Donghua Zhang, Nai-Chia Chen, Jerry Wang, Jun-En Ding, Chia-Hsuan Hsu, Guoan Wang, Feng Liu, Fang-Ming Hung, Chenwei Wu, Liyue Shen

机构 * National Chengchi University(国立中正大学) Georgetown University(乔治城大学) University of Michigan(密歇根大学) Stevens Institute of Technology(史蒂文斯理工学院) National Taiwan University of Science and Technology(台湾科技大学) Far Eastern Memorial Hospital(东方纪念医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedAction,通过LLM与环境交互生成高质量多轮诊断轨迹,解决现有模型在动态证据下推理不足的问题,提升开源医疗LLMs性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15567 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph 62%

Evaluating Large Language Models in Scientific Discovery

评估大型语言模型在科学发现中的表现

Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan

机构 * Deep Principle(深原则) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) QuEra Computing Inc.(QuEra计算公司) Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) Harvard Law School(哈佛法学院) Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) Department of Physics, Tsinghua University(物理系,清华大学) Institute for Advanced Study, Tsinghua University(清华大学高级研究所) Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07640 2026-05-11 cs.CV cs.AI 57%

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

LithoBench:用于遥感岩石学解释的大型多模态模型基准测试

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院) PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LithoBench,一个用于评估遥感岩石学解释中地质语义理解的多级基准,包含10000个专家标注实例,涵盖12种岩石类型,通过专家反馈的半自动化流程提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07533 2026-05-11 cs.CL 57%

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

为何大语言模型在低资源翻译中失败?解析大语言模型在机器翻译中的令牌动态

Shenbin Qian, Yves Scherrer

机构 * Language Technology Group, Department of Informatics University of Oslo(奥斯陆大学语言技术组,信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过分析15种模型在22种语言对上的表现,发现非英语语言对翻译质量较低,引入令牌激活率指标揭示语言表示与翻译性能的关系,指出推理模型在低TAR语言中生成更多令牌可能补偿性能差异。

Comments Accepted to the 26th Annual Conference of the European Association for Machine Translation (EAMT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 57%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07422 2026-05-11 cs.SE cs.AI 57%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 57%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07114 2026-05-11 cs.LG 57%

Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

在何处分配 rollout:用于基于组的 RLVR 的 hit-utility 优化 rollout 分配

Tao Wang, Shuo Li, Yan Sun, Dongsheng Ding, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出 HORA 方法,通过最大化 hit-utility 提升 RLVR 的效率,实验证明其在多个基准上优于 GRPO,且兼容其他组基估计器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07112 2026-05-11 cs.AI cs.MA 57%

Switchcraft: AI Model Router for Agentic Tool Calling

Switchcraft:面向代理工具调用的AI模型路由

Sharad Agarwal, Pooria Namyar, Alec Wolman, Rahul Ambavat, Ankur Gupta, Qizheng Zhang

机构 * Microsoft Research(微软研究院) Stanford(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Switchcraft是首个面向代理工具调用优化的模型路由系统,通过选择成本最低且正确的模型,降低推理成本达84%,同时保持准确率与最佳单个模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 57%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06707 2026-05-11 cs.SE cs.AI 57%

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

单文件测试:一项纵向的公共接口评估,评估首次输出LLM网页生成与社交传播跟踪

Diego Cabezas Palacios

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过8周的观察比较,评估了17项公共实验中收集的68个单文件HTML生成,比较了GPT、Gemini、Grok和Claude四种推理模型家族在固定公共接口协议下的表现,发现Claude在性能和一致性上表现最佳,但模型家族对代码冗余的影响大于提示词内容。

Comments 23 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19254 2026-05-11 cs.CL 57%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 57%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00780 2026-05-11 cs.SE 50%

Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems

语言模型能否超越编程?评估语言模型构建现实系统的能力

Chenyu Zhao, Shenglin Zhang, Zeshun Huang, Weilin Jin, Yongqian Sun, Dan Pei, Chaoyun Zhang, Qingwei Lin, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Build-bench基准,评估语言模型在跨指令集架构迁移中修复构建失败的能力,发现当前模型最大成功率为63.19%,并揭示了不同模型在工具使用上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07466 2026-05-11 cs.CV 50%

A Unified Framework for the Detection and Classification of Fatty Pancreas in Ultrasound Images

一种用于超声图像中脂肪性胰腺检测与分类的统一框架

Ioan-Tudor-Alexandru Anghel, Ciprian-Mihai Ceausescu, Elena Dana Nedelcu, Elena Raluca Stirban, Camelia Croitoru, Despina Ungureanu, Ana Maria Palan, Gabriela Pop

机构 * Faculty of Mathematics and Computer Science, University of Bucharest(布加勒斯大学数学与计算机科学学院) Ponderas Academic Hospital, Radiology(波内拉斯学术医院放射科) Ponderas Academic Hospital, Internal Medicine(波内拉斯学术医院内科) Ponderas Academic Hospital, Gastroenterology(波内拉斯学术医院胃肠病科) Emergency Clinical Hospital Bucharest, Radiology Department(布加勒斯急救临床医院放射科)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种端到端框架,通过分割引导的纹理分析自动分类正常与脂肪性胰腺,采用TransUNet架构结合ResNet和Transformer,实现胰腺和脾静脉分割,并通过纹理比较进行分类,验证了在无标注数据下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 50%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 50%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 50%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 19 篇

2605.06819 2026-05-11 cs.LG 86%

A Theory of Online Learning with Autoregressive Chain-of-Thought Reasoning

在线学习中自回归链式推理理论

Ilan Doron-Arad, Idan Mehalel, Elchanan Mossel

机构 * MIT(麻省理工学院) The Hebrew University(希伯来大学)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(title);分类 cs.LG

AI总结 本文研究自回归生成过程中的在线学习问题,探讨反馈形式对学习误差界的影响,证明在链式推理模型中可消除生成步数依赖,提出最优误差界及新下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01290 2026-05-11 cs.LG 85%

ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models

ThinKV: 基于思维适应的KV缓存压缩以提高推理模型效率

Akshat Ramachandran, Marina Neseem, Charbel Sakr, Rangharajan Venkatesan, Brucek Khailany, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA Research(NVIDIA研究)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出ThinKV,通过混合量化-驱逐策略,根据思维重要性动态调整token精度,减少KV缓存占用,提升推理效率和吞吐量。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07307 2026-05-11 cs.CL 83%

Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts

重新审视密集顺序链:推理语言模型可以从稀疏、顺序打乱的思维链中提取答案

Yi-Chang Chen, Feng-Ting Liao, Da-shan Shiu, Hung-yi Lee

机构 * MediaTek Research(联发科技研究) Artificial Intelligence Center of Research Excellence, National Taiwan University(台湾大学人工智能研究中心)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文挑战了密集顺序思维链的假设,通过系统干预发现顺序不重要、信息不全且结构鲁棒,为并行化和高效推理生成开辟了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 81%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19669 2026-05-11 cs.CL 79%

DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference

DiffAdapt:面向令牌高效大语言模型推理的难度自适应推理

Xiang Liu, Xuming Hu, Xiaowen Chu, Eunsol Choi

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DiffAdapt框架,通过分析推理轨迹中的熵分布,根据问题难度选择不同的推理策略,减少令牌使用量,提升推理效率。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07182 2026-05-11 cs.LG 79%

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic:多模型一体的推理LLM及其高效预算控制

Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Star Elastic方法,通过单次训练任务添加多个嵌套子模型,降低训练成本并解决静态架构的刚性问题,实现动态预算控制,提升推理准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏