arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1626 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1626 篇

2607.00862 2026-07-02 cs.CL cs.AI 新提交 62%

CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models

CAT:面向大型推理模型高效推理的置信度自适应思考

Qizhi Jiang, Shuo Wang, Pei Ke, Yuhang Song, Ke Qin

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省泛在智能与可信服务重点实验室)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出置信度自适应思考(CAT)框架,利用模型内在自确信信号作为置信度,通过偏好优化自主调节推理长度,在保持准确率的同时压缩简单问题的推理开销。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27617 2026-06-29 cs.CL cs.LG 新提交 62%

Masked Language Flow Models

掩码语言流模型

Iskander Azangulov, Kianoosh Ashouritaklimi, Leo Zhang, Simon Vary, Patrick Rebeschini

机构 * CC BY 4.0(知识共享署名4.0国际许可)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出掩码语言流模型(MLFM),通过连续随机插值将掩码机制融入流语言模型,实现并行生成与多步推理的平衡,首次将流模型扩展到推理和指令跟随任务。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26300 2026-06-26 cs.AI cs.CL 新提交 62%

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

验证地平线:编码智能体奖励没有银弹

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mingze Li, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu Wang, Yuheng Jing, Zeyao Ma, Zeyu Cui

机构 * Qwen Team(Qwen团队)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。

Comments Authors are listed alphabetically by their first names

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25000 2026-06-25 cs.LG cs.AI physics.geo-ph 新提交 62%

Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks

Geo-Strat-RL:从可验证任务中学习地质事件推理

Lukas Mosser

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21821 2026-06-23 cs.LG cs.CL 新提交 62%

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18327 2026-06-18 cs.LG cs.AI 新提交 62%

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Self-CTRL:基于强化学习的自一致性训练

Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Self-CTRL方法,通过强化学习优化语言模型自我解释与行为之间的一致性,在概率推理和宪法AI任务上显著提升一致性和安全性。

Comments 34 pages, 12 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15741 2026-06-16 cs.CL cs.AI 新提交 62%

A Self Consistency Based Reranking for Narrative Question Answering

基于自一致性的叙事问答重排序

Molham Mohamed, Ali Hamdi

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出自一致性重排序框架,通过生成多个候选答案并基于语义一致性选择最终答案,提升叙事问答的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15733 2026-06-16 cs.CL cs.AI 新提交 62%

Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning

Vernier: 探测因果推理中词汇间隙背后的表征错位

Zhenyu Yu

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过配对视图权重更新和激活修补,发现语言模型在因果推理中因变量名替换导致的答案差异源于表征错位而非信息丢失,并在Qwen和Llama模型上验证了反事实增强的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15589 2026-06-16 cs.LG cs.AI 新提交 62%

Is Code Better Than Language for Algorithmic Reasoning

算法推理中代码是否优于语言

Terry Tong, Yu Feng, Surbhi Goel, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过分离中间表示与执行机制,在40个任务上比较代码执行与自然语言推理,发现代码执行优势源于外部执行而非表示变化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09926 2026-06-10 cs.LG cs.AI 新提交 62%

Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling

在你挣扎处采样:通过熵引导的幂采样增强基础模型推理

Hong Guo, Nianhui Guo, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institut(霍普夫纳研究所) German University of Digital Science(德国数字科学大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07812 2026-06-09 cs.AI cs.CL 新提交 62%

Scaling Participation in Modular AI Systems

模块化AI系统中的参与扩展

Shangbin Feng, Yike Wang, Weijia Shi, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18532 2026-07-22 cs.CL 新提交 61%

Reasoning Fine-Tuning Induces Persistent Latent Policy States

推理微调诱导持久的潜在策略状态

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

机构 * University of Oxford(牛津大学) University of Utah(犹他大学)

专题命中 推理与问题求解 :language model(abstract,comments);分类 cs.CL

AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18011 2026-08-19 cs.CL 新提交 57%

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17981 2026-08-19 cs.LG 新提交 57%

Recirculation

再循环

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind) University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17151 2026-08-19 cs.CV cs.LG 新提交 57%

Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport

基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正

Xiang Li, Yuqi Wang, Casey C. Heirman, Jihye Heo, Kyle J. Lafata

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。

Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 57%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15687 2026-08-18 cs.AI 新提交 57%

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

THESIS-MoE:可训练的分层提取与混合专家模型中谄媚行为的引导

Kareem Hassani, Chaymaa Abbas, Lama Mawlawi, Mariette Awad

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出THESIS-MoE,通过共享对比信号定位MoE模型中谄媚行为的计算子电路,采用有条件干预方法,在保留知识的同时消除了高达90%的信念诱导谄媚行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15394 2026-08-18 cs.CL 新提交 57%

The Machine's Internal Clock: Do LLMs Share Human Temporal Illusions?

机器的内部时钟:大型语言模型(LLMs)是否会共享人类的时间错觉?

Catherine Bao, Vivek Srikumar

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本研究构建含5种错觉的6684个叙事对基准,发现人类仅在2种错觉中偏好预期场景,而14个LLMs在4种错觉中与文献预测一致,其一致性源于心理学研究检索而非类人时间偏差。

Comments 25 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15006 2026-08-18 cs.CV cs.AI cs.MM 新提交 57%

MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems

MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题

Penghao Yin, Haomin Wang, Qihong Tang, Xiaoye Qu, Hongjie Zhang, Xiao-Ping Zhang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14665 2026-08-18 cs.LG 新提交 57%

When Does the Best Sampling Temperature Rise with the Budget? Sufficient Conditions for Pass@k

最佳采样温度何时随预算升高?Pass@k的充分条件

Changsu Jeong

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 该研究针对使pass@k最大化的采样温度随预算升高的经验模式,给出了总体层面的形式化充分条件,推导了相关相图与核表示,构建了该现象的条件理论。

Comments Theory paper, 13 pages, 1 analytical figure. Deterministic verification code is included as ancillary material. No new language-model experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14420 2026-08-17 cs.LG 新提交 57%

More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It

更多正确质量,更差答案:幂采样为何会失效及如何修复

Haohui Yang, Jiaxing Sun, Xiujun Ma

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能 State Key Laboratory)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究发现幂采样存在悖论,即提升正确轨迹概率却降低下游推理性能,归因于剂量与覆盖不匹配,提出修复后的支持保留幂采样器可逆转损失并优于标准多采样推理。

Comments 16 pages, 8 figures, 1 table. Haohui Yang and Jiaxing Sun contributed equally. Xiujun Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 57%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12344 2026-08-14 cs.CL cs.CY stat.AP 新提交 57%

Predicting consumer-technology ownership without a diffusion history

基于扩散历史预测消费技术拥有情况

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。

Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12220 2026-08-13 cs.CV cs.AI 新提交 57%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 57%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 57%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 57%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10504 2026-08-12 cs.AI 新提交 57%

MEGA: Self-Evolving Agent Optimization Infrastructure via Wisdom Graph

MEGA:基于智慧图的自进化智能体优化基础设施

Jung Hwan Lee, Kyu Ho Lee, Gwang Hoon Yoo

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MEGA是一种自进化智能体优化基础设施,通过三层架构实现智慧积累、组合推理与自进化,可系统性优化异构智能体系统,将优化与知识进化融为一体。

Comments 29 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 57%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏