arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 61 篇

2606.03357 2026-06-03 cs.CL cs.AI 85%

The Unsampled Truth: Psychometrics in SLMs Measure Prompt Artifacts, Not Psychological Constructs

未抽样的真相:SLM 中的心理测量衡量的是提示伪影,而非心理构念

Nils Schwager, Christoph Hau, Simon Münker, Achim Rettinger

机构 * Trier University(特里尔大学)

专题命中 推理与问题求解 :SLM(title_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过提示变异框架分离语义信号与提示伪影,发现小型语言模型在心理测量中主要反映提示遵从性而非模拟心理特质,并提供了诊断工具。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03629 2026-06-03 cs.AI 84%

TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning

TSQAgent: 通过专用智能体推理评估时间序列数据质量

Shunyu Wu, Dan Li, Haozheng Ye, Weibin Feng, Jian Lou, Bo Zhang, Wenjie Feng, Chenjuan Guo, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) China University of Mining Technology(中国矿业大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TSQAgent框架,通过三个协作智能体(感知器、检查员、裁决者)识别相关质量维度并进行定量比较,显著提升LLM在时间序列数据质量评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04942 2026-06-03 cs.AI cs.LO 84%

Lemmanaid: Neuro-Symbolic Lemma Conjecturing

Lemmanaid: 神经符号引理猜想

Yousef Alhessi, Sólrún Halla Einarsdóttir, George Granberry, Emily First, Moa Johansson, Sorin Lerner, Nicholas Smallbone

机构 * Department of Computer Science and Engineering University of California, San Diego, USA(计算机科学与工程系,加州大学圣地亚哥分校) Department of Computer Science and Engineering Chalmers University of Technology & University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学及哥德堡大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 提出首个神经符号引理猜想工具LEMMANAID,通过类比数学理论生成引理,结合微调LLM与符号方法,在Isabelle测试集上优于纯神经和纯符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03460 2026-06-03 cs.CV 83%

From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring

从3D感知到安全推理:基于图的实时地下矿井监控框架

Pasindu Ranasinghe, Simit Raval, Dibyayan Patra, Bikram Banerjee, Ismet Canbulat

专题命中 推理与问题求解 :LLM(summary_cn,abstract);pretraining(abstract)

AI总结 提出一个结合3D语义感知、不确定性异常检测、规则检查、设备端LLM推理和GraphRAG记忆分析的连续监控框架,通过场景图和时序图实现结构化安全推理,在115个危险场景中达到93%的覆盖率和92.7%的感知精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-06-03 cs.CV cs.CL 83%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01075 2026-06-03 cs.CL 83%

On the Generalization Gap in Self-Evolving Language Model Reasoning

自进化语言模型推理中的泛化差距

Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby, Kan Yuan, Andrew Tomkins, Tu Vu, Da-Cheng Juan, Cyrus Rashtchian

机构 * Google Research(谷歌研究) Harvard University(哈佛大学) Google(谷歌) Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究严格闭环设置下自进化算法与完美监督之间的差距,发现多轮批评-修正策略可接近完美监督性能,但自进化仍存在非平凡差距。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06165 2026-06-03 cs.CL cs.AI 82%

UR$^2$: Unify RAG and Reasoning through Reinforcement Learning

UR$^2$:通过强化学习统一检索增强生成与推理

Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究机构(AIR),清华大学,北京,中国) School of Management Science & Information Engineering, Hebei University of Economics and Business, Hebei, China(管理科学与信息工程学院,河北经贸大学,河北,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出UR$^2$框架,通过强化学习动态协调检索与推理,结合难度感知课程和混合知识访问策略,在开放域问答、MMLU-Pro、医学和数学推理任务上优于现有基线,性能接近GPT-4o-mini和GPT-4.1-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11213 2026-06-03 cs.AI cs.CL 82%

FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration

FutureWeaver: 面向模块化协作的多智能体系统的测试时计算规划

Dongwon Jung, Peng Shi, Muhao Chen, Yi Zhang

机构 * University of California, Davis(加州大学戴维斯分校) University of Waterloo(滑铁卢大学) Greenshoe, Inc(Greenshoe公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出FutureWeaver框架,通过双层次规划架构和自诱导协作模块,在固定预算下优化多智能体系统的测试时计算分配,显著提升协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03782 2026-06-03 cs.CL 81%

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

基于语法的推理:合成语言推理轨迹能否增强低资源机器翻译?

Renhao Pei, Yihong Liu, Sampo Pyysalo, Hinrich Schütze, Shaoxiong Ji

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自动生成语言推理轨迹的方法,通过上下文学习、监督微调和强化微调评估其对低资源机器翻译的影响,发现推理轨迹在推理时指导效果显著,但作为训练数据收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16302 2026-06-03 cs.AI cs.IR 81%

DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA

DTKG: 用于多跳问答的双轨知识图谱验证推理框架

Changhao Wang, Yanfang Liu, Xinxin Fan, Ao Tian, Lanzhi Zhou, Yunfeng Lu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DTKG框架,通过分类阶段和分支处理阶段分别处理并行事实验证和链式多跳推理,提升多跳问答的效率和准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03152 2026-06-03 cs.DB 80%

Cost-Aware Optimization for Agentic Query Execution

面向代价的智能查询执行优化

Lunyiu Nie, Yilin Xia, Yiren Liu, Christopher Jermaine, Swarat Chaudhuri

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对LLM支持的查询执行中算子放置、顺序和粒度影响代价与质量的问题,提出EnumGRPO优化器,通过上下文强化学习从枚举计划中蒸馏启发式策略,在SWAN数据库上实现0.011美元/查询的LLM代价和35.4%的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03047 2026-06-03 cs.RO cs.MA 80%

ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control

ModuLoop: 使用模块化合成器和闭环调试器进行机器人控制的低级代码生成

Gina Yoon, Sumin Lee, Joo Yong Sim

机构 * Department of Mechanical Systems Engineering, Sookmyung Women’s University(苏州市女子大学机械系统工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出闭环模块化代码合成框架,利用预训练大语言模型进行模块化代码规划与生成,并通过迭代执行和调试探针实现系统调试与优化,成功应用于RGB-D相机与机械臂标定及抓取任务。

Comments IEEE Robotics and Automation Letters (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG 79%

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03986 2026-06-03 cs.CV 78%

NewtPhys: Do Foundation Models Understand Newtonian Physics?

NewtPhys: 基础模型理解牛顿物理学吗?

Sebastian Cavada, Soumava Paul, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(Valeo人工智能公司) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出NewtPhys,一个基于真实场景多视图图像和物理模拟的4D物理标注数据集,用于系统评估基础模型在低层次牛顿物理推理中的能力,揭示了现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03217 2026-06-03 stat.ML cond-mat.dis-nn cs.LG 77%

An Asymptotic Theory of Chain-of-Thought in In-Context Learning

上下文学习中思维链的渐近理论

Kaito Takanami, Cengiz Pehlevan

机构 * Department of Physics, Graduate School of Science, The University of Tokyo(东京大学物理系研究生院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学凯普勒人工智能研究 institute) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过高维随机矩阵理论,推导了线性回归中上下文学习思维链的泛化误差精确公式,揭示了推理深度、预训练数据量和上下文长度之间的相变现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03132 2026-06-03 cs.CL 77%

DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

DMT-CBT:面向CBT咨询的纵向治疗状态建模

Chang Liu, Shuyi Zhang, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DMT-CBT框架,通过跨会话结构化治疗状态、多模态行为基础与工具增强干预,解决现有方法将CBT咨询简化为局部回复生成的问题,实现纵向治疗状态动态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25902 2026-06-03 cs.LG 77%

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

读取微调先验:通过对比解码差异进行逐字内容恢复

Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Turin(都灵大学) University of Warsaw(华沙大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 提出对比解码差异(CDD)方法,仅基于输出层logit分布,无需权重或内部访问,即可从微调模型中逐字恢复植入事实,并在多种架构和场景下优于白盒方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17708 2026-06-03 cs.AI 77%

Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization

协同进化智能体架构与可解释推理用于自动化优化

Jiahao Huang, Peilan Xu, Xiaoya Nan, Wenjian Luo

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoOR-Agent协同进化框架,通过将智能体工作流表示为活动边网络,并利用图介导的路径条件重组、多粒度语义变异和精英种群更新,实现自动化优化中的自适应协调与可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03608 2026-06-03 cs.LG cs.AI 73%

Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

利用验证-生成差距:基于置信度条件的测试时强化学习

Jiahui Li, Jianfeng Shan, Wenpei Chen, Shunyu Wu, Jian Lou, Wenjie Feng, Dan Li, See-Kiong Ng

机构 * Sun Yat-Sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TTRL-CoCoV框架,通过置信度自适应机制解决无标签设置下Pass@k优化中的伪标签错误和多样性崩溃问题,显著提升Pass@1和Pass@k性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02994 2026-06-03 cs.AI cs.CL 73%

Inducing Reasoning Primitives from Agent Traces

从智能体轨迹中归纳推理原语

Zhihan Lei, Jiarui Yan, Joshua Momo, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出推理原语归纳方法,从ReAct智能体轨迹中挖掘并聚类常见推理步骤,构建伪工具库,在多个推理任务上显著提升性能。

Comments 22 pages including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02871 2026-06-03 cs.CL cs.AI 73%

Adaptive Latent Agentic Reasoning

自适应潜在智能推理

Dongwon Jung, Peng Shi, Yi Zhang, Junshan Zhang, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Waterloo(滑铁卢大学) Greenshoe, Inc.(Greenshoe公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出双模式框架ALAR,在常规决策步骤使用紧凑潜在推理,仅在需要深入思考时切换至显式思维链,在保持或提升任务准确率的同时显著减少生成令牌数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08977 2026-06-03 cs.LG cs.CL 73%

Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL

打破自我确认循环:诊断与缓解自奖励强化学习中的系统性奖励偏差

Chuyi Tan, Peiwen Yuan, Xinglin Wang, Yiwei Li, Shaoxiong Feng, Yueqi Zhang, Jiayi Shi, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过量化反馈回路偏差并提出集成奖励强化学习(RLER)方法,诊断并缓解了自奖励强化学习中由置信度耦合导致的系统性奖励偏差,从而提升性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03812 2026-06-03 cs.AI 70%

Enhancing Operational Safety via Agentic Dialogue Hazard Identification Analysis

通过智能体对话危害识别分析增强操作安全性

Sanjay Das, Ran Elgedawy, Ethan Seefried, Ryan Burchfield, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HAZDIAL框架,利用结构化多智能体多轮对话(对抗性辩论与建设性讨论)改进基于NLP的危害识别质量,并通过算法优化智能体交互,实验证明优于单次基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03768 2026-06-03 cs.CL 70%

HybridThinker: Efficient Chain-of-Thought Reasoning via Compressed Memory and Transient Thought Steps

HybridThinker: 通过压缩记忆和瞬态思考步骤实现高效的思维链推理

Xin Liu, Runsong Zhao, Xinyu Liu, Junhao Ruan, Pengcheng Huang, Shichao Dong, Chunyang Xiao, Chenglong Wang, Changliang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) China Unicom Cloud-Link(中国联通云链) NiuTrans Research(牛传研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出HybridThinker方法,通过保留压缩记忆和临时保留思考步骤,并采用混合训练方案,在保持推理准确性的同时显著压缩思维链长度。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03743 2026-06-03 cs.AI 70%

Proof-Refactor: Refactoring Generated Formal Proofs into Modular Artifacts

Proof-Refactor: 将生成的形式化证明重构为模块化工件

Yiming Fu, Peixuan Liu, Zichen Wang, Kun yuan

机构 * Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个名为 Proof-Refactor 的智能体框架,通过四阶段流程(提取候选证明片段、设计辅助声明、形式化证明提取和设计的组件、使用验证组件修复原始证明)将大语言模型生成的形式化证明重构为更模块化、可读、可维护和可重用的工件,在 PutnamBench 和 Putnam2025 上的 Lean 证明重构中优于基线。

Comments 21 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03458 2026-06-03 cs.LG 70%

KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks

KVarN: 方差归一化的KV缓存量化减轻推理任务中的误差累积

Lorenz K. Muller, Philippe Bich, Chiara Boretti, Hyun-Min Chang, Jiawei Zhuang, Lukas Cavigelli

机构 * Huawei(华为)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出KVarN,一种无校准的KV缓存量化方法,通过Hadamard旋转和双尺度方差归一化减少自回归解码中的量化误差累积,在2位精度下达到生成基准测试的最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03435 2026-06-03 cs.AI 70%

CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations

CP-Agent: 化学扰动下细胞形态学轮廓的上下文感知多模态推理

Yuxin Zhang, Yiyao Li, Ping Shu Ho, Simon See, Zhenqin Wu, Kevin Tsia

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Biomedical Engineering, The University of Hong Kong(香港大学生物医学工程学院) Nvidia AI Technology Center(NVIDIA人工智能技术中心) Advanced Biomedical Instrumentation Centre(先进生物医学仪器中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CP-Agent,一种基于上下文感知对齐模块CP-CLIP的多模态大语言模型,用于生成药物扰动下细胞形态变化的可解释机制性解释,实现高精度处理与机制区分(最大F1分数0.896),并整合工具使用与推理生成结构化报告以加速药物发现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03234 2026-06-03 cs.LG 70%

Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

正确即力量:对齐验证的隐藏状态增强强化学习推理

Ziyue Wang, Aomufei Yuan, Yongfu Zhu, Shuai Dong, Wenpu Liu, Yiran Yao, Weichu Xie, Yuqi Xu, Caoyuan Ma, Wenqi Shao, Xiaoying Zhang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JINGDONG(京东) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Tianjin University(天津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Hidden-Align辅助损失函数,在强化学习训练中对齐正确rollout在锚点token处的最后一层隐藏状态,提升数学推理性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03169 2026-06-03 cs.SD cs.LG cs.MM 70%

SketchSong: Hierarchical Song Generation with Sketch Planning and Fine-Grained Multi-Track Modeling

SketchSong: 基于草图规划与细粒度多轨建模的分层歌曲生成

Xiaoyue Duan, Nanxing Hu, Yutang Feng, Xudong Yan, Jiatao Chen, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯人工智能研究院)

专题命中 推理与问题求解 :post-training(abstract);preference optimization(abstract);分类 cs.LG

AI总结 提出分层歌曲生成框架SketchSong,通过歌曲级草图规划和细粒度多轨建模解决歌曲编排不连贯及声部建模粗糙问题,在客观指标和人工听测上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03066 2026-06-03 cs.AI 70%

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

CORE: 面向冲突的通用多模态篡改检测推理

Jinjie Shen, Yaxiong Wang, Yujiao Wu, Lechao Cheng, Tianrui Hui, Nan Pu, Zhihui Li, Zhun Zhong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CORE框架,通过构建冲突归因语料库和面向冲突的推理,增强多模态大语言模型的冲突捕捉能力,实现鲁棒且泛化的多模态篡改检测。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏