arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-23 至 2026-06-23 共收录 276 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 20 篇

2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交 92%

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21704 2026-06-23 cs.CL 新提交 87%

When Compression Helps and When It Hurts: Condition-Aware Analysis of Chain-of-Thought Distillation

何时压缩有益,何时有害:链式思维蒸馏的条件感知分析

Siyang Lyu, Zhijing Sun, Xinghao Chen, Tong Liu, Dawei Zhu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工高等研究院,宁波) Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) The Hong Kong Polytechnic University(香港理工大学) LMU Munich(慕尼黑大学) Saarland University(萨尔大学)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 通过系统实验揭示链式思维蒸馏中压缩方法的关键因素:重要性准则的粒度、重构级别和压缩预算在不同领域和模式下的影响,并给出条件感知的部署指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 85%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23181 2026-06-23 cs.AI cs.CL 新提交 84%

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART: 用于混合推理模型中免训练自适应思考预算的草案一致路由

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonseok Moon, Heuiseok Lim

机构 * Korea University(高丽大学) dot(42dot) Konkuk University(建国大学) Yonsei University(延世大学) Soongsil University(崇实大学) Kumoh National Institute of Technology(金乌国立技术学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出免训练路由框架DART,通过采样两个廉价无思考草案,当草案一致时直接回答,不一致时根据草案熵预测思考预算,在保持或提升准确率的同时大幅减少思考令牌使用。

Comments 15 pages, 4 figures, 16 tables. Code: https://github.com/js-lee-AI/DART

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22798 2026-06-23 cs.CL 新提交 83%

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号

Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-06-23 cs.AI cs.CL cs.LG stat.ML 新提交 82%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22716 2026-06-23 cs.AI cs.CL 新提交 81%

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

超越惩罚错误:通过自适应仅正确奖励稳定大型推理模型的效率训练

Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

机构 * Korea University(高丽大学) Soongsil University(崇实大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对GRPO中长度惩罚导致奖励崩溃的问题,提出ACOER方法,通过仅对正确回答给予简洁奖励并动态调整预算,在数学推理任务中准确率提升且生成token减少超60%。

Comments 13 pages, 3 figures, 7 tables. Code: https://github.com/js-lee-AI/ACOER

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交 79%

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19120 2026-06-23 cs.LG cs.CV 新提交 79%

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏

Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出ViGOS框架,通过解耦感知和推理,在MLLM后训练中避免文本捷径,提升图像依赖行为。

Comments 29 pages, 5 figures, 8 tables; Project page: https://oedosoldier.github.io/ViGOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 75%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23567 2026-06-23 cs.LG cs.AI 新提交 62%

Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

调度思维:在扩散语言模型中学习思维的顺序

Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出自感知调度(SAS),通过策略优化学习扩散语言模型中的去掩码顺序,显著提升Sudoku和数学推理任务的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 62%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06021 2026-06-23 cs.LG cs.AI 版本更新 62%

OPRD: On-Policy Representation Distillation

OPRD: 在线策略表示蒸馏

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Haobo Wang, Mingxuan Xia, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Junbo Zhao, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中输出空间监督的采样方差和忽略中间隐藏状态的问题,提出OPRD方法,通过在隐藏状态空间对齐师生表示,消除采样方差、提供更丰富的逐层结构信息,并在AIME等基准上缩小师生差距,训练速度提升1.44倍,内存减少54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21166 2026-06-23 cs.LG cs.AI 版本更新 62%

The Ratchet Effect in Silico: How Interaction Drives Cumulative Intelligence in Large Language Models

通过交互驱动的累积智能在大语言模型中实现的“棘轮效应

Ren Zhuang

机构 * School of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出POLIS框架,通过异质智能体之间的交互实现知识积累,展示出在数学推理任务中,群体模型的性能提升显著。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05520 2026-06-23 cs.LG cs.CL 版本更新 62%

Efficient Reinforcement Finetuning via Adaptive Curriculum Learning

通过自适应课程学习的高效强化微调

Taiwei Shi, Yiyang Wu, Linxin Song, Tianyi Zhou, Jieyu Zhao

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出AdaRFT方法,通过自适应课程学习动态调整训练问题难度,提升强化微调效率,在数学推理任务上训练时间减半。

Comments Published in Transactions on Machine Learning Research (TMLR). 30 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16312 2026-06-23 cs.AI cs.CL 版本更新 62%

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 57%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20713 2026-06-23 cs.AI 新提交 57%

FairTutor: Equity-Aware Pedagogical LLM Routing for Budget-Constrained AI Tutoring

FairTutor: 预算受限AI辅导中的公平感知教学LLM路由

Qingyang Xu

机构 * Independent researcher, Shanghai, China(独立研究者,上海,中国)

专题命中 数学推理 :planning(abstract);分类 cs.AI

AI总结 提出FairTutor框架,通过教学驱动的多智能体编排实现成本效益AI辅导,在降低71.6%服务成本的同时达到97.1%的优质教学质量,并引入AIED优势差距指标衡量公平性。

Comments AI for Education Day at SIGKDD 2026, 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20643 2026-06-23 cs.AI cs.CV 新提交 57%

SPARC: A Multi-Agent System for Electrical Circuit Question Answering

SPARC:用于电路问答的多智能体系统

Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia, Nishat Shawrin, Ang Chen, Amrita Roy Chowdhury

机构 * University of Michigan(密歇根大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17999 2026-06-23 cs.CL 新提交 57%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 16 篇

2606.20895 2026-06-23 cs.AI 新提交 81%

Neurosymbolic Clinical Trial Matching via LLM-Driven Abduction and Logical Verification

基于LLM驱动溯因与逻辑验证的神经符号临床试验匹配

Baiyang Qu, Leonardo Ranaldi, Xi Wang, Marco Valentino

机构 * University of Leicester(莱斯特大学) University of Edinburgh(爱丁堡大学) University of Sheffield(谢菲尔德大学)

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型与逻辑验证的神经符号框架αNeSy-CTM,通过溯因推理处理噪声和不完整临床文本,在临床试验匹配中相对零样本基线提升30%准确率。

Comments 21 pages (including appendix), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21867 2026-06-23 cs.AI cs.CL cs.SC 新提交 81%

ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation

ForEx:逻辑谬误检测与可解释推理的形式验证框架

Pei-Cing Huang, Chienyu Liu, Chan Hsu, Ci-Siang Chen, Pei-Ju Lee, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) National Chung Hsing University(中国科技大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ForEx框架,将LLM生成的解释翻译为Lean4并验证其形式可推导性,通过论证验证矩阵区分标签一致性与形式验证状态,揭示形式可推导性与标签一致性之间的系统性差距。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 79%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20881 2026-06-23 cs.AI 新提交 79%

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

内在奖励何时对代码推理有效?一项全面研究

Xiaolong Jin, Xuandong Zhao, Wenbo Guo, Xiangyu Zhang, Dawn Song

机构 * Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。

Comments 18 pages, 45 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14345 2026-06-23 cs.CR cs.AI 版本更新 70%

AXE: Grey-Box Exploitability Confirmation for Localized Vulnerability Reports

AXE:针对局部漏洞报告的灰盒可利用性确认

Amirali Sajadi, Tu Nguyen, Kostadin Damevski, Preetha Chatterjee

机构 * Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出多智能体框架AXE,利用CWE分类和代码位置等轻量级元数据,通过解耦规划、代码探索和动态执行反馈实现Web漏洞利用,在CVE-Bench上达到30%成功率,比黑盒基线提升3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交 62%

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20740 2026-06-23 cs.CL cs.LG 新提交 62%

VeriBound: PAC-Bayesian Generalization Bounds for Process Reward Models Trained with Formal Verification Tools

VeriBound: 使用形式验证工具训练的过程奖励模型的PAC-Bayesian泛化界

Amirul Rahman, Mohammed Sabih Alsharari

机构 * University of Malaya(马来亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对形式验证工具标注的过程奖励模型(PRM)缺乏理论解释的问题,提出VeriBound框架,给出PAC-Bayesian泛化界、样本复杂度、收敛速率及下游Best-of-K性能的误差传播界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20642 2026-06-23 cs.AI cs.LG cs.LO math.ST stat.TH 新提交 62%

Hypothesis-Disciplined Multi-Agent Automated Formalization of Asymptotic Statistical Theory

假设约束的多智能体自动形式化渐近统计理论

Tingzhou Wei, Zeyu Zheng, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Mathematical Sciences, Carnegie Mellon University(卡内基梅隆大学数学科学系) Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院生物统计系)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种假设约束的多智能体Lean 4形式化流程,通过七个专业角色协调工作,实现渐近统计理论中参数和半参数模型的形式化,确保公理干净且忠实于原文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 57%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22495 2026-06-23 cs.AI 新提交 57%

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Grounded Scaling: 为什么代理型AI需要确定性环境

Liang Ding, Xintong Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏