arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-27 至 2026-04-27 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2604.22597 2026-04-27 cs.AI 88%

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

机构 * Tel-Aviv University(特拉维夫大学) Amazon Prime Video(亚马逊Prime视频) Ben-Gurion University(巴内尔·戈里翁大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21935 2026-04-27 cs.AI cs.LG 81%

Math Takes Two: A test for emergent mathematical reasoning in communication

数学需要两个:一种评估交流中涌现数学推理的测试

Michael Cooper, Samuel Cooper

机构 * Cooper Cognitive(Cooper认知)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Math Takes Two基准测试,通过两个无先验数学知识的智能体交流,评估模型在视觉任务中通过发现潜在结构来发展抽象概念的能力。

Comments Accepted at HCAIR workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05038 2026-04-27 cs.CL 79%

Toward Automated Robustness Evaluation of Mathematical Reasoning

迈向数学推理的自动化鲁棒性评估

Yutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Ma Shuguang, Zhaoqian Dai, Hailiang Huang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Math Stress Tester框架,通过多轮重写验证循环生成对抗样本,提升数学推理任务的鲁棒性评估能力,并验证其在非数学任务中的扩展性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16989 2026-04-27 cs.CL cs.AI cs.LG cs.LO 67%

Bolzano: Case Studies in LLM-Assisted Mathematical Research

Bolzano:大语言模型辅助数学研究的案例研究

Martin Balko, Jan Grebík, Pavel Hubáček, Martin Koutecký, Matěj Kripner, Václav Rozhoň, Robert Šámal, Adrián Zámečník

机构 * Computer Science Institute, Charles University(查尔斯大学计算机科学研究所) Institute of Mathematics, Czech Academy of Sciences(捷克科学院数学研究所) Institute of Formal and Applied Linguistics, Charles University(查尔斯大学形式与应用语言学研究所) Department of Applied Mathematics, Charles University(查尔斯大学应用数学系)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过八个数学和理论计算机科学问题,展示Bolzano系统如何通过多代理交互生成可发表的研究成果,其中五项几乎完全自主完成。

Comments 33 pages, 1 figure. Project page: https://bolzano.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22438 2026-04-27 cs.CR cs.AI cs.CL 62%

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

SSG: 用于LLM水印的对数平衡词汇分区

Chenxi Gu, Xiaoning Du, John Grundy

机构 * AllenG-L

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSG方法,通过对数平衡词汇分区提升水印检测效果,针对低熵场景改进水印强度下界。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2604.22601 2026-04-27 cs.SE cs.AI 57%

From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification

从自然语言到验证代码:迈向借助Dafny基于形式验证的AI辅助问题到代码生成

Md Erfan, Md Kamal Hossain Chowdhury, Ahmed Ryan, Md Rayhanur Rahman

机构 * Department of Computer Science, The University of Alabama(阿拉巴马大学计算机科学系) The University of Alabama(阿拉巴马大学) Alabama Water Institute, The University of Alabama(阿拉巴马水研究院,阿拉巴马大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文提出NL2VC-60数据集,通过分层提示策略评估不同LLM在形式验证中的表现,发现结构化提示和迭代反馈能显著提升验证成功率,证明开放权重LLM可用于高可靠软件开发。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2604.22062 2026-04-27 cs.CL 83%

Incentivizing Neuro-symbolic Language-based Reasoning in VLMs via Reinforcement Learning

通过强化学习激励基于神经符号语言的视觉语言推理

Karthic Palaniappan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文基于Qwen3-VL-2B-Instruct模型,通过强化学习提升视觉语言模型的神经符号语言推理能力,在数学、科学和常识问题上准确率提升3.33%,推理令牌减少75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 79%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12979 2026-04-27 cs.CL 70%

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check

扩散语言模型在代理工作流中的苦涩教训:全面的现实检验

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

机构 * Southeast University(东南大学) Alibaba(阿里巴巴) Southeast University Shenzhen Research Institute(东南大学深圳研究院) College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文评估了扩散语言模型在代理任务中的表现,发现其在长期规划和工具调用任务中存在系统性失败,提出需整合因果推理机制以提升代理能力。

Comments ACL 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 13 篇

2604.22156 2026-04-27 cs.LG cs.CV 83%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22560 2026-04-27 cs.CV cs.AI 81%

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影

Gautam Kumar Jain, Carsten Markgraf, Julian Stähler

机构 * Technische Hochschule Augsburg(亚琛工业大学)

专题命中 规划推理 :reasoning(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。

Comments 16 pages, 8 figures, 8 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22266 2026-04-27 cs.CL 70%

Large Language Models Decide Early and Explain Later

大语言模型早决策晚解释

Ayan Datta, Zhixue Zhao, Bhuvanesh Verma, Radhika Mamidi, Mounika Marreddy, Alexander Mehler

机构 * University of Sheffield, UK(谢菲尔德大学,英国) Goethe University, Frankfurt am Main, Germany(法兰克福歌德大学,德国)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究发现大语言模型在生成过程中,只有32%的查询在中间阶段改变最终答案,且稳定后生成额外760个推理token。通过早停策略可减少500个token使用,仅导致2%的准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22256 2026-04-27 cs.SC cs.AI 70%

A Probabilistic Framework for Hierarchical Goal Recognition

基于概率的层次目标识别框架

Chenyuan Zhang, Katherine Ip, Hamid Rezatofighi, Buser Say, Mor Vered

机构 * Monash University(蒙纳士大学) The University of Melbourne(墨尔本大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于规划的概率框架,用于层次目标识别,结合层次任务网络结构与概率推理,提升目标识别性能。

Comments Accepted by KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22199 2026-04-27 cs.RO cs.AI 70%

An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments

基于大语言模型的闭环自主学习框架:面向机器人在开放环境中处理未覆盖任务

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息学院计算机学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的闭环自主学习框架,使机器人在开放环境中自主处理未覆盖任务,通过闭环学习减少对大语言模型的依赖,提升任务执行效率和本地知识库的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21375 2026-04-27 cs.CL cs.AI cs.SE 62%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00931 2026-04-27 cs.AI cs.HC cs.LG 62%

Explanation through Reward Model Reconciliation using POMDP Tree Search

通过POMDP树搜索实现奖励模型协调以进行解释

Benjamin D. Kraske, Anshu Saksena, Anna L. Buczak, Zachary N. Sunberg

机构 * Department of Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过POMDP树搜索协调算法与用户隐式奖励模型差异,以提升用户对AI系统的信任度。

Journal ref IEEE ICAA (2023), pg. 137-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22446 2026-04-27 cs.AI 57%

From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company

从技能到人才:将异构智能体组织成现实世界的企业

Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin Luo, Jun Wang

机构 * HUAWEI Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院) University Liverpool(利物浦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出OneManCompany框架,通过引入Talent市场和E²R树搜索,将多智能体系统提升至组织层面,实现动态招聘和自适应改进,提升任务完成效率。

Comments 33 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22428 2026-04-27 cs.AI 57%

CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease

CognitiveTwin: 用于预测阿尔茨海默病认知衰退的稳健多模态数字孪生

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial & Manufacturing Eng.(机械、工业与制造工程系) The University of Toledo(托莱多大学) Department of Industrial Eng. and Mngt. Systems(工业工程与管理系统系) University of Central Florida(中央佛罗里达大学) Department of Statistics and Data Science(统计与数据科学系) Department of Internal Medicine(内科医学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 CognitiveTwin通过融合多模态纵向数据预测个体认知轨迹,展现高准确性和公平性,对缺失数据具有鲁棒性,适用于临床试验和个性化医疗。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14287 2026-04-27 cs.LG 57%

Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents

链式记忆:轻量级记忆构建与动态演化用于大语言模型代理

Xiucheng Xu, Bingbing Xu, Xueyun Tian, Zihe Huang, Rongxin Chen, Yunfan Li, Huawei Shen

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CoM框架,通过轻量级记忆构建与动态演化机制,提升LLM代理的持久知识维护与长周期决策能力,实验显示在LongMemEval和LoCoMo基准上准确率提升7.5%-10.4%,计算开销降低2.7%-6.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03294 2026-04-27 cs.CR cs.AI 57%

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

AgentMark:用于代理的效用保持行为水印

Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huaqiao University(华侨大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。

Comments Accepted to ACL 2026 (Main, Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16853 2026-04-27 cs.CY cs.AI 57%

Agentic Inequality

代理不平等

Matthew Sharp, Omer Bilgin, Iason Gabriel, Lewis Hammond

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所) Access Partnership University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) Cooperative AI Foundation(协作人工智能基金会)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了AI代理在政治经济中的影响,定义了代理不平等的概念,并分析了其成因与治理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22715 2026-04-27 cs.RO 50%

ATRS: Adaptive Trajectory Re-splitting via a Shared Neural Policy for Parallel Optimization

ATRS: 一种通过共享神经策略实现的自适应轨迹重划分用于并行优化

Jiajun Yu, Guodong Liu, Li Wang, Pengxiang Zhou, Wentao Liu, Yin He, Chao Xu, Fei Gao, Yanjun Cao

机构 * IEEE Robotics and Automation Letters(IEEE机器人与自动化 letters)

专题命中 规划推理 :planning(abstract)

AI总结 ATRS通过共享深度强化学习策略改进并行ADMM循环,实现自适应调整,提升收敛速度和计算效率,适用于大规模离线全局规划和实时在线重规划。

Comments 8 pages, submitted to IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2411.08027 2026-04-27 cs.LG cs.AI cs.CV cs.RO 81%

LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines

LLMPhy: 结合大语言模型和物理引擎的参数可识别物理推理

Anoop Cherian, Radu Corcodel, Siddarth Jain, Diego Romeres

机构 * Mitsubishi Electric Research Labs (MERL)(三菱电机研究实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 LLMPhy通过整合大语言模型与物理引擎,解决复杂物理推理中参数识别问题,提出数字孪生构建方法,引入新数据集验证性能,实现更准确的参数恢复与稳定收敛。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11103 2026-04-27 cs.SD cs.AI 79%

ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

ActorMind:模拟人类演员推理的语音角色扮演

Xi Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ActorMind框架,通过多代理推理模拟人类演员在舞台上的表演,提升语音角色扮演能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO 57%

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 50%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2604.22074 2026-04-27 cs.CL 85%

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

结果奖励并不能保证可验证或因果重要的推理

Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文通过实验发现,尽管RLVR提升了任务准确率,但并未可靠提升推理的因果重要性和充分性,通过预训练可改善此问题,辅助奖励能进一步提升推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06019 2026-04-27 cs.CL cs.LG 62%

Multi-Token Prediction via Self-Distillation

通过自蒸馏实现多token预测

John Kirchenbauer, Abhimanyu Hans, Brian Bartoldson, Micah Goldblum, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Columbia University(哥伦比亚大学) TogetherAI

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过自蒸馏将预训练的自回归语言模型转换为快速独立的多token预测模型,无需额外辅助模型或复杂管道,实现更快的解码速度和更高的准确性。

Comments 9 pages and 5 figures in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 9 篇

2510.21285 2026-04-27 cs.AI cs.CL 84%

When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models

当模型超越安全限制:揭示并缓解大推理模型的自我突破

Yingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大推理模型存在自我突破现象,提出CoG框架通过分步干预缓解安全问题,平衡安全与推理性能。

Comments ACL 2026. The first two authors contributed equally. The main text is 9 pages, with an appendix of 28 pages. The paper contains 20 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07632 2026-04-27 cs.AI cs.CL cs.CV cs.LG 82%

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

测试时匹配:在多模态模型中解锁组合推理

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。

Comments To appear at ICLR 2026; extended results to generative multimodal models

详情

展开后加载摘要…

URL PDF HTML 收藏