arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2509.22979 2026-01-15 cs.LG 57%

OptiMind: Teaching LLMs to Think Like Optimization Experts

OptiMind: 教授大语言模型像优化专家一样思考

Xinzhi Zhang, Zeyi Chen, Humishka Zope, Hugo Barbalho, Konstantina Mellou, Marco Molinaro, Janardhan Kulkarni, Ishai Menache, Sirui Li

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21005 2026-01-14 cs.AI cs.IR 57%

ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning

ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习

Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 57%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG 57%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05298 2026-01-12 cs.AI 57%

Mathematical Knowledge Graph-Driven Framework for Equation-Based Predictive and Reliable Additive Manufacturing

基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造

Yeongbin Cha, Namjung Kim

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04675 2026-01-09 cs.AI 57%

LLM-Guided Quantified SMT Solving over Uninterpreted Functions

基于大语言模型的量化SMT求解与不可解释函数

Kunhang Lv, Yuhang Dong, Rui Han, Fuqi Jia, Feifei Ma, Jian Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AquaForte利用大语言模型提供语义指导,通过生成满足约束条件的函数定义实例化候选,显著减少SMT求解的搜索空间和复杂性,有效解决传统求解器超时的实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG 57%

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03017 2026-01-07 cs.CL 57%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13102 2026-01-07 cs.AI 57%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00885 2026-01-06 cs.AI 57%

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

反事实自问法用于语言模型中的稳定策略优化

Mandar Parab

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00121 2026-01-05 cs.AI cs.HC 57%

Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control

提问、澄清、优化:人类-大语言模型代理协作以实现更智能的库存控制

Yaqi Duan, Yichun Hu, Jiashuo Jiang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出混合代理框架,利用LLM作为智能接口,通过分离语义推理与数学计算,降低库存成本32.1%,证明LLM作为自然语言接口使优化策略更易被非专家使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22944 2025-12-30 cs.LG 57%

Multiple Token Divergence: Measuring and Steering In-Context Computation Density

多令牌分歧:测量和引导上下文计算密度

Vincent Herrmann, Eric Alcaide, Michael Wand, Jürgen Schmidhuber

机构 * The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 多令牌分歧通过测量语言模型的计算努力,提供了一种轻量级工具,用于分析和引导生成文本的计算动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18841 2025-12-30 cs.CL 57%

MDToC: Metacognitive Dynamic Tree of Concepts for Boosting Mathematical Problem-Solving of Large Language Models

MDToC:元认知动态概念树用于提升大语言模型的数学问题解决能力

Tung Duong Ta, Tim Oates, Thien Van Luong, Huan Vu, Tien Cuong Nguyen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) National Economics University(国家经济大学) VNPT AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MDToC通过构建概念树和多数投票机制,提升大语言模型在数学问题解决中的准确性与验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21911 2025-12-29 cs.CL 57%

Accelerate Speculative Decoding with Sparse Computation in Verification

通过验证中的稀疏计算加速推测解码

Jikai Wang, Jianchao Tan, Yuxuan Hu, Jiayu Qin, Yerui Sun, Yuchen Xie, Xunliang Cai, Juntao Li, Min Zhang

机构 * Key Laboratory of Data Intelligence and Advanced Computing, Soochow University(数据智能与先进计算 key laboratory,苏州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种稀疏验证框架,通过联合稀疏化注意力、FFN和MoE组件,减少验证阶段的计算成本,并结合检索重用策略提升效率-准确性平衡。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11496 2025-12-23 cs.CV cs.AI 57%

AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model

AndesVL 技术报告:一种高效的移动端多模态大语言模型

Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, Xin Li, Ruichen Wang, Zhihao Li, Qi Qi, Long Cheng, Dongze Hao, Quanlong Zheng, Yanhao Zhang, Haobo Ji, Jian Ma, Zhitong Zheng, Zhenyi Lin, Haolin Deng, Xin Zou, Xiaojie Yin, Ruilin Wang, Liankai Cai, Haijing Liu, Yuqing Qiu, Ke Chen, Zixian Li, Chi Xie, Huafei Li, Chenxing Li, Chuangchuang Wang, Kai Tang, Zhiguang Zhu, Kai Tang, Wenmei Gao, Rui Wang, Jun Wu, Chao Liu, Qin Xie, Chen Chen, Haonan Lu

机构 * AndesVL Team(AndesVL团队) OPPO AI Center(OPPO人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。

Comments Tech report of OPPO AndesVL Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11792 2025-12-23 cs.AI 57%

Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling

Solver-Informed RL: 为真实优化建模奠定大语言模型基础

Yitian Chen, Jingfan Xia, Siyu Shao, Dongdong Ge, Yinyu Ye

机构 * Cardinal Operations, China(中国卡迪纳尔运营公司) Shanghai University of Finance and Economics(上海财经大学) The University of Hong Kong(香港大学) Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SIRL通过强化学习与外部优化求解器结合,提升大语言模型在优化建模中的准确性与实用性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16649 2025-12-19 cs.CL 57%

JustRL: Scaling a 1.5B LLM with a Simple RL Recipe

JustRL: 通过简单强化学习方法扩展1.5B语言模型

Bingxiang He, Zekai Qu, Zeyuan Liu, Yinghao Chen, Yuxin Zuo, Cheng Qian, Kaiyan Zhang, Weize Chen, Chaojun Xiao, Ganqu Cui, Ning Ding, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 JustRL通过简单强化学习方法在1.5B语言模型上实现高性能,省去复杂训练流程,展现稳定训练效果。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10691 2025-12-12 cs.AI cs.CV 57%

Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning

通过强化学习增强放射学报告生成和视觉基础识别

Benjamin Gundersen, Nicolas Deperrois, Samuel Ruiperez-Campillo, Thomas M. Sutter, Julia E. Vogt, Michael Moor, Farhad Nooralahzadeh, Michael Krauthammer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。

Comments 10 pages main text (3 figures, 3 tables), 31 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09108 2025-12-11 cs.SE cs.AI 57%

Evolving Excellence: Automated Optimization of LLM-based Agents

精益求精:基于大语言模型的代理的自动化优化

Paul Brookes, Vardan Voskanyan, Rafail Giavrimis, Matthew Truscott, Mina Ilieva, Chrystalla Pavlou, Alexandru Staicu, Manal Adham, Will Evers- Hood, Jingzhi Gong, Kejia Zhang, Matvey Fedoseev, Vishal Sharma, Roman Bauer, Zheng Wang, Hema Nair, Wei Jie, Tianhua Xu, Aurora Constantin, Leslie Kanthan, Michail Basios

机构 * University of Leeds(利兹大学) City, University of London(伦敦城市大学) University of West London(西伦敦大学) University of Edinburgh(爱丁堡大学) University of Surrey(萨里大学) University of Warwick(沃里克大学) King's College London(伦敦国王学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ARTEMIS通过语义感知的进化算法,自动优化基于大语言模型的代理配置,显著提升多个任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05382 2025-12-11 physics.data-an cs.AI hep-ph physics.comp-ph physics.hist-ph 57%

Large Physics Models: Towards a collaborative approach with Large Language Models and Foundation Models

大规模物理模型:迈向与大规模语言模型和基础模型的协作方法

Kristian G. Barman, Sascha Caron, Emily Sullivan, Henk W. de Regt, Roberto Ruiz de Austri, Mieke Boon, Michael Färber, Stefan Fröse, Faegheh Hasibi, Andreas Ipp, Rukshak Kapoor, Gregor Kasieczka, Daniel Kostić, Michael Krämer, Tobias Golling, Luis G. Lopez, Jesus Marco, Sydney Otten, Pawel Pawlowski, Pietro Vischia, Erik Weber, Christoph Weniger

机构 * CLPS - Centre for Logic and Philosophy of Science(逻辑与哲学科学中心) UGent(根特大学) IMAPP, Radboud University and Nikhef(IMAPP、拉德堡德大学和荷兰皇家科学院) Utrecht University(乌特勒支大学) Institute for Science in Society, Radboud University(社会科学研究院,拉德堡德大学) Instituto de Física Corpuscular (IFIC), CSIC-UV, Spain(Corpuscular 物理研究所(IFIC),CSIC-UV,西班牙) University of Twente(代尔夫特理工大学) TU Dresden & ScaDS.AI(德累斯顿技术大学及ScaDS.AI) ErUM-Data-Hub & TU Dortmund University(ErUM-Data-Hub及多特蒙德技术大学) Computing and Information Science, Radboud University(计算与信息科学,拉德堡德大学) TU Wien(维也纳技术大学) Thapar Institute of Engineering & Technology (TIET), Patiala, India(泰帕尔工程与技术学院(TIET),帕蒂亚,印度) Universität Hamburg(汉堡大学) Institute of Philosophy, University of Leiden(哲学研究所,莱顿大学) RWTH Aachen University(亚琛工业大学) University of Geneva(日内瓦大学) Munich Center for Mathematical Philosophy, LMU Munich(慕尼黑数学哲学中心,慕尼黑大学) Institute of Physics of Cantabria (IFCA), CSIC-UC, Spain(坎塔布里亚物理研究所(IFCA),CSIC-UC,西班牙) Radboud University(拉德堡德大学) Ippen Digital, Germany(Ippen 数字,德国) Universidad de Oviedo and ICTEA, Spain(奥维多大学及ICTEA,西班牙) CLPS - Centre for Logic and Philosophy of Science, UGent(逻辑与哲学科学中心) GRAPPA, Institute of Physics, University of Amsterdam(GRAPPA,物理研究所,阿姆斯特丹大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过跨学科协作开发大规模物理模型,旨在解决物理研究中的特定需求。

Journal ref Eur. Phys. J. C 85, 1066 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03817 2025-12-10 cs.AI cs.MA 57%

Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning

学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型

Wei Yang, Jesse Thomason

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05757 2025-12-09 cs.AI 57%

Hyperbolic Large Language Models

双曲大语言模型

Sarang Patil, Zeyong Zhang, Yiran Huang, Tengfei Ma, Mengjia Xu

机构 * Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院) Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双曲大语言模型,通过双曲几何提升语义表示学习和多尺度推理能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04748 2025-12-05 cs.CL 57%

Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time

模型Whisper:引导向量解锁大型语言模型在测试时的潜力

Xinyue Kang, Diwei Shi, Li Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 Model Whisper通过轻量级引导向量在测试时提升大型语言模型的推理能力,实现高效且稳定的性能提升。

Comments accepted to aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03442 2025-12-04 cs.CL 57%

PretrainZero: Reinforcement Active Pretraining

PretrainZero:强化主动预训练

Xingrun Xing, Zhiyuan Fan, Jie Lou, Guoqi Li, Jiajun Zhang, Debing Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaohongshu Inc.(小红书公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PretrainZero通过主动预训练和自监督学习方法,提升通用推理能力,并在多个基准测试中取得显著成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02556 2025-12-03 cs.CL 57%

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

DeepSeek-V3.2: 推动开放大规模语言模型的前沿

DeepSeek-AI, Aixin Liu, Aoxue Mei, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenhao Xu, Chong Ruan, Damai Dai, Daya Guo, Dejian Yang, Deli Chen, Erhang Li, Fangqi Zhou, Fangyun Lin, Fucong Dai, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Hanwei Xu, Hao Li, Haofen Liang, Haoran Wei, Haowei Zhang, Haowen Luo, Haozhe Ji, Honghui Ding, Hongxuan Tang, Huanqi Cao, Huazuo Gao, Hui Qu, Hui Zeng, Jialiang Huang, Jiashi Li, Jiaxin Xu, Jiewen Hu, Jingchang Chen, Jingting Xiang, Jingyang Yuan, Jingyuan Cheng, Jinhua Zhu, Jun Ran, Junguang Jiang, Junjie Qiu, Junlong Li, Junxiao Song, Kai Dong, Kaige Gao, Kang Guan, Kexin Huang, Kexing Zhou, Kezhao Huang, Kuai Yu, Lean Wang, Lecong Zhang, Lei Wang, Liang Zhao, Liangsheng Yin, Lihua Guo, Lingxiao Luo, Linwang Ma, Litong Wang, Liyue Zhang, M. S. Di, M. Y Xu, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Mingxu Zhou, Panpan Huang, Peixin Cong, Peiyi Wang, Qiancheng Wang, Qihao Zhu, Qingyang Li, Qinyu Chen, Qiushi Du, Ruiling Xu, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, Runqiu Yin, Runxin Xu, Ruomeng Shen, Ruoyu Zhang, S. H. Liu, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shaofei Cai, Shaoyuan Chen, Shengding Hu, Shengyu Liu, Shiqiang Hu, Shirong Ma, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, Songyang Zhou, Tao Ni, Tao Yun, Tian Pei, Tian Ye, Tianyuan Yue, Wangding Zeng, Wen Liu, Wenfeng Liang, Wenjie Pang, Wenjing Luo, Wenjun Gao, Wentao Zhang, Xi Gao, Xiangwen Wang, Xiao Bi, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaokang Zhang, Xiaotao Nie, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xingkai Yu, Xingyou Li, Xinyu Yang, Xinyuan Li, Xu Chen, Xuecheng Su, Xuehai Pan, Xuheng Lin, Xuwei Fu, Y. Q. Wang, Yang Zhang, Yanhong Xu, Yanru Ma, Yao Li, Yao Li, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Qian, Yi Yu, Yichao Zhang, Yifan Ding, Yifan Shi, Yiliang Xiong, Ying He, Ying Zhou, Yinmin Zhong, Yishi Piao, Yisong Wang, Yixiao Chen, Yixuan Tan, Yixuan Wei, Yiyang Ma, Yiyuan Liu, Yonglun Yang, Yongqiang Guo, Yongtong Wu, Yu Wu, Yuan Cheng, Yuan Ou, Yuanfan Xu, Yuduan Wang, Yue Gong, Yuhan Wu, Yuheng Zou, Yukun Li, Yunfan Xiong, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuyang Zhou, Z. F. Wu, Z. Z. Ren, Zehua Zhao, Zehui Ren, Zhangli Sha, Zhe Fu, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhibin Gou, Zhicheng Ma, Zhigang Yan, Zhihong Shao, Zhixian Huang, Zhiyu Wu, Zhuoshu Li, Zhuping Zhang, Zian Xu, Zihao Wang, Zihui Gu, Zijia Zhu, Zilin Li, Zipeng Zhang, Ziwei Xie, Ziyi Gao, Zizheng Pan, Zongqing Yao, Bei Feng, Hui Li, J. L. Cai, Jiaqi Ni, Lei Xu, Meng Li, Ning Tian, R. J. Chen, R. L. Jin, S. S. Li, Shuang Zhou, Tianyu Sun, X. Q. Li, Xiangyue Jin, Xiaojin Shen, Xiaosha Chen, Xinnan Song, Xinyi Zhou, Y. X. Zhu, Yanping Huang, Yaohui Li, Yi Zheng, Yuchen Zhu, Yunxian Ma, Zhen Huang, Zhipeng Xu, Zhongyu Zhang, Dongjie Ji, Jian Liang, Jianzhong Guo, Jin Chen, Leyi Xia, Miaojun Wang, Mingming Li, Peng Zhang, Ruyi Chen, Shangmian Sun, Shaoqing Wu, Shengfeng Ye, T. Wang, W. L. Xiao, Wei An, Xianzu Wang, Xiaowen Sun, Xiaoxiang Wang, Ying Tang, Yukun Zha, Zekai Zhang, Zhe Ju, Zhen Zhang, Zihua Qu

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 DeepSeek-V3.2通过高效注意力机制、强化学习框架和大规模代理任务合成流水线,在计算效率与推理能力上取得突破,超越GPT-5并获国际竞赛金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18649 2025-12-02 cs.CL 57%

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting

评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力

Goun Pyeon, Inbum Heo, Jeesu Jung, Taewook Hwang, Hyuk Namgoong, Hyein Seo, Yerim Han, Eunbin Kim, Hyeonseok Kang, Sangkeun Jung

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00344 2025-12-02 cs.AI 57%

Echo-N1: Affective RL Frontier

Echo-N1:情感强化学习前沿

Naifan Zhang, Ruihan Sun, Ruixi Su, Shiqi Ma, Shiya Zhang, Xianna Weng, Xiaofan Zhang, Yuhan Zhan, Yuyang Xu, Zhaohan Chen, Zhengyuan Pan, Ziyi Song

机构 * Echo-N1: Affective RL Frontier Team(情感强化学习前沿团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Echo-N1通过实时推断用户个性并优化个性化对话偏好,开创了情感强化学习的新领域,显著提升了人类般的交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏