arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML 67%

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19509 2026-04-14 cs.CL cs.AI cs.LG 67%

Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference

金字塔MoA:一种用于成本优化的任何时间推断概率框架

Arindam Khaled

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pyramid MoA框架,通过概率方法优化任何时间推断,实现高效查询路由和计算节省。

Comments 12 pages, 6 figures, 4 tables. v3: corrected router direction, added multi-benchmark context-aware escalation analysis, added Dean & Boddy and Horvitz citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04898 2026-04-07 cs.AI cs.CL cs.LG 67%

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

QED-Nano:用小型模型证明难题定理

LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

机构 * CMU(卡内基梅隆大学) Hugging Face ETH Zurich(苏黎世联邦理工学院) Project Numina

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18756 2026-03-20 cs.LG cs.AI cs.CL 67%

Are complicated loss functions necessary for teaching LLMs to reason?

复杂损失函数是否必要用于教LLM进行推理?

Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 67%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10055 2026-03-12 cs.LG cs.AI cs.CL 67%

Training Language Models via Neural Cellular Automata

通过神经细胞自动机训练语言模型

Dan Lee, Seungwook Han, Akarsh Kumar, Pulkit Agrawal

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过神经细胞自动机生成合成非语言数据,提升语言模型的预训练效果和推理能力。

Comments Website: https://hanseungwook.github.io/blog/nca-pre-pre-training/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01815 2026-03-12 cs.CL cs.AI cs.LG 67%

KV Cache Transform Coding for Compact Storage in LLM Inference

KV缓存变换编码用于LLM推理中的紧凑存储

Konrad Staniszewski, Adrian Łańcucki

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 67%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10177 2026-03-09 cs.LG cs.AI cs.CL cs.CY 67%

Towards Autonomous Mathematics Research

迈向自主数学研究

Tony Feng, Trieu H. Trinh, Garrett Bingham, Dawsen Hwang, Yuri Chervonyi, Junehyuk Jung, Joonkyung Lee, Carlo Pagano, Sang-hyun Kim, Federico Pasqualotto, Sergei Gukov, Jonathan N. Lee, Junsu Kim, Kaiying Hou, Golnaz Ghiasi, Yi Tay, YaGuang Li, Chenkai Kuang, Yuan Liu, Hanzhao Lin, Evan Zheran Liu, Nigamaa Nayakanti, Xiaomeng Yang, Heng-Tze Cheng, Demis Hassabis, Koray Kavukcuoglu, Quoc V. Le, Thang Luong

机构 * UC Berkeley(伯克利大学) Brown University(布朗大学) Yonsei University(延世大学) Concordia University(Concordia 大学) Korea Institute for Advanced Study(韩国高级研究院) UC San Diego(圣地亚哥大学) Caltech(加州理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia是一个能够自主生成、验证和修订数学解决方案的代理,展示了AI在数学研究中的应用,包括生成研究论文和解决开放问题。

Comments 42 pages, updated with summary of FirstProof results. Accompanied blog post https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03230 2026-03-04 cs.LG cs.AI cs.CL math.OC 67%

DiaBlo: Diagonal Blocks Are Sufficient For Finetuning

DiaBlo: 对角块足以用于微调

Selcuk Gurses, Aozhong Zhang, Yanxia Deng, Xun Dong, Xin Li, Naigang Wang, Penghang Yin, Zi Yang

机构 * University at Albany, SUNY(纽约州立大学阿尔巴尼分校) IBM T. J. Watson Research Center(IBM 汤普逊·杰·沃森研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiaBlo是一种仅更新模型权重矩阵对角块的参数高效微调方法,通过消除低秩矩阵乘积需求,实现稳定收敛和高效训练。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG 67%

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01822 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym:评估AI智能体创新潜力的基准测试

Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InnoGym通过引入性能提升和新颖性两个指标,首次系统评估AI智能体的创新潜力,揭示了创造力与有效性的平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL 67%

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11164 2026-02-13 cs.LG cs.AI cs.CL 67%

Automated Optimization Modeling via a Localizable Error-Driven Perspective

通过可定位的误差驱动视角实现自动化优化建模

Weiting Liu, Han Wu, Yufei Kuang, Xiongwei Han, Tao Zhong, Jianfeng Feng, Wenlian Lu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MIND通过可定位的误差驱动视角,改进自动化优化建模方法,提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14238 2026-02-10 cs.CL cs.AI cs.LG 67%

ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models

ABBA-Adapters: 高效且表达力强的基础模型微调

Raghav Singhal, Kaustubh Ponkshe, Rohit Vartak, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫德尔·本·扎耶德人工智能大学) Duke University(杜克大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABBA-Adapters通过引入低秩矩阵的Hadamard乘积,实现高效且表达力强的基础模型微调,显著提升适应新领域的性能。

Comments ICLR 2026. Raghav Singhal, Kaustubh Ponkshe, and Rohit Vartak contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04010 2026-02-09 cs.LG cs.AI cs.CL cs.NE 67%

Hyperbolic Fine-Tuning for Large Language Models

双曲微调用于大语言模型

Menglin Yang, Ram Samarth B B, Aosong Feng, Bo Xiong, Jihong Liu, Irwin King, Rex Ying

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Indian Institute of Science(印度科学研究院) Yale University(耶鲁大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HypLoRA通过在双曲空间中进行低秩适应,提升大语言模型在算术和常识推理任务中的性能。

Comments NeurIPS 2025; https://github.com/marlin-codes/HypLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03531 2026-02-06 cs.CL cs.AI cs.LG 67%

Real-Time Detection of Hallucinated Entities in Long-Form Generation

长文本生成中hallucinated实体的实时检测

Oscar Obeso, Andy Arditi, Javier Ferrando, Joshua Freeman, Cameron Holmes, Neel Nanda

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种廉价且可扩展的方法,用于实时检测长文本生成中的幻觉实体,通过网络搜索标注数据集训练高效分类器,并在多个模型家族上实现了优于基线的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00092 2026-02-03 cs.LG cs.AI cs.CL cs.CV 67%

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

通过宪法进行原子概念编辑来解释和控制模型行为

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过原子概念编辑学习模型宪法,以解释和控制模型行为,实验证明其在提升模型成功率方面效果显著。

Journal ref Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23149 2026-02-02 cs.SD 67%

Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO

听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO

Junchi Yao, Lokranjan Lakshmikanthan, Annie Zhao, Danielle Zhao, Shu Yang, Zikang Ding, Di Wang, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(卡布斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22628 2026-02-02 cs.LG cs.AI cs.CL 67%

TTCS: Test-Time Curriculum Synthesis for Self-Evolving

TTCS: 测试时课程合成用于自演化

Chengyi Yang, Zhishang Xiang, Yunbo Tang, Zongpei Teng, Chengsong Huang, Fei Long, Yuhan Liu, Jinsong Su

机构 * Xiamen University(厦门大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) Renmin University of China(中国人民大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTCS通过共进化框架提升LLM推理能力,利用生成器和求解器的协同进化,动态构建测试时课程以增强模型性能。

Comments 10 pages, 4 figures, Our code and implementation details are available at https://github.com/XMUDeepLIT/TTCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20861 2026-01-29 cs.LG cs.AI cs.CL 67%

Evolutionary Strategies lead to Catastrophic Forgetting in LLMs

进化策略导致大语言模型中的灾难性遗忘

Immanuel Abdi, Akshat Gupta, Micah Mok, Alexander Lu, Nicholas Lee, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 进化策略在大语言模型训练中导致灾难性遗忘,尽管性能接近GRPO,但持续学习能力受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 67%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL 67%

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25204 2026-01-27 cs.LG cs.AI cs.CL 67%

Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation

谱logit雕刻:一种自适应低秩logit变换用于受控文本生成

Jin Li, Zhebo Wang, Tianliang Lu, Mohan Li, Wenpeng Xing, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Hangzhou Dianzi University(杭州电子科技大学) People’s Public Security University of China(中国人民公安大学) Guangzhou University(广州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLS通过自适应低秩logit变换优化文本生成,提升输出分布的尖锐度并保持上下文一致性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14566 2026-01-22 cs.HC 67%

SCSimulator: An Exploratory Visual Analytics Framework for Partner Selection in Supply Chains through LLM-driven Multi-Agent Simulation

SCSimulator: 一种基于LLM驱动多智能体模拟的供应链伙伴选择探索性可视化分析框架

Shenghan Gao, Junye Wang, Junjie Xiong, Yun Jiang, Yun Fang, Qifan Hu, Baolong Liu, Quan Li

专题命中 数学推理 :reasoning(abstract);CoT(abstract)

AI总结 SCSimulator通过LLM驱动的多智能体模拟与人机协作,探索供应链伙伴选择的动态博弈,提供透明的决策解释和可交互的分析工具。

Comments ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14175 2026-01-21 cs.LG cs.AI cs.CL hep-th 67%

A model of errors in transformers

Transformer 中的错误模型

Suvrat Raju, Praneeth Netrapalli

机构 * International Centre for Theoretical Sciences, Tata Institute of Fundamental Research, Bengaluru, India(理论科学国际研究中心,印度塔塔基础研究研究所,班加罗尔) Google Deepmind, Bengaluru, India(谷歌DeepMind,班加罗尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种Transformer错误模型,通过双参数关系解释任务复杂度与准确性的关系,并展示了如何通过提示减少错误率。

Comments 8+17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04419 2026-01-21 cs.LG cs.AI cs.CL 67%

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10349 2026-01-16 cs.LG cs.AI cs.CL cs.GT 67%

SuS: Strategy-aware Surprise for Intrinsic Exploration

SuS:基于策略的惊喜用于内在探索

Mark Kashirskiy, Ilya Makarov

机构 * Higher School of Economics(俄罗斯高等经济学院) AI Talent Hub(人工智能人才中心) ITMO University(ITMO大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SuS通过结合策略稳定性与策略惊喜,提升强化学习中探索的准确性和多样性,实现显著性能提升。

Comments 8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09706 2026-01-15 cs.CL cs.AI cs.LG 67%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏