arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 110 篇

2603.01563 2026-03-03 cs.LG cs.AI 73%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01375 2026-03-03 cs.AI cs.LG 73%

Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation

词语与权重:通过协同适应流式多轮交互

Chenxing Wei, Hong Wang, Ying He, Zhongxiang Dai, Bo Jiang, F. Richard Yu, Yao Shu

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) University of Science(科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Carleton University(卡尔顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ROSA2通过协同适应词语与权重空间,提升多轮交互的语义清晰度和参数更新效率,实现更高效的交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10609 2026-03-03 cs.CL cs.AI 73%

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

在线因果卡尔曼滤波用于稳定和有效的策略优化

Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPO方法,通过在线因果卡尔曼滤波稳定和提升策略优化效果,有效解决token级重要性采样比率的高方差问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08616 2026-03-03 q-fin.ST cs.AI cs.LG q-fin.CP 73%

Reasoning on Time-Series for Financial Technical Analysis

用于金融技术分析的时间序列推理

Kelvin J. L. Koa, Jan Chen, Yunshan Ma, Huanhuan Zheng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Technical University of Munich(慕尼黑技术大学) Singapore Management University(新加坡管理学院) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VTA通过结合语言和潜在推理,生成准确且可解释的股票时间序列预测,展示了在金融技术分析中的优越性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00405 2026-03-03 cs.LG cs.AI 73%

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

UME-R1: 探索基于推理的生成多模态嵌入

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24298 2026-03-03 cs.LG cs.AI 73%

AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

AReaL: 一种用于语言推理的大规模异步强化学习系统

Wei Fu, Jiaxuan Gao, Xujie Shen, Chen Zhu, Zhiyu Mei, Chuyi He, Shusheng Xu, Guo Wei, Jun Mei, Jiashu Wang, Tongkai Yang, Binhang Yuan, Yi Wu

机构 * IIIS, Tsinghua University(清华信息学院) Ant Group(蚂蚁集团) HKUST(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AReaL通过异步机制提升大语言模型推理训练效率,实现GPU利用率显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00623 2026-03-03 cs.AI cs.CL 73%

TraceSIR: A Multi-Agent Framework for Structured Analysis and Reporting of Agentic Execution Traces

TraceSIR: 一个用于结构化分析和报告代理执行轨迹的多代理框架

Shu-Xun Yang, Cunxiang Wang, Haoke Zhang, Wenbo Yu, Lindong Wu, Jiayi Gui, Dayong Yang, Yukuo Cen, Zhuoer Feng, Bosi Wen, Yidong Wang, Lucen Zhong, Jiamin Ren, Linfeng Zhang, Jie Tang

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI(智谱AI) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TraceSIR通过多代理框架结构化分析和报告代理执行轨迹,提升故障诊断和根本原因分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08427 2026-03-03 cs.CL cs.LG 73%

Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering

沉默法官:通过潜在几何聚类的自我验证强化学习

Nonghai Zhang, Weitao Ma, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu

机构 * Meituan(美团) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent-GRPO框架,通过潜在空间几何聚类生成内在奖励,提升大语言模型推理性能并加速训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24393 2026-03-03 cs.AI cs.CL 73%

Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention

通过纠正干预实现大推理模型的安全推理

Yichi Zhang, Yue Ding, Jingwen Yang, Tianwei Luo, Dongbai Li, Ranjie Duan, Qiang Liu, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) RealAI

专题命中 推理与问题求解 :SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21413 2026-03-03 cs.CL cs.AI 73%

RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning

RefTool: 基于参考的工具创建用于知识密集型推理

Xiao Liu, Da Yin, Zirui Wu, Yansong Feng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) University of Chicago(芝加哥大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RefTool通过基于参考的工具创建框架,提升LLMs在知识密集型任务中的推理能力,实现更准确和高效的工具生成与应用。

Comments Accepted by ICLR 2026. Code is available at https://github.com/xxxiaol/RefTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01641 2026-03-03 cs.AI 70%

Learning Structured Reasoning via Tractable Trajectory Control

通过可计算的轨迹控制学习结构化推理

Po-Nien Kung, Zhen Yang, Jeffrey Luo, Cheng-Fu Yang, Haikang Deng, Zi-Yi Dou, Yinfei Yang, Nanyun Peng, Zhe Gan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Apple(苹果公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Ctrl-R通过可计算的轨迹控制学习结构化推理,提升复杂问题解决的多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01241 2026-03-03 cs.IR cs.AI 70%

TARSE: Test-Time Adaptation via Retrieval of Skills and Experience for Reasoning Agents

TARSE: 通过检索技能和经验进行测试时适应以实现推理代理

Junda Wang, Zonghai Tao, Hansi Zeng, Zhichao Yang, Hamed Zamani, Hong Yu

机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04388 2026-03-03 cs.LG 70%

Learning to Orchestrate Agents in Natural Language with the Conductor

通过指挥模型学习自然语言中的代理协调

Stefan Nielsen, Edoardo Cetin, Peter Schwendeman, Qi Sun, Jinglue Xu, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI公司) University of Michigan, USA(美国密歇根大学) Institute of Science Tokyo, Japan(日本东京科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过强化学习训练指挥模型,实现自然语言中代理的协调,展示其在推理基准测试中的卓越性能。

Comments To appear at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23365 2026-03-03 cs.LG 70%

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

连续思维的涌现:揭示连续思维链的训练动态

Hanlin Zhu, Shibo Hao, Zhiting Hu, Jiantao Jiao, Stuart Russell, Yuandong Tian

机构 * UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Nvidia(英伟达) Meta AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。

Comments 32 pages, 9 figures, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05606 2026-03-03 cs.CV cs.CL 70%

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-cot: 向跨文本和视觉的统一链式推理迈进

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。

Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19965 2026-03-03 cs.AI 70%

Adaptive Location Hierarchy Learning for Long-Tailed Mobility Prediction

自适应位置层级学习用于长尾移动预测

Yu Wang, Junshu Dai, Yuchen Ying, Hanyang Yuan, Zunlei Feng, Tongya Zheng, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ALOHA通过自适应层级学习缓解长尾移动预测偏差,提升多种模型的预测性能达16.59%。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00873 2026-03-03 cs.AI 70%

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

MC-Search:基于结构化长推理链评估和增强多模态代理搜索

Xuying Ning, Dongqi Fu, Tianxin Wei, Mengting Ai, Jiaru Zou, Ting-Wei Li, Hanghang Tong, Yada Zhu, Hendrik Hamann, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09794 2026-03-03 cs.AI 70%

Learning Global Hypothesis Space for Enhancing Synergistic Reasoning Chain

学习全局假设空间以增强协同推理链

Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Xudong Wang, Zhenzhen Huang, Pengcheng Zheng, Shuai Yuan, Sheng Zheng, Qigan Sun, Jie Zou, Lik-Hang Lee, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Kyung Hee University(庆熙大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GHS-TDA通过构建全局假设图和拓扑数据分析,提升推理链的稳定性和可解释性,优于现有基线方法。

Comments Accept by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12664 2026-03-03 cs.AI cs.SY eess.SY 70%

Behavioral Generative Agents for Energy Operations

行为生成代理在能源运营中的应用

Cong Chen, Omer Karaduman, Xu Kuang

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) Graduate School of Business, Stanford University(斯坦福大学商学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05669 2026-03-03 cs.AI 70%

ACPBench: Reasoning about Action, Change, and Planning

ACPBench: 关于行动、变化和规划的推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ACPBench是一个用于评估规划领域推理能力的基准,包含7个推理任务和13个规划领域,评估了多种LLM和推理模型的性能差异。

Comments In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02035 2026-03-03 cs.RO cs.CV 67%

LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers

LAD-Drive: 通过动作感知扩散变换器弥合语言与轨迹

Fabian Schmidt, Karol Fedurko, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃斯林根应用科学大学) Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 LAD-Drive通过动作感知扩散变换器,将语言模型的意图与连续轨迹生成结合,提升自动驾驶中的多模态规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24119 2026-03-03 cs.AI cs.CL cs.LG 67%

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

SPIRAL:通过多智能体多轮强化学习进行零和游戏的自我对战以促进推理

Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques

机构 * National University of Singapore(新加坡国立大学) Northeastern University(东北大学) Sea AI Lab(Sea AI 实验室) Centre for Frontier AI Research (CFAR), A*STAR(前沿人工智能研究中心(CFAR),A*STAR) Plastic Labs University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIRAL通过多智能体多轮强化学习在零和游戏中促进推理,展示了模型在多个基准测试中的显著性能提升。

Comments Accepted at ICLR 2026. Code: https://github.com/spiral-rl/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01637 2026-03-03 cs.CV 67%

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19661 2026-03-03 cs.CV 67%

CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

CodeV: 通过工具感知策略优化实现基于图像的代码推理

Xinhai Hou, Shaoyuan Xu, Manan Biyani, Moyan Li, Jia Liu, Todd C. Hollon, Bryan Wang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 CodeV通过工具感知策略优化提升视觉推理的忠实度,实现更高准确率和更可靠的工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00905 2026-03-03 cs.CV 67%

pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning

pySpatial: 为零样本空间推理生成3D视觉程序

Zhanpeng Luo, Ce Zhang, Silong Yong, Cunxi Dai, Qianwei Wang, Haoxi Ran, Guanya Shi, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。

Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00500 2026-03-03 cs.RO 67%

Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented Generation

通过3D高斯点云增强的多模态检索增强生成实现零样本机器人操作

Zilong Xie, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yuan Xie

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出RobMRAG框架,通过3D高斯点云增强多模态检索增强生成,提升零样本机器人操作的泛化能力和可解释性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00409 2026-03-03 cs.CV 67%

SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning

SSR:通过结构化场景推理推动空间智能的极限

Yi Zhang, Youya Xia, Yong Wang, Meng Song, Xin Wu, Wenjun Wan, Bingbing Liu, AiXue Ye, Hongbo Zhang, Feng Wen

机构 * Foundation Model Department, Huawei(华为基础模型部门)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SSR通过结构化场景推理框架,在减少对齐成本的同时,实现了高效的空间智能,优于更大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00971 2026-03-03 cs.CV 67%

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

揭示认知罗盘:基于理论of-Mind的多模态情感推理

Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang, Qiuchan Chen, Menglu Han, Wenhao Chen, Yanxiang Huang, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出HitEmotion基准和TMPO方法,通过理论of-Mind引导多模态情感推理,提升模型情感理解和认知能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01365 2026-03-03 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

Align and Filter: Improving Performance in Asynchronous On-Policy RL

对齐与过滤:提升异步在线强化学习的性能

Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth

机构 * Mila – Quebec AI Institute, Canada(魁北克AI研究所) University of Alberta, Canada(阿尔伯塔大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于总变分的优势对齐约束策略优化方法,用于缓解异步在线强化学习中的策略滞后问题,并在经典和现代强化学习任务中展示了其优越的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19473 2026-03-03 cs.LG cs.AI 62%

WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning

WavefrontDiffusion: 动态解码调度以提升推理性能

Haojin Yang, Rui Hu, Zequn Sun, Rui Zhou, Yujun Cai, Yiwei Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 WavefrontDiffusion通过动态解码调度提升推理和代码生成的性能与语义连贯性。

Comments 19 pages. 3 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏