arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2093
2609.04203 2026-09-04 cs.CV 新提交

Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision

时间自蒸馏:无监督学习视频中的视觉状态跟踪

Shravan Venkatraman, Wenshuai Zhao, Mohammad Hassan Vali, Arno Solin

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学)

AI总结 本文提出首个完全自包含的连续视频状态跟踪框架S$^3$T,利用时间采样密度作为特权信息实现无监督训练,在LLaVA-OneVision-2-8B等基准上显著提升VSTAT等任务性能,且可迁移至真实视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04202 2026-09-04 cs.CV 新提交

TokenMatch: 3D Mesh Correspondence Transformer with Curvature-Guided Tokenisation

TokenMatch:基于曲率引导分词的3D网格对应Transformer

Adeela Islam, Zorah Lähner, Vittorio Murino, Vladislav Golyanik

机构 * Italian Institute of Technology(意大利理工学院) University of Genoa(热那亚大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) University of Verona(维罗纳大学)

AI总结 本文提出基于Transformer的TokenMatch模型,通过曲率引导分词技术学习几何描述符,在多基准测试中实现了更优的3D形状匹配性能,且推理速度更快。

Comments 25 pages, 13 figures and 12 tables; project page: this https URL (https://4dqv.mpi-inf.mpg.de/TokenMatch/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04201 2026-09-04 cs.CV 新提交

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

Scal3R:学习高效的多相对位姿查询以实现可扩展的在线三维重建

Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) NVIDIA(英伟达公司)

AI总结 Scal3R将在线三维重建转化为多参考相对位姿查询,通过轻量可学习标记和位姿图优化抑制漂移,在多数据集上实现性能提升

Comments ECCV 2026. Project page: this https URL (https://linjohnss.github.io/scal3r/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04200 2026-09-04 cs.CV 新提交

Principia: Relational Physics Tests for Video Models

Principia:面向视频模型的关系物理测试基准

Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad

机构 * Indian Institute of Science(印度科学学院) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 Principia是评估视频模型物理推理的校准无关基准,涵盖八种物理现象,实验显示现有视频生成器和视觉语言模型在该基准上表现远差于通用视频基准VBench。

Comments Project Page: this https URL (https://principiabench.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04199 2026-09-04 cs.CL cs.AI cs.LG 新提交

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions

通过训练进行编译:将自然语言规范转换为局部神经函数

Yuntian Deng, Pengyu Nie, Stuart Shieber

机构 * University of Waterloo(滑铁卢大学) Harvard University(哈佛大学)

AI总结 该研究提出“通过训练进行编译”方法,将自然语言规范转为可复用神经函数,在FuzzyBench-Hard上达83.6%语义准确率,可部署于多场景。

Comments EMNLP 2026 System Demonstrations. Demo: this https URL (https://programasweights.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04198 2026-09-04 cs.AI cs.LG 新提交

Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints

清洁工程,不稳定测量:共享端点上黑盒大语言模型评判器的预注册可靠性失效

Haoyaun Zhu, Jie Zhang

机构 * School of Electronic and Electrical Engineering, University of Sheffield(谢菲尔德大学电子与电气工程学院) Ranplan Wireless Network Design Ltd.(Ranplan无线网络设计有限公司) Cambridge AI+ Ltd.(剑桥AI+有限公司)

AI总结 该研究通过两项预注册审计发现共享端点上黑盒大语言模型评判器的排名一致性未达阈值,分析了三种失效机制,提出改进方案并强调预注册评估需先测量工具有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04197 2026-09-04 cs.CL cs.AI 新提交

ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize

ESPO:基于诊断、多样化与稳定化的错误结构化提示优化

Lihao Liu, Peng Tang, Kunwar Yashraj Singh, Shabnam Ghadar

机构 * AWS Agentic AI(亚马逊云科技智能体人工智能部门)

AI总结 针对现有进化式提示优化器的提示膨胀问题,ESPO通过诊断、多样化、稳定化三阶段优化,在七个NLP基准及四个学生模型上均提升准确率,缩短提示长度并加快推理。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04196 2026-09-04 cs.CV 新提交

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

Puffin-World:基于原生3D世界状态扩展统一多模态模型

Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) University of Michigan(密歇根大学) Beijing Jiaotong University(北京交通大学) ACE Robotics(ACE机器人公司)

AI总结 研究提出无需外部离线模块的Puffin-World统一多模态模型,联合建模三类原生3D世界状态与Omni-Camera表示,构建含1500万三元组的Puffin-16M数据集,支持多任务协同的闭环应用并发布相关资源。

Comments Project Page: this https URL (https://kangliao929.github.io/projects/puffin-world/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04194 2026-09-04 cs.CL cs.LG 新提交

Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

可解释性≠可理解性:对比思维链推理中的主观判断重要性与实际重要性

Kevin Du, Alexander Hoyle, Laura Ruis, Acyr Locatelli

机构 * ETH Zürich(苏黎世联邦理工学院) MIT(麻省理工学院) Cohere(科here公司)

AI总结 该研究对比思维链推理的可理解性与实际重要性,发现LLM评判识别高优势步骤的能力有限,微调步骤级批评家仅对错误响应有效,警示勿将推理轨迹可理解性等同于可解释性。

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04193 2026-09-04 cs.RO 新提交

GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation

GIFT:面向机器人操作的基于动作导向结构监督的引导式中间特征训练

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Chaoyue Li, Qichao Zhang, Haoran Li, Zhongpu Xia, Ya-Qin Zhang, Shuicheng Yan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 该研究提出 GIFT 框架,通过几何对齐、可供性预测和目标区域重建约束中间特征,在 LIBERO-Plus 和 RoboCasa 数据集上,其多个变体在机器人操作任务中显著优于基准模型,性能提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04190 2026-09-04 cs.CV cs.AI 新提交

One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing

一个编辑器,多种编辑:用于多样化视频编辑的统一无训练框架

Adheesh Sunil Juvekar, Onkar Kishor Susladkar, Kiet A. Nguyen, Muntasir Wahed, Nabeel Bashir, Xiaona Zhou, Tianjiao Yu, Vedant Shah, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对单一框架内实现高质量多样化视频编辑的挑战,提出无训练框架EditVid,结合稀疏因果记忆等技术,在FiVE、IVEBench数据集及用户研究中均取得优于基线的结果。

Comments this https URL (https://plan-lab.github.io/editvid)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04189 2026-09-04 cs.LG cs.GT cs.LO cs.MA 新提交

Robust PAC Learning of Concurrent Stochastic Games

并发随机博弈的鲁棒PAC学习

Angel Y. He, David Parker

机构 * University of Oxford(牛津大学)

AI总结 提出带转移不确定性的一般和并发随机博弈的鲁棒PAC学习框架,通过维护转移核置信集、引入纳什边际特征,在满足可达性条件下以多项式样本复杂度终止,基准博弈实验验证其性能与理论一致性。

Comments Main text: 10 pages, 1 figure, 2 tables; Appendix: 22 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04183 2026-09-04 cs.CV cs.AI 新提交

Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning

先看后合成:面向弱监督密集视频字幕的VLM引导式过渡事件发现

Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim, Hwiseon Kim, Hyungee Kim, Dong-Jin Kim

机构 * Hanyang University(汉阳大学)

AI总结 该研究针对弱监督密集视频字幕中LLM合成过渡字幕缺乏视觉基础的问题,提出SBS框架,利用VLM检测过渡并优化时间掩码,在ActivityNet Captions和YouCook2上取得最优性能。

Comments Accepted to EMNLP 2026 (main, long)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04180 2026-09-04 cs.CL cs.AI 新提交

Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views

预训练期间的知识获取?辅助视角让大语言模型学习得更好

Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本研究通过受控实验证实,辅助视角(知识的重构形式)是大语言模型预训练成功的关键因素,可提升学习效果,解释了数据多样性的重要性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04177 2026-09-04 cs.AI 新提交

A Computationally Feasible Framework for Causal Probabilistic Explanation

一种计算可行的因果概率解释框架

Rafal Urbaniak, Sam Witty, Daniel Waxman, Andy Zane, Poorva Garg, Emily Bunnapradist, Sankaran Vaidyanathan, Jack Feser, Drew Lehe, Eli Bingham

机构 * Basis Research Institute(贝西斯研究所) Sorbus AI(索巴斯人工智能公司) Massachusetts Institute of Technology(麻省理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) HouseIQ(豪斯IQ公司)

AI总结 该研究针对现有因果解释工具的局限性,提出概率因果影响(PCI)框架,将可解释性转化为概率因果模型的估计问题,可高效计算且符合因果逻辑,经多类案例验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04174 2026-09-04 cs.CV 新提交

Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations

基于3D基础模型场景表示的零样本新视角深度合成

Denis M. Akola, David F. Fouhey

机构 * New York University(纽约大学) Tandon School of Engineering(坦登工程学院) Courant Institute of Mathematical Sciences(柯朗数学科学研究所)

AI总结 该研究提出基于3D基础模型的Z3D方法,通过对其内部表示做潜在扩散,实现零样本下多数据集新视角真实感深度图的预测。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: this https URL (https://akola-mbey-denis.github.io/Z3D-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04172 2026-09-04 cs.AI cs.CL 新提交

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

大型语言模型的在线策略蒸馏再思考 II:一个训练示例

Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang, Ruhang Xiao, Cheng Qian, Qinyu Luo, Huan-ang Gao, Yudong Wang, Zhiyuan Liu, Ning Ding, Chaojun Xiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究通过单查询训练探究在线策略蒸馏(OPD)的训练数据作用,发现单查询 OPD 可恢复大部分全数据增益,16 个语义查询可匹配全数据效果,指出 OPD 数据过剩但算法不足,为后续研究指明方向。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04170 2026-09-04 cs.AI 新提交

A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms

自主研究群体中涌现的作弊与举报行为案例研究

Davide Paglieri, Logan Cross, Tim Genewein, Joel Z. Leibo, Nenad Tomasev, Alexander Sasha Vezhnevets

机构 * Google DeepMind(谷歌DeepMind)

AI总结 该研究以100个自主LLM智能体组成的研究集体为对象,发现其自发涌现作弊与举报行为,提出用制度机制支持自主群体去中心化自治的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04151 2026-09-04 cs.CV 新提交

Persistent Identity Preservation in Generative Image Models: A Benchmark and Evaluation System

生成式图像模型中的持久身份保留:基准与评估系统

Mengwei Ren, Xuaner Zhang, Zhihao Xia

机构 * Phota Labs Research(Phota实验室研究院)

AI总结 该研究针对生成式图像模型的身份保留问题构建基准,对比不同身份表示范式,发现PHOTA IDENTITY等持久身份方案可有效缓解身份退化,提升多场景下的身份保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04148 2026-09-04 cs.AI cs.CL 新提交

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学)

AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04147 2026-09-04 cs.LG cs.AI cs.RO 新提交

A Low-Cost, Open Platform for End-to-End Autonomous Driving on a Miniature Ackermann Vehicle

用于微型阿克曼车辆端到端自动驾驶的低成本开放平台

Gustavo Claudio Karl Couto, Eric Aislan Antonelo, Gabriel George Zipperer

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学)

AI总结 本文提出了一种微型阿克曼车辆端到端自动驾驶的低成本开放平台,实现命令条件式行为克隆,经仿真与真实实验验证,可完成赛道行驶,为仿真到真实研究提供测试平台并发布以支持可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04134 2026-09-04 cs.LG cs.NE q-bio.NC 新提交

Prospective Coding Improves Learning in Deep Continuous-Time Recurrent Networks

前瞻性编码改善深度连续时间循环网络的学习效果

Shivang Rawat, Mirko Morello, Flaviano Morone, David J. Heeger

机构 * Telepath New York University(纽约大学)

AI总结 该研究开发递归正交滤波器(RQFs)并提出前瞻性输入编码修正,缓解深度连续时间循环网络的梯度衰减,在语音命令等任务上取得优异性能,验证了其参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04131 2026-09-04 cs.CV 新提交

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

超越检索:面向流视频理解的渐进式潜在记忆演化

Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究针对流视频理解中存储-检索范式无法内化历史证据的问题,提出LatentStream框架,通过分层内存组织、渐进式演化及置信度优化实现流记忆的检索-内化,在视频基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04128 2026-09-04 cs.AI 新提交

Environment Evolution for Terminal Agents

终端智能体的环境演化

Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang

机构 * Hunyuan Team, Tencent(腾讯混元团队)

AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04127 2026-09-04 cs.AI 新提交

Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable

LLM推荐的认知保证:当真实值不可用时表征依赖的基础

Shai Vardi, João Sedoc

机构 * University of South Florida(南佛罗里达大学) Muma College of Business(马玛商学院) New York University(纽约大学)

AI总结 针对LLM推荐缺乏可靠依赖依据的问题,引入认知保证构造并通过四级依赖证书实现,经验证其能有效表征LLM推荐的依赖基础,与置信度、决策难度无关。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04120 2026-09-04 cs.CV 新提交

BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能

Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。

Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04113 2026-09-04 cs.LG cs.GT 新提交

Constant regret in general games via higher-order optimism

通过高阶乐观策略实现一般博弈中的常数遗憾

Omar Abbadi, Rida Laraki, Panayotis Mertikopoulos

机构 * Univ. Mohammed VI Polytechnic(穆罕默德六世大学) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化研究所) Grenoble INP(格勒诺布尔工业大学) LIG(信息与信号处理实验室)

AI总结 本文提出带折扣的高阶乐观算法(HOOD),作为OptFTRL的变体,可在N玩家标准型博弈中保证O(N³log²K)的个体遗憾,消除了此前实现一般博弈常数遗憾的关键障碍,且与同期独立工作有相似性。

Comments 42 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04110 2026-09-04 cs.CV 新提交

The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs

时间的形态:用于视频语言模型(VideoLMs)时间理解的视频 token 对比

Yumeng Shi, Quanyu Long, Yin Wu, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对 VideoLMs 时间理解中监督与视频表示不匹配的问题,提出 VT-Contrast 表示级时间反事实目标,通过对比视频 token 的顺序视图与反事实提升时间理解性能,且无需改动架构。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04108 2026-09-04 cs.CL cs.AI cs.LG 新提交

Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

顺序式优于联合式:论在线蒸馏与可验证奖励强化学习的相互作用

Boyan Li, Bingsen Chen, Chenghao Yang, Ping Nie, Chen Zhao, Xi Ye

机构 * New York University(纽约大学) University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学) NYU Shanghai(纽约大学上海分校) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

AI总结 该研究提出OPD-then-RL的两阶段方案,在逻辑与数学推理基准上优于纯OPD、纯RLVR及联合基线,为结合两种后训练方法提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏