arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1460
2604.03316 2026-07-28 cs.CV 版本更新

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29227 2026-07-28 cs.RO 版本更新

Kernel-SDF: An Open-Source Library for Real-Time Signed Distance Function Estimation using Kernel Regression

基于核回归的SDF库:利用核回归进行实时符号距离函数估计的开源库

Zhirui Dai, Tianxing Fan, Mani Amani, Jaemin Seo, Ki Myung Brian Lee, Hyondong Oh, Nikolay Atanasov

机构 * University of California, San Diego(加州大学圣地亚哥分校) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出Kernel-SDF开源库,通过核回归实时估计带不确定性的符号距离函数,提供高精度SDF、梯度和网格构造,适用于机器人应用。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2026; code: https://github.com/ExistentialRobotics/kernel_sdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21371 2026-07-24 cs.CV cs.AI 新提交

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

机构 * Multimodal Intelligence and Perception Lab., DGIST(多模态智能与感知实验室,大邱庆北科学技术院) Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

AI总结 研究针对开放词汇语义分割中视觉与文本对齐问题,提出基于ODE的DINOde框架,通过语义文本流和全局上下文流、速度切向投影等组件,连续对齐视觉与文本,实验证明该方法优于现有方法,性能达领先水平。

Comments Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21179 2026-07-24 cs.CV 新提交

Out of Sight, Still in Mind: Token Compression for Omni-LLMs

视而不见,仍记于心:全模态大语言模型的令牌压缩

Suho Yoo, Youngjoon Jang, Hyebin Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉几何组)

AI总结 研究旨在降低Omni-LLMs推理时输入令牌成本,提出无需训练的ReMo框架,通过跨模态重分配信息压缩视觉令牌,在Qwen2.5-Omni上实验,去除54%输入令牌且准确率无损失,甚至略超全令牌模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20561 2026-07-24 cs.LG cs.CV 新提交

CT-Merging: Consensus Directions and Task-Level Scaling for LoRA Adapter Merging

CT-Merging:用于LoRA适配器合并的共识方向和任务级缩放

Keumseo Ryum, Joonhyuk Kang

机构 * KAIST(韩国科学技术院)

AI总结 研究针对LoRA适配器合并中系数不匹配问题,提出CT-Merging算法,通过平均任务子空间投影仪估计共识方向并分配任务级系数缩放,利用跨任务SVD子空间构建公共基础,在基准测试中比现有方法准确率更高。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20473 2026-07-24 cs.AI 新提交

Incomplete Prompt Jailbreaks in Large Language Models

大语言模型中的不完整提示越狱

Yeonjea Kim, Bumjin Park, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI(因尼吉)

AI总结 研究大语言模型中不完整提示越狱现象,通过实证表征其何时及如何引发有害延续,分析相关吸引子类型,指出参数调整训练模型拒绝不完整有害提示不足,识别终止和延续神经元,强调神经元级干预对防御的潜力。

Comments Accepted to ACL 2026 Findings. 15 pages (9 pages for main body), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13026 2026-07-24 cs.LG cs.AI cs.CL 版本更新

Understanding and Accelerating the Training of Masked Diffusion Language Models

理解并加速掩码扩散语言模型的训练

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) University of Tokyo(东京大学) Sony Group Corporation(索尼集团)

AI总结 本文研究了掩码扩散模型训练缓慢的原因,提出bell-shaped时间采样策略,显著提升训练效率和模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05964 2026-07-24 cs.CV 版本更新

QATMA: Quantization-Aware Training with Multimodal Alignment for Open-Vocabulary Object Detection

CR-QAT: 基于课程关系量化感知训练的开放词汇目标检测

Jinyeong Park, Donghwa Kang, Seunghwan An, Insoo Kim, Brent ByungHoon Kang, Hyeongboo Baek, Jibum Kim

机构 * Incheon National University, Incheon, South Korea(韩国仁川国立大学) KAIST, Daejeon, South Korea(韩国成均馆大学) University of Seoul, Seoul, South Korea(首尔大学)

AI总结 CR-QAT通过课程关系量化感知训练提升开放词汇目标检测在低比特设置下的性能,实现显著的AP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22699 2026-07-24 cs.LG cs.CR

Exactly Minimax-Optimal Locally Differentially Private Sampling

精确的最小最大最优局部差分隐私采样

Hyun-Young Park, Shahab Asoodeh, Si-Hyeon Lee

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Department of Computing and Software, McMaster University(麦斯特大学计算机与软件系)

AI总结 本文提出了一种在局部差分隐私下精确最优的采样机制,通过f-散度度量效用,实现了有限和连续数据空间的最优隐私-效用权衡。

Comments 32 pages and 7 figures. Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-07-23 cs.RO cs.CV 新提交

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19362 2026-07-23 cs.AI cs.IR 新提交

GraphContainer: A Unified Platform for Comparing and Debugging Graph RAG Methods

GraphContainer:用于比较和调试图RAG方法的统一平台

Seonho An, Chaejeong Hyun, Min-Soo Kim

机构 * KAIST(韩国科学技术院)

AI总结 研究针对图RAG方法分散不兼容问题,提出GraphContainer平台,通过统一图表示层和图记录器两个关键组件,实现多格式图统一与检索过程可视化,助力可控比较不同图格式及检索策略,降低设计最优图RAG管道的难度。

Comments VLDB 2026 demo accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03698 2026-07-22 cs.LG 版本更新

Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策

Sangeun Park, Minhae Kwon

机构 * KAIST(韩国科学技术院)

AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18119 2026-07-21 stat.ML cs.LG 新提交

COVAriance-Induced Fairness Gap Penalty for Subgroup-Fair Clustering

用于子群公平聚类的协方差诱导公平差距惩罚

Kyungseon Lee, Hankyo Jeong, Kunwoong Kim, Kwanho Lee, Yongdai Kim

机构 * Department of Statistics, Seoul National University(首尔国立大学统计系) KAIST AI(韩国科学技术院人工智能研究所)

AI总结 研究在多敏感属性定义多个子群时的公平聚类问题,提出基于协方差诱导公平差距惩罚的方法,推导代理并连续松弛,扩展框架捕捉子群 - 边际公平差距,实验证明算法在成本 - 公平权衡上有竞争力且提高计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17272 2026-07-21 cs.LG cs.SI 新提交

Node4All: Learning Node Representation Beyond Datasets

Node4All:超越数据集学习节点表示

Dooho Lee, Jaemin Yoo

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

AI总结 研究针对多数节点表示学习方法依赖特定数据集训练的问题,提出Node4All,基于通道图变换器和自监督学习构建,能跨任意图数据集泛化,在节点分类任务中表现出色,实现可复用性且实践效果好。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16926 2026-07-21 cs.CV 新提交

Splat-based 3D Scene Reconstruction with Extreme Motion-blur

基于体素的极端运动模糊3D场景重建

Hyeonjoong Jang, Dongyoung Choi, Donggun Kim, Woohyun Kang, Min H. Kim

机构 * KAIST(韩国科学技术院) HYPERGRAM(超图)

AI总结 研究针对低光照下RGB-D输入的极端运动模糊问题,提出结合高斯体素框架的相机姿态估计与图像去模糊方法,通过对齐帧、调整高斯位置等步骤,提升3D重建质量,优于现有方法,有广泛应用意义。

Journal ref Proceedings of IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03788 2026-07-21 cs.LG 版本更新

Tensor-Train Joint Modeling for Few-Step Discrete Diffusion

用于少步离散扩散的张量训练联合建模

Byoungkwon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 研究离散扩散少步生成潜力受限问题,用张量分解进行联合分布建模,支持多种分解方式,提出迭代边际推理程序,通过微调预训练模型大幅提升少步生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02722 2026-07-21 cs.AI cs.LG 版本更新

Enhancing LLMs' Clinical Reasoning with Real-World Data from a Nationwide Sepsis Registry

利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力

Junu Kim, Chaeeun Shim, Sungjin Park, Su Yeon Lee, Gee Young Suh, Chae-Man Lim, Seong Jin Choi, Song Mi Moon, Kyoung-Ho Song, Eu Suk Kim, Hong Bin Kim, Sejoong Kim, Chami Im, Dong-Wan Kang, Yong Soo Kim, Hee-Joon Bae, Sung Yoon Lim, Han-Gil Jeong, Edward Choi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Microsoft(微软) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心) Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心) Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)

AI总结 研究旨在增强大语言模型临床推理能力,利用全国脓毒症登记处数据构建问题,通过强化学习微调模型得到C-Reason,该模型在域内测试集表现出色,推理能力能推广到不同任务和疾病,为开发通用临床推理模型提供思路。

Comments Accepted at MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16012 2026-07-20 cs.CV cs.AI cs.RO 新提交

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

DPNeXt:用于基于高效视觉Transformer的多任务密集预测的轻量级多尺度特征融合框架

Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

AI总结 研究针对机器人感知系统多任务学习中现有解码策略瓶颈,提出DPNeXt框架,用双深度可分离倒置瓶颈及MTBG策略,在多任务密集预测上表现出色,相比DPT大幅减少参数并提升推理速度。

Comments 8 pages, 5 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15799 2026-07-20 cs.LG cs.AI 新提交

Knowledge-Assisted Multi-Graph Dependency Learning for Multivariate Time Series Anomaly Detection in Multi-Stage Industrial Processes

用于多阶段工业过程中多变量时间序列异常检测的知识辅助多图依赖学习

Jaeyeong Lee, Taeseong Yoon, Wonmo Koo, Heeyoung Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 针对多阶段工业过程中多变量时间序列异常检测问题,提出知识辅助多图框架并构建三个互补图,利用多图注意力网络建模,通过纳入过程知识显著提升异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15699 2026-07-20 cs.CV 新提交

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking

GoStop:基于强化学习的事件驱动特征跟踪中的自适应时间聚合

Youngho Kim, Hoonhee Cho, Jae-Young Kang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 研究基于事件相机的特征跟踪问题,提出用强化学习框架自适应控制事件累积过程,训练智能体依运动线索决策,引入新数据集评估,集成该框架到现有方法可提升性能,在动态运动下更具鲁棒性且平衡跟踪精度与效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16030 2026-07-20 quant-ph cs.AI cs.LG 新提交

Rethinking Quantum Continual Learning with Quantum Fisher Information

用量子费舍尔信息重新思考量子持续学习

Yu-Chao Hsu, Yu-Cheng Lin, Tai-Yue Li, Nan-Yow Chen, En-Jui Kuo

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院) Cross College Elite Program, National Cheng Kung University(成功学院精英计划,成功大学) National Center for High-Performance Computing , National Institutes of Applied Research (NIAR)(高性能计算中心,应用研究国立机构) Department of Electrophysics, National Yang Ming Chiao Tung University(电子物理系,交通大学)

AI总结 研究量子持续学习中变分量子分类器的灾难性遗忘问题,提出基于量子费舍尔信息的QEWC方法,通过量化参数化量子态内在敏感性减轻遗忘,实验表明该方法能改善任务保留,在量子态几何研究中有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14927 2026-07-17 cs.CV 新提交

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization

TanGO:通过切线空间引导和优化实现免训练3D编辑

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Hyeonseo Yun, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chung-Ang University(中央大学)

AI总结 研究针对3D生成模型免训练编辑存在语义伪影的问题,提出TanGO框架,通过在切线空间自适应逐令牌引导,制定最优控制规则并确定控制信号强度,减少结构伪影,性能优于现有基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03454 2026-07-17 cs.RO cs.LG 版本更新

ADP: Adversarial Dynamics Priors for Physically Grounded Humanoid Locomotion

ADP:用于物理基础类人机器人运动的对抗动力学先验

Seokju Lee, Jeongtae Lee, Jeonghyeok Lim, Jeonguk Kang, Byungwook Lee, Seungho Han, Keun Ha Choi, Dongil Park, Kyung-Soo Kim

机构 * Mechatronics, Systems and Control Lab (MSC Lab), Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院机械工程系机电一体化、系统与控制实验室(MSC实验室)) Samsung Electronics, Future Robotics AI Group(三星电子未来机器人人工智能集团) School of Electrical Engineering, Hanyang University(汉阳大学电气工程学院) Advanced Robotics Research Center, Korea Institute of Machinery & Materials (KIMM)(韩国机械与材料研究所先进机器人研究中心)

AI总结 提出对抗动力学先验(ADP)用于类人机器人抗干扰运动控制。以动力学特征取代运动学特征作对抗目标,用轨迹优化建参考数据集训练鉴别器,提升机器人抗干扰及运动跟踪能力。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19877 2026-07-17 cs.CL 版本更新

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13579 2026-07-16 cs.RO cs.AI cs.LG 新提交

Agile perceptive multi-skill locomotion for quadrupedal robots in the wild

野外四足机器人的敏捷感知多技能运动

Jun-Gill Kang, Jaehyun Park, Tae-Gyu Song, Joon-Ha Kim, Seungwoo Hong, Hae-Won Park

机构 * Agency for Defense Development(国防发展局) Korea Advanced Institute of Science and Technology(韩国科学技术院) DIDEN Robotics(迪登机器人公司) Korea University(韩国大学)

AI总结 研究使四足机器人在复杂地形实现多技能运动的问题,提出 APT-RL 框架,利用机载感知和计算自主转换技能,通过轨迹优化生成数据集训练技能,经实验验证该框架能让机器人在复杂环境敏捷机动,稳健穿越多样障碍物。

Comments Project page: https://skillquadsr.github.io/ ,This is the author's version of the work. It is posted here by permission of the AAAS for personal use, not for redistribution. The definitive version was published in Science Robotics on 7.15.2026; doi: 10.1126/scirobotics.adz7397. Jun-Gill Kang and Jaehyun Park are co-first authors. Seungwoo Hong and Hae-Won Park are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08803 2026-07-16 q-bio.QM cs.AI cs.LG 版本更新

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

TheBioCollection:用于生物学的统一预训练规模语言模型语料库

Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

机构 * Trillion Labs KAIST(韩国科学技术院) SK Biopharmaceuticals Co., Ltd.(SK生物制药公司) Lunit Inc.(Lunit公司) AIGEN Sciences Inc.(AIGEN科学公司)

AI总结 为满足生物学大语言模型训练需求,提出TheBioCollection语料库,整合异构生物资源并丰富记录、引入新任务,配对TheBioCollection-Eval评估,固定架构训练后模型在各领域表现提升,语言能力基本不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01060 2026-07-16 cs.RO 版本更新

RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation

RoboWorld: 用于通用机器人策略评估的快速可靠神经模拟器

Byeongguk Jeon, Seonghyeon Ye, JaeHyeok Doo, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院) Config

AI总结 提出RoboWorld自动化评估流程,结合快速自回归视频世界模型和任务进度感知视觉语言模型评分,通过Step Forcing减少训练-测试不匹配,实现与真实世界评估高度一致。

Comments Project page: https://byeongguks.github.io/RoboWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12829 2026-07-15 cs.LG cs.AI cs.CL 新提交

Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques

加速掩码扩散大语言模型:高效推理技术综述

Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Yonsei University(延世大学)

AI总结 综述介绍用于扩散大语言模型的统一延迟分解框架,以理清算法、架构和系统因素对推理速度的影响,将加速技术分类,提供可重复基准测试指导方针并强调实现并行生成潜力的挑战。

Comments Accepted at IJCAI-ECAI 2026 (Survey Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22432 2026-07-15 cs.LG 版本更新

AMUSE: Anytime Muon with Stable Gradient Evaluation

AMUSE: 任何时刻的Muon with Stable Gradient Evaluation

Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) Seoul National University(首尔国立大学)

AI总结 本文研究了Muon算法的机制,提出了一种名为AMUSE的算法,通过结合Muon的快速批量进步和Schedule-Free平均的稳定效果,实现了无需学习率调度的任何时刻训练,并在视觉任务和大语言模型预训练中提升了性能-迭代帕累托前沿。

Comments 44 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00492 2026-07-15 cs.AI 版本更新

Rethinking Reward Models for Multi-Domain Test-Time Scaling

重新思考多领域测试时扩展的奖励模型

Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) TH Nürnberg

AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。

详情

展开后加载摘要…

URL PDF HTML 收藏