arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-02 至 2026-06-02 共收录 34
2606.02578 2026-06-02 cs.CV cs.AI

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02491 2026-06-02 cs.CV

MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents

MORPHOS: 基于时间结构化潜变量的自回归4D生成

Minkyung Kwon, Jinhyeok Choi, Youngjin Shin, Jaeyeong Kim, JongMin Lee, Seungryong Kim

机构 * KAIST AI(韩国国立科学技术院人工智能实验室)

AI总结 提出MORPHOS框架,利用时间结构化潜变量(T-SLAT)统一表示4D动态资产,通过自回归因果注意力生成,解决多表示兼容、拓扑变化和长时间一致性问题。

Comments Project page: https://cvlab-kaist.github.io/MORPHOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02479 2026-06-02 cs.CV

Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation

检索缺失内容:面向一致长视频生成的覆盖最大化检索

Minseok Joo, Dogyun Park, Taehoon Lee, Kyujin Lee, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院)

AI总结 提出基于深度的覆盖最大化检索增强生成框架COVRAG,利用预训练3D先验构建轻量级覆盖图作为记忆证据,通过迭代检索最大化残差覆盖来提升长视频生成的几何一致性。

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02096 2026-06-02 cs.CV

WebSpline: Structure-Informed Splines for Real-Time 3D Gaussians from Monocular Videos

WebSpline:面向单目视频实时三维高斯的结构化样条

Jongmin Park, Jeonghwan Yun, Minh-Quan Viet Bui, Munchurl Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出WebSpline框架,利用结构信息样条(SIS)表示和结构代理图(SPG),实现从单目视频中实时、高保真、结构连贯的动态三维高斯重建。

Comments The first two authors contributed equally to this work (equal contribution). Please visit our project page at https://kaist-viclab.github.io/webspline-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02047 2026-06-02 stat.ML cs.LG math.ST stat.ME stat.TH

Convex Distance Operator Transport: A Convex and Geometry-Preserving Formulation

凸距离算子传输:一种凸且保持几何的公式

Junhyoung Chung, Euijong Song, Won Hwa Kim, Gunwoong Park

机构 * KAIST(韩国科学技术院)

AI总结 提出凸距离算子传输(CDOT),通过算子正则化联合保持特征对应与内在几何结构,实现异质分布对齐,并证明其伪度量性质及与Gromov-Wasserstein的关系。

Comments This paper is 41 pages long, contains 6 figures, and has been accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01686 2026-06-02 cs.SD cs.AI

HAIM: Human-AI Music Datasets for AI Music Production Tracking Benchmark

HAIM: 用于AI音乐制作跟踪基准的人机音乐数据集

Seonghyeon Go, Yumin Kim

机构 * KAIST(韩国科学技术院)

AI总结 针对当前AI音乐检测局限于二元分类的不足,提出HAIM数据集,通过多阶段标签定义“AI音乐跟踪”任务,评估现有检测器缺陷,推动向细粒度结构化评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01021 2026-06-02 cs.CV

Learning Neural Deformation Representation for 4D Dynamic Shape Generation

学习神经变形表示用于4D动态形状生成

Gyojin Han, Jiwan Hur, Jaehyun Choi, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出一种新的神经变形表示,结合条件神经符号距离场,设计解耦运动与形状潜在空间的4D表示架构,通过扩散模型生成高质量、高时间一致性的4D动态形状。

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01014 2026-06-02 cs.CV cs.AI

Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

基于文本的三维人体运动编辑中的跨轴特征融合与关节运动差异预测

Gyojin Han, Junmo Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

AI总结 提出一种跨轴特征融合架构和辅助任务,通过联合锚定变换器预测关节运动差异,实现文本驱动的三维人体运动编辑,在MotionFix数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00460 2026-06-02 cs.CL eess.AS

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

SALSA: 通过学习的引导激活向量实现语音感知的LLM适配

Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng, Julia Hockenmaier, Chang D. Yoo, Mark A. Hasegawa-Johnson

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出SALSA方法,通过监督学习优化逐层引导向量,在儿童语音、多语种语音和普通话-英语代码切换基准上显著提升零样本推理和语音上下文学习性能,最高相对提升46.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30748 2026-06-02 cs.SD cs.AI eess.AS

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

Chatterbox-Flash: 用于流式零样本TTS的先验校准块扩散

Deokjin Seo, Gangin Park, Kihyun Nam

机构 * Resemble AI Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 提出Chatterbox-Flash,通过将预训练自回归TTS解码器微调为块扩散解码器,实现块内并行生成与块间流式推理,并引入先验校准评分和早期解码调度解决长尾分布导致的生成质量下降问题。

Comments 8 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08646 2026-06-02 cs.LG

Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation

梯度预处理实现高效可靠的奖励引导生成

Jisung Hwang, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 提出一种梯度预处理方法,通过将奖励梯度投影到白高斯噪声可行集上,实现一步生成模型在奖励引导生成中的高效性和可靠性,防止奖励黑客攻击并加速优化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01711 2026-06-02 cs.RO cs.LG

Contrastive Representation Regularization for Vision-Language-Action Models

视觉-语言-动作模型的对比表示正则化

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

AI总结 提出机器人状态感知对比损失(RS-CL),通过对比学习对齐VLM表示与机器人本体感受状态,提升VLA模型在机器人操作任务中的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01752 2026-06-02 cs.LG

Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions

鲁棒线性决斗赌博机:在未知延迟和对抗性破坏下的服务后上下文

Youngmin Oh

机构 * KAIST(韩国科学技术院)

AI总结 针对同时存在服务后上下文、延迟反馈和对抗性破坏的易变环境,提出RCDP-UCB算法,通过预测服务后上下文和自适应加权策略,实现了延迟无关的遗憾上界,并揭示了破坏与延迟之间的加性成本结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18077 2026-06-02 cs.AI cs.LG cs.MA

LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

LLM引导的通信用于合作多智能体强化学习

Sangjun Bae, Yisak Park, Sanghyeon Lee, Seungyul Han

机构 * KAIST(韩国科学技术院)

AI总结 提出LMAC框架,利用大语言模型的推理能力设计通信协议,使所有智能体尽可能准确一致地重建底层状态,从而提升多智能体强化学习中的状态重建和性能。

Comments 9 pages for main, 32 pages for total, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16451 2026-06-02 cs.LG cs.AI

Physics-Guided Geometric Diffusion for Macro Placement Generation

物理引导的几何扩散用于宏单元布局生成

Jongho Yoon, Jinsung Jeon, Seokhyeong Kang

机构 * POSTECH Institute of Artificial Intelligence(POSTECH人工智能研究所) KAIST InnoCORE LLM(韩国科学技术院InnoCORE语言模型实验室) Seoul National University(首尔国立大学) Pohang University of Science and Technology(釜山科学技术大学)

AI总结 提出MacroDiff+框架,通过双域去噪架构和物理引导采样策略,在宏单元布局中同时优化拓扑连接和物理约束,在ISPD2005 MMS基准上实现线长减少6.1-6.2%。

Comments Accepted to IJCAI 2026. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13178 2026-06-02 cs.CV cs.AI

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

CLIP Tricks You: 面向大型视觉-语言模型中高效像素定位的无训练令牌剪枝

Sangin Lee, Yukyung Choi

机构 * KAIST(韩国科学技术院)

AI总结 提出LiteLVLM,一种无需训练、文本引导的令牌剪枝策略,通过反转CLIP视觉-文本相似度排序,保留指代区域令牌并恢复上下文令牌,实现高效像素定位推理,在多种令牌预算下性能提升超5%,保持90%原始性能同时加速22%并减少2.3倍内存。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12634 2026-06-02 cs.AI

MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents

MobiBench: 面向移动GUI智能体的多分支模块化基准

Youngmin Im, Byeongung Jo, Jaeyoung Wi, Seungwoo Baek, Tae Hoon Min, Joo Hyung Lee, Sangeun Oh, Insik Shin, Sunjae Lee

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(全北大学) Korea University(韩国大学) Fluiz

AI总结 提出MobiBench,首个模块化且支持多路径感知的离线基准测试框架,用于高保真、可扩展和可复现地评估移动GUI智能体,并揭示组件级性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17415 2026-06-02 cs.LG cs.AI cs.CV

Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models

奖励分数匹配:统一流模型和扩散模型的基于奖励的微调

Jeongjae Lee, Jinho Chang, Jeongsol Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Korea(人工智能研究生院,韩国科学技术院)

AI总结 提出奖励分数匹配(RSM)框架,统一了多种基于奖励的微调方法,通过分数匹配与值引导目标对齐,简化了设计空间并提高了效率。

Comments 43 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14405 2026-06-02 cs.LG cs.AI

ES-Merging: Biological MLLM Merging via Embedding Space Signals

ES-Merging: 通过嵌入空间信号进行生物多模态大模型合并

Wonbin Lee, Dongki Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

AI总结 提出ES-Merging框架,利用嵌入空间信号估计合并系数,实现生物多模态大模型的高效合并,提升跨模态推理和单模态知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12996 2026-06-02 cs.LG

DAPD: Dependency-Aware Parallel Decoding via Attention for Diffusion LLMs

DAPD: 面向扩散LLM的基于注意力的依赖感知并行解码

Bumjun Kim, Dongjae Jeon, Moongyu Jeon, Albert No

机构 * KAIST(韩国科学技术院)

AI总结 提出一种无需训练的并行解码方法DAPD,利用自注意力构建掩码标记的依赖图,通过选择独立集并行解码,避免强耦合标记同时更新,提升了扩散LLM的精度-步数权衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25837 2026-06-02 cs.LG cs.AI

Distillation of Large Language Models via Concrete Score Matching

通过具体分数匹配进行大型语言模型的蒸馏

Yeongmin Kim, Donghyeok Shin, Mina Kang, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出具体分数蒸馏(CSD)目标,通过离散分数匹配克服softmax平滑和logit平移不变性限制,实现学生与教师模型间所有词汇对相对logit差异的灵活加权,在GPT-2、OpenLLaMA和GEMMA上优于现有蒸馏方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23197 2026-06-02 cs.CL cs.LG stat.ML

Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models

微调不忘上下文学习:线性注意力模型的理论分析

Chungpa Lee, Jy-yong Sohn, Kangwook Lee

机构 * KAIST(韩国科学技术院)

AI总结 本文通过线性注意力模型理论分析,揭示了微调目标如何修改注意力参数并导致少样本性能下降的条件,提出仅更新值矩阵可保持上下文学习能力。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12080 2026-06-02 cs.LG

PathCRF: Ball-Free Soccer Event Detection via Possession Path Inference from Player Trajectories

PathCRF: 通过球员轨迹的控球路径推断实现无球足球事件检测

Hyunsung Kim, Kunhee Lee, Sangwoo Seo, Sang-Ki Ko, Jinsung Yoon, Chanyoung Park

机构 * KAIST(韩国釜山科学技术院) Fitogether Inc.(Fitogether公司) University of Seoul(首尔大学)

AI总结 提出PathCRF框架,仅利用球员轨迹数据,通过将轨迹建模为动态图并采用条件随机场(CRF)推断控球路径,实现无球足球事件检测,降低对人工标注和球轨迹数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05951 2026-06-02 cs.CV cs.AI cs.LG

Better Source, Better Flow: Learning Condition-Dependent Source Distribution for Flow Matching

更好的源,更好的流:学习条件依赖的源分布用于流匹配

Junwan Kim, Jiho Park, Seonghu Jeon, Seungryong Kim

机构 * New York University(纽约大学) KAIST AI(韩国科学技术院人工智能实验室)

AI总结 本文提出在流匹配框架中学习条件依赖的源分布,通过方差正则化和源-目标方向对齐,显著提升文本到图像生成的速度和质量。

Comments Project Page: https://junwankimm.github.io/CSFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23782 2026-06-02 cs.CL

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

弥合大语言模型在多项选择题中的知识-预测差距

Yoonah Park, Haesung Pyun, Yohan Jo

机构 * KAIST(韩国科学技术院)

AI总结 通过分析隐藏表示中的知识子空间和预测子空间,提出轻量级推理时干预方法KAPPA来对齐两者,从而减少LLM在多项选择题上的知识-预测差距。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03211 2026-06-02 cs.LG cs.AI

Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models

前瞻样本奖励引导用于扩散模型的测试时缩放

Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

机构 * KAIST(韩国科学技术院)

AI总结 提出一种高效测试时缩放方法LiDAR采样,通过前瞻几步采样和精确求解器引导粒子向高奖励区域移动,无需反向传播,在GenEval上达到与最新梯度引导方法相同性能且加速9.5倍。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01053 2026-06-02 cs.LG

LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents

LRAgent: 面向多LoRA LLM代理的高效KV缓存共享

Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

机构 * KAIST(韩国科学技术院)

AI总结 针对多LoRA代理系统中每个代理独立存储相同长轨迹的KV缓存导致内存和计算开销大的问题,提出LRAgent框架,通过将缓存分解为共享基座部分和适配器依赖部分,并利用共享A的多LoRA架构和Flash-LoRA-Attention内核,实现高效共享,在保持精度的同时显著降低开销。

Comments 25 pages, 10 figures, 22 tables

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏