arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-05-14 至 2026-05-14 共收录 11
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13333 2026-05-14 cs.CV cs.AI cs.GR cs.LG

Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation

通过超网络驱动的低秩适应生成风格化文本到动作生成

Junhyuk Jeon, Seokhyeon Hong, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国庆熙大学视觉媒体实验室)

AI总结 本文提出轻量级风格条件框架,通过超网络生成LoRA参数动态调节预训练扩散模型,实现高效且通用的风格化动作生成。

Comments Accepted to SIGGRAPH 2026. Project page: https://junhyukjeon.github.io/projects/style-salad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13131 2026-05-14 cs.LG cs.RO

ERPPO: Entropy Regularization-based Proximal Policy Optimization

ERPPO:基于熵正则化的近端策略优化

Changha Lee, Gyusang Cho

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出ERPPO算法,通过引入熵正则化项解决多维环境中多智能体强化学习的非平稳观测问题,提升目标定位的准确性和稳定性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12919 2026-05-14 cs.CV

GuardMarkGS: Unified Ownership Tracing and Edit Deterrence for 3D Gaussian Splatting

GuardMarkGS: 3D高斯溅射的统一所有权追溯与编辑威慑

Utae Jeong, Jaewan Choi, Junseok Lee, Jongheon Jeong, Sang Ho Yoon, ByoungSoo Koh, Sangpil Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Hanshin University(汉西大学)

AI总结 本文提出GuardMarkGS框架,通过结合全局水印目标与对抗目标,实现3D高斯溅射资产的统一所有权追溯与未经授权编辑的威慑,实验表明其在比特精度、编辑威慑和渲染质量间取得良好平衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11572 2026-05-14 cs.CV

TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning

TB-AVA:文本作为语义桥梁用于音频-视觉参数高效微调

Seongah Kim, Dinh Phu Tran, Hyeontaek Hwang, Saad Wazir, Duc Do Minh, Daeyoung Kim

机构 * AI2 Lab, KAIST(AI2实验室,韩国科学技术院)

AI总结 本文提出利用文本作为语义桥梁,通过冻结音频和视觉编码器构建参数高效微调框架,实现音频与视觉流的文本介导交互,实验表明其在多个基准上取得最佳性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11347 2026-05-14 cs.LG cs.AI cs.CV

Gradient-Free Noise Optimization for Reward Alignment in Generative Models

生成模型中奖励对齐的无梯度噪声优化

Jeongsol Kim, Hongeun Kim, Jian Wang, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能实验室) Snap Inc.(Snap公司)

AI总结 本文提出ZeNO框架,通过路径积分控制问题实现无梯度噪声优化,适用于不可微生成器,展示了在蛋白质结构生成等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12575 2026-05-14 eess.IV cs.AI cs.CV

Are Compact Rationales Free? Measuring Tile Selection Headroom in Frozen WSI-MIL

紧凑的理性是否免费?测量冻结WSI-MIL中的瓷砖选择余地

Hyun Do Jung, Jungwon Choi, Soojung Choi, Yujin Oh, Hwiyoung Kim

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院) Department of Integrative Medicine, College of Medicine, Yonsei University(延世大学医学院整合医学系) Department of Biomedical Systems Informatics, College of Medicine, Yonsei University(延世大学医学院生物医学系统信息学系) H-Data Strategy Center, Hallym University Chuncheon Sacred Heart Hospital(翰林大学春川圣心医院H-Data战略中心)

AI总结 本文研究了冻结WSI-MIL中的后验理性高亮,通过FOCI层验证了在不重新训练的情况下,能否从紧凑的瓷砖子集恢复滑片级预测,展示了选择余地指数SHI及不同模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏