arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2604.10950 2026-04-15 cs.CV

Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation

通过蒸馏辅助测试时适应提升视频语义分割模型

Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出DiTTA框架,通过高效测试时适应将图像分割模型转化为时间感知的视频分割模型,无需标注视频,实验表明其在VSPW和Cityscapes上表现优异。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07926 2026-04-15 cs.CV cs.AI

IMSE: Intrinsic Mixture of Spectral Experts Fine-tuning for Test-Time Adaptation

IMSE:内在光谱专家混合微调用于测试时间适应

Sunghyun Baek, Jaemyung Yu, Seunghee Koh, Minsu Kim, Hyeonseong Jeon, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) LG Energy Solution(LG能源解决方案)

AI总结 本文提出IMSE方法,通过分解线性层并仅更新奇异值,结合多样性最大化损失和领域感知光谱码检索,提升测试时间适应性能,在多种分布偏移基准测试中取得最佳效果,且在连续测试时间适应中提升准确率3.4个百分点,参数量减少385倍。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23104 2026-04-15 cs.CV

DC-TTA: Divide-and-Conquer Framework for Test-Time Adaptation of Interactive Segmentation

DC-TTA:用于交互分割测试时间适应的分而治之框架

Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Wooseong Jeong, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(Chung-Ang 大学)

AI总结 本文提出DC-TTA框架,通过分而治之策略改进交互分割中用户交互的适应性,提升复杂场景下的分割性能。

Comments accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11579 2026-04-14 cs.CV

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

透过触觉:基于触觉驱动的材料区域视觉定位

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

AI总结 本文提出通过密集跨模态特征交互学习局部视觉-触觉对齐,生成触觉条件下的材料分割热图,提升材料区域视觉定位的鲁棒性和多样性。

Comments CVPR 2026. Project page: https://mm.kaist.ac.kr/projects/SeeingThroughTouch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11466 2026-04-14 cs.MA cs.AI

SLALOM: Simulation Lifecycle Analysis via Longitudinal Observation Metrics for Social Simulation

SLALOM:通过纵向观测度量进行社会模拟的仿真生命周期分析

Juhoon Lee, Joseph Seering

机构 * School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 本文提出SLALOM框架,通过纵向观测度量评估仿真过程的可信度,结合POM方法和DTW技术,提升社会模拟的结构性真实性和政策模拟标准。

Comments CHI 2026 PoliSim@CHI 2026: LLM Agent Simulation for Policy Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17755 2026-04-14 cs.CL

HyperGraphPro: Progress-Aware Reinforcement Learning for Structure-Guided Hypergraph RAG

HyperGraphPro: 为结构引导的超图RAG设计的进度感知强化学习

Jinyoung Park, Sanghyeok Lee, Omar Zia Khan, Hyunwoo J. Kim, Joo-Kyung Kim

机构 * KAIST(韩国科学技术院) Microsoft(微软) Amazon(亚马逊)

AI总结 HyperGraphPro通过结合语义相关性和图连接性,改进超图检索机制,采用基于进度的逐步策略优化,提升多步推理的准确性和生成质量。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15420 2026-04-14 cs.LG

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

FlowBind: 任意到任意生成的高效方法

Yeonwoo Cha, Semin Kim, Jinhyeon Kwon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 本文提出FlowBind框架,通过共享潜在空间和双向流实现高效任意模态生成,减少数据和计算成本,实验显示生成质量与传统方法相当。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13255 2026-04-14 cs.LG

BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation

BézierFlow:学习Bézier随机插值调度器用于少步生成

Yunhong Min, Juil Koo, Seungwoo Yoo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 BézierFlow通过学习Bézier随机插值调度器,实现少步生成的性能提升,采用轻量训练方法,在10次NFE内提升2-3倍性能,且训练时间仅需15分钟。

Comments ICLR 2026, Project page: https://bezierflow.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10152 2026-04-14 cs.AI cs.LG

SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding

SpecMoE:通过自辅助推测解码实现快速高效的专家混合推理

Jehyeon Bang, Eunyeong Cho, Ranggi Hwang, Jinha Chung, Minsoo Rhu

机构 * KAIST(韩国科学技术院) UNIST(蔚山科学技术院)

AI总结 本文提出SpecMoE,一种基于自辅助推测解码算法的高效MoE推理系统,显著提升推理吞吐量并减少内存和互连带宽需求。

Comments This is an extended version of our work, which is accepted for publication at the 63rd ACM/IEEE Design Automation Conference (DAC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09692 2026-04-14 cs.AI cs.CV

Tipiano: Cascaded Piano Hand Motion Synthesis via Fingertip Priors

Tipiano:通过指尖先验知识实现钢琴手部运动的级联合成

Joonhyung Bae, Kirak Kim, Hyeyoon Cho, Sein Lee, Yoon-Seok Choi, Hyeon Hur, Gyubin Lee, Akira Maezawa, Satoshi Obata, Jonghwa Park, Jaebum Park, Juhan Nam

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) Seoul National University(首尔大学)

AI总结 本文提出Tipiano框架,利用钢琴运动的自然层级结构,通过指尖定位、轨迹细化、手腕估计和姿态合成四个阶段,实现高精度自然的钢琴手部运动合成,实验表明其性能优于扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09605 2026-04-14 cs.HC cs.AI

Human-AI Interaction Traces as Blackout Poetry: Reframing AI-Supported Writing as Found-Text Creativity

人类-人工智能交互痕迹作为黑屏诗:重新定义AI支持的写作作为发现文本创作

Syemin Park, Soobin Park, Youn-kyung Lim

机构 * Department of Industrial Design, KAIST(韩国科学技术院工业设计系)

AI总结 本文探讨将AI写作交互痕迹视为表达性艺术制品,通过黑屏诗启发,重新审视人类与AI协作中的意义创造,提升读者对创作贡献的理解与信任。

Comments 4 pages, Accepted to ACM CHI 2026 Workshop on Herding CATs: Making Sense of Creative Activity Traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09585 2026-04-14 cs.HC cs.AI cs.CV

Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition

基于眼动数据的视觉提示在基于多模态LLM的人类活动识别中的评估

Jae Young Choi, Seon Gyeom Kim, Hyungjun Yoon, Taeckyung Lee, Donggun Lee, Jaeryung Chung, Jihyung Kil, Ryan Rossi, Sung-Ju Lee, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

AI总结 本文通过眼动数据可视化方法提升多模态LLM处理高频传感器数据的效率,验证了视觉提示在人类活动识别中的有效性与扩展性。

Comments 6 pages. Conditionally accepted to IEEE PacificVis 2026 (VisNotes track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09405 2026-04-13 cs.CV

EGLOCE: Training-Free Energy-Guided Latent Optimization for Concept Erasure

EGLOCE:无需训练的能量引导潜在优化用于概念擦除

Junyeong Ahn, Seojin Yoon, Sungyong Baik

机构 * KAIST AI(韩国科学技术院人工智能) Hanyang University(汉阳大学)

AI总结 EGLOCE通过在推理过程中重新定向噪声潜在变量,实现无需训练的概念擦除,结合排斥能量和保留能量,提升图像质量和提示对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08986 2026-04-13 cs.CL cs.AI

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

PerMix-RLVR: 在可验证奖励对齐下保持人物表达性

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) Samsung Advanced Institute of Technology(三星高级技术研究院) Seoul National University(首尔国立大学)

AI总结 本文提出PerMix-RLVR方法,通过训练阶段处理人物敏感性,平衡模型在不同人物设定下的鲁棒性和表现真实性,提升任务性能和人物表达 fidelity。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07994 2026-04-13 cs.CV

SAT: Selective Aggregation Transformer for Image Super-Resolution

SAT:用于图像超分辨率的选择性聚合变换器

Dinh Phu Tran, Thao Do, Saad Wazir, Seongah Kim, Seon Kwon Kim, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国科学技术院计算机学院)

AI总结 本文提出SAT变换器,通过选择性聚合关键值矩阵,减少计算复杂度并扩大模型感受野,实现高效且高质量的图像超分辨率。

Comments Accepted to CVPR2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03342 2026-04-13 cs.CV cs.AI cs.LG

Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution

分块提示:克服图像和视频超分辨率中的提示误导

Bryan Sangwoo Kim, Jonghyun Park, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能学院)

AI总结 本文提出Tiled Prompts框架,通过为每个潜在块生成特定提示,解决传统全局提示在超分辨率中的误导问题,提升图像和视频的感知质量和真实性。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03074 2026-04-13 stat.ML cs.LG

GL-LowPopArt: A Nearly Instance-Wise Minimax-Optimal Estimator for Generalized Low-Rank Trace Regression

GL-LowPopArt:一种近似实例最优的广义低秩迹回归估计器

Junghyun Lee, Kyoungseok Jang, Kwang-Sung Jun, Milan Vojnović, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) CAU AI(中央大学人工智能系) POSTECH CSE/AI(浦项工业大学计算机科学与工程/人工智能系) LSE Statistics(伦敦政治经济学院统计学系)

AI总结 本文提出GL-LowPopArt估计器,结合核范数正则化与矩阵Catoni估计,改进了广义低秩迹回归的误差界,并引入了新的实验设计目标GL(π)。

Comments AISTATS 2026 (58 pages, 2 tables, 1 figure) (ver5: fixed some stuff from camera-ready version, significant revisions)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08456 2026-04-10 cs.CV cs.CL

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

熵-梯度基础:在视觉语言模型中无需训练的证据检索

Marcel Gröpl, Jaewoo Jung, Seungryong Kim, Marc Pollefeys, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) KAIST AI(韩国科学技术院人工智能系)

AI总结 本文提出一种无需训练的视觉语言模型证据检索方法,通过熵梯度映射提升对微小视觉细节和多区域线索的处理能力,实验显示在多个基准上取得显著改进。

Comments Project Page : https://entropy-gradient-grounding.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12184 2026-04-10 cs.CV cs.AI

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CompoDistill:多模态大语言模型中基于注意力的知识蒸馏用于组合推理

Jiwan Kim, Kibum Kim, Sangwoo Seo, Chanyoung Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CompoDistill,通过显式对齐学生与教师模型的视觉注意力,提升多模态大语言模型的组合推理能力,同时保持视觉问答任务的性能。

Comments ICLR'26, Project Page : https://ptkjw1997.github.io/CompoDistill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06837 2026-04-09 cs.LG

Contraction-Aligned Analysis of Soft Bellman Residual Minimization with Weighted Lp-Norm for Markov Decision Problem

基于软贝尔曼残差最小化与加权Lp范数的马尔可夫决策问题收缩对齐分析

Hyukjun Yang, Han-Dong Lim, Donghwan Lee

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程系)

AI总结 本文提出基于加权Lp范数的软贝尔曼残差最小化方法,通过调整p值对齐贝尔曼算子的收缩几何特性,推导出性能误差界,改进误差传播控制并保持梯度优化兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10510 2026-04-09 cs.LG cs.AI

Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning

自适应回放缓冲区用于离线到在线强化学习

Chihyeon Song, Jaewoo Lee, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Omelet

AI总结 本文提出自适应回放缓冲区,通过动态优先级采样提升离线到在线强化学习的性能,实验表明其能有效缓解早期性能下降并提高最终表现。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03046 2026-04-09 cs.LG

Bayesian E(3)-Equivariant Interatomic Potential with Iterative Restratification of Many-body Message Passing

贝叶斯E(3)等价互原子势与多体信息传递的迭代重分配

Soohaeng Yoo Willow, Tae Hyeon Park, Gi Beom Sim, Sung Wook Moon, Seung Kyu Min, D. ChangMo Yang, Hyun Woo Kim, Juho Lee, Chang Woo Myung

机构 * Sungkyunkwan University(成均馆大学) Institute for Basic Science (IBS)(基础科学研究院) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) Korea Institute of Science and Technology Information(韩国科学技术信息研究院) Gwangju Institute of Science and Technology(光州科学技术院) KAIST(韩国科学技术院)

AI总结 本文提出一种贝叶斯E(3)等价机器学习势,通过迭代重分配多体信息传递来解决不确定性量化问题,提升了能量和力的预测精度,并在主动学习和异常检测中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10073 2026-04-08 cs.CV cs.AI

ReaMIL: Reasoning- and Evidence-Aware Multiple Instance Learning for Whole-Slide Histopathology

ReaMIL:基于推理和证据的多实例学习用于整张滑片病理学

Hyun Do Jung, Jungwon Choi, Hwiyoung Kim

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

AI总结 ReaMIL通过引入轻量选择头改进多实例学习,实现紧凑证据集和高准确率,在病理学图像分类中表现优异。

Comments Accepted at LFMBio Workshop, WACV 2026. Oral Presentation

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, March 2026, pp. 40-45

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05779 2026-04-08 cs.CL cs.AI

What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"

什么模型知道,它知道得有多好:基于知识加权的微调方法用于学习何时说“我不知道”

Joosung Lee, Hwiyeol Jo, Donghyeon Ko, Kyubyung Chae, Cheonbok Park, Jeonghoon Kim

机构 * NAVER CLOUD(NAVER云) Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 本文提出一种基于知识加权的微调方法,通过估计实例级知识评分来提升模型在知识不足时的不确定性表达能力,同时保持对已知问题的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05724 2026-04-08 cs.CV

Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP

超越语义:在稀疏自编码器中解构信息范围以用于CLIP

Yusung Ro, Jaehyun Choi, Junmo Kim

机构 * KAIST(韩国科学技术院) Korea AI Safety Institute, ETRI(韩国电子通信研究院人工智能安全研究所)

AI总结 本文提出信息范围作为理解CLIP表示的新维度,通过Contextual Dependency Score量化稀疏自编码器特征的广度,揭示不同信息范围特征对CLIP预测和置信度的影响差异。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05417 2026-04-08 cs.CL

Multi-Drafter Speculative Decoding with Alignment Feedback

多草案生成与对齐反馈

Taehyeon Kim, Hojung Jung, Se-Young Yun

机构 * LG AI Research(LG AI研究院) KAIST AI(韩国科学技术院人工智能学院)

AI总结 本文提出MetaSD框架,通过整合多个草案生成器并利用对齐反馈,提升大规模语言模型推理效率和生成质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏