arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2602.20951 2026-03-27 cs.CV cs.AI

See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis

查看并修复缺陷:通过代理数据合成使VLMs和扩散模型能够理解视觉缺陷

Jaehyun Park, Minyoung Ahn, Minkyu Kim, Jonghyun Lee, Jae-Gil Lee, Dongmin Park

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) KRAFTON

AI总结 本文提出ArtiAgent,通过代理数据合成生成真实与带缺陷图像对,有效减少视觉缺陷,提升模型对视觉缺陷的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24294 2026-03-26 cs.CV

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22201 2026-03-26 cs.RO

ACG: Action Coherence Guidance for Flow-based Vision-Language-Action models

ACG:基于流的视觉-语言-动作模型中的动作一致性指导

Minho Park, Kinam Kim, Junha Hyung, Hyojin Jang, Hoiyeong Jin, Jooyeol Yun, Hojoon Lee, Jaegul Choo

机构 * DAVIAN-Robotics, KAIST AI(DAVIAN机器人实验室,韩国科学技术院人工智能研究所)

AI总结 本文提出ACG算法,通过测试时指导提升视觉-语言-动作模型的动作一致性,从而在多种操作任务中提高成功率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22172 2026-03-26 cs.CV

CA-LoRA: Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

CA-LoRA:面向领域对齐的分割数据集生成的概念感知LoRA

Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi

机构 * KAIST(韩国科学技术院) Qualcomm AI Research(高通AI研究) Kyung Hee University(庆熙大学)

AI总结 本文提出CA-LoRA方法,通过文本到图像生成模型生成分割数据集,解决数据稀缺问题。该方法通过选择性更新与领域对齐相关的概念权重,提升生成样本的多样性和信息量,在城市场景分割中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23975 2026-03-26 cs.CV

HyDRA: Hybrid Domain-Aware Robust Architecture for Heterogeneous Collaborative Perception

HyDRA: 一种混合领域感知鲁棒架构用于异构协作感知

Minwoo Song, Minhee Kang, Heejin Ahn

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(电气工程学院,韩国科学技术院)

AI总结 HyDRA通过整合中间和晚期融合,在领域感知框架中解决异构协作感知中的性能退化问题,采用轻量级领域分类器和锚点引导姿态图优化,实现无需额外训练的性能提升。

Comments 8 pages, 6 figures, Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23803 2026-03-26 eess.SY cs.RO cs.SY

High-Density Automated Valet Parking with Relocation-Free Sequential Operations

高密度自动泊车中的无重定位顺序操作

Bon Choe, Minhee Kang, Heejin Ahn

机构 * School of Electrical Engineering(电气工程学院) KAIST(韩国科学技术院) Daejeon, South Korea(韩国大田)

AI总结 本文提出DROP框架,通过无重定位顺序操作提升高密度停车区域利用效率,结合布局设计与序列生成方法解决停车与取车问题。

Comments 7 pages, 6 figure. The results from all experiments are available at: https://drop-park.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21304 2026-03-26 cs.CV

F4Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting

F4Splat:面向前馈3D高斯点绘制的预测密集化

Injae Kim, Chaehyeon Kim, Minseong Bae, Minseok Joo, Hyunwoo J. Kim

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学)

AI总结 本文提出F4Splat,通过面向前馈3D高斯点绘制的预测密集化方法,引入基于密集度指导的分配策略,实现自适应的空间复杂度和多视角重叠的高斯点分配,减少冗余并提升重建质量。

Comments Project Page: $\href{https://mlvlab.github.io/F4Splat}{\text{this http URL}}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23499 2026-03-25 cs.CV

DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models

DA-Flow:基于扩散模型的降质感知光流估计

Jaewon Min, Jaeeun Lee, Yeji Choi, Paul Hyunbin Cho, Jin Hyeon Kim, Tae-Young Lee, Jongsik Ahn, Hwayeong Lee, Seonghyun Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Hanwha Systems(韩华系统)

AI总结 本文提出DA-Flow,通过融合扩散模型与卷积特征,提升在真实世界降质视频中的光流估计精度,优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/DA-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23487 2026-03-25 cs.CV

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23255 2026-03-25 cs.LG

Permutation-Symmetrized Diffusion for Unconditional Molecular Generation

排列对称扩散用于无条件分子生成

Gyeonghoon Ko, Juho Lee

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出在商流形上直接建模扩散,以实现分子点云生成的排列不变性,通过MCMC近似难以计算的排列后验,提升生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22837 2026-03-25 cs.CL

Analysing LLM Persona Generation and Fairness Interpretation in Polarised Geopolitical Contexts

分析极化地缘政治背景下大语言模型的人格生成与公平性解释

Maida Aizaz, Quang Minh Nguyen

机构 * Graduate School of Data Science(数据科学研究生院) KAIST(韩国科学技术院)

AI总结 本文研究了五种流行LLM在640种实验条件下生成巴勒斯坦和以色列身份人格的分布特征,揭示了模型在不同情境下对地缘政治身份的公平性解释差异。

Comments EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19250 2026-03-25 cs.CV cs.RO

Background Fades, Foreground Leads: Curriculum-Guided Background Pruning for Efficient Foreground-Centric Collaborative Perception

背景褪色,前景引领:基于课程学习的背景剪枝用于高效前景导向的协同感知

Yuheng Wu, Xiangbo Gao, Quang Tau, Zhengzhong Tu, Dongman Lee

机构 * KAIST(韩国科学技术院) Texas A&M University(德克萨斯A&M大学)

AI总结 本文提出FadeLead框架,通过课程学习策略在训练中学习将背景上下文压缩为紧凑的前景特征,提升协同感知的效率和效果。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20476 2026-03-25 cs.CV cs.MM eess.AS eess.IV

Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio

迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言

Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro

机构 * Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))

AI总结 本文提出首个统一框架,整合手语、唇形和音频生成口语文本,探索多模态协同作用,提升手语翻译性能。

Comments Updated the professional title of the corresponding author. Added an Acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22564 2026-03-25 cs.CV cs.AI cs.LG

PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

PRISM:基于渐进细化和插入的稀疏运动视频数据集压缩

Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim

机构 * Korea AI Safety Institute, ETRI(韩国人工智能安全研究所,ETRI) KAIST(韩国科学技术院) NAVER AI Lab(NAVER AI实验室)

AI总结 PRISM通过将视频视为统一的时空结构,解决视频处理计算成本高和时空依赖性难题,实现高效存储与复杂运动的保留。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07861 2026-03-25 cs.LG cs.AI cs.DS

Streaming Attention Approximation via Discrepancy Theory

通过偏差理论实现流式注意力近似

Ekaterina Kochetkova, Kshiteej Sheth, Insu Han, Amir Zandieh, Michael Kapralov

机构 * EPFL(苏黎世联邦理工学院) KAIST(韩国科学技术院) Google Research(谷歌研究)

AI总结 本文提出BalanceKV算法,基于几何过程选择平衡的Key和Value token,实现流式注意力近似,理论和实验均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22319 2026-03-25 cs.LG cs.AI

Sparsely-Supervised Data Assimilation via Physics-Informed Schrödinger Bridge

通过物理引导的薛定谔桥实现稀疏监督的数据同化

Dohyun Bu, Chanho Kim, Seokun Choi, Jong-Seok Lee

机构 * Department of Industrial \& Systems Engineering, KAIST, Daejeon, Repulic of Korea Department of Mathematical Sciences, KAIST, Daejeon, Repulic of Korea

AI总结 本文提出物理引导的条件薛定谔桥,利用低保真先验向观测条件的高保真后验传输,无需额外推理指导,实现快速且准确的时空场重建。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22057 2026-03-24 cs.CV

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

SpatialBoost: 通过语言引导的推理增强视觉表示

Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD NAVER Cloud(NAVER云)

AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。

Comments 35 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05146 2026-03-24 cs.LG cs.AI

Cross-talk based multi-task learning for fault classification of machine system influenced by multiple variables

基于交叉作用的多任务学习用于受多种变量影响的机器系统故障分类

Wonjun Yi, Rismaya Kumar Mishra, Yong-Hwa Park

机构 * Korea Adavanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院)

AI总结 本文提出基于交叉作用的多任务学习框架,用于处理受多种变量影响的机器系统故障分类问题,通过联合学习故障条件和其他变量,提升分类性能。

Comments Submitted to 32th International Congress on Sound and Vibration (ICSV32)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22169 2026-03-24 cs.CV cs.AI

Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization

通过群体相对策略优化实现实时长周期空气质量预报

Inha Kang, Eunki Kim, Wonjeong Ryu, Jaeyo Shin, Seungjun Yu, Yoon-Hee Kang, Seongeun Jeong, Eunhye Kim, Soontae Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院) Ajou University(全州大学) Kunsan University(全州大学)

AI总结 本文提出群体相对策略优化方法,解决传统模型在长周期空气质量预报中的误报问题,通过减少误报率提升预报可靠性。

Comments 31 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04822 2026-03-24 cs.CL

Shared Heritage, Distinct Writing: Rethinking Resource Selection for East Asian Historical Documents

共享遗产,迥异写作:重新审视东亚历史文件的资源选择

Seyoung Song, Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Genentech(基因科技)

AI总结 本文质疑通过古典汉语资源进行跨语言迁移在处理韩日古文历史文件的有效性,实验显示古典汉语数据对模型性能影响有限,强调需谨慎验证而非盲目依赖跨语言迁移。

Comments IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏