arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-03-25 至 2026-03-25 共收录 14
2603.23499 2026-03-25 cs.CV

DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models

DA-Flow:基于扩散模型的降质感知光流估计

Jaewon Min, Jaeeun Lee, Yeji Choi, Paul Hyunbin Cho, Jin Hyeon Kim, Tae-Young Lee, Jongsik Ahn, Hwayeong Lee, Seonghyun Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Hanwha Systems(韩华系统)

AI总结 本文提出DA-Flow,通过融合扩散模型与卷积特征,提升在真实世界降质视频中的光流估计精度,优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/DA-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23487 2026-03-25 cs.CV

TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation

TETO:利用教师观察进行事件跟踪以实现运动估计和帧插值

Jini Yang, Eunbeen Hong, Soowon Son, Hyunkoo Lee, Sunghwan Hong, Sunok Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) ETH Zurich(苏黎世联邦理工学院) Korea Aerospace University(韩国航空航天大学)

AI总结 TETO提出一种教师-学生框架,通过知识蒸馏从预训练的RGB跟踪器中学习事件运动估计,仅用25分钟未标注真实数据实现高精度点跟踪和光流估计,提升帧插值质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23255 2026-03-25 cs.LG

Permutation-Symmetrized Diffusion for Unconditional Molecular Generation

排列对称扩散用于无条件分子生成

Gyeonghoon Ko, Juho Lee

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出在商流形上直接建模扩散,以实现分子点云生成的排列不变性,通过MCMC近似难以计算的排列后验,提升生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22837 2026-03-25 cs.CL

Analysing LLM Persona Generation and Fairness Interpretation in Polarised Geopolitical Contexts

分析极化地缘政治背景下大语言模型的人格生成与公平性解释

Maida Aizaz, Quang Minh Nguyen

机构 * Graduate School of Data Science(数据科学研究生院) KAIST(韩国科学技术院)

AI总结 本文研究了五种流行LLM在640种实验条件下生成巴勒斯坦和以色列身份人格的分布特征,揭示了模型在不同情境下对地缘政治身份的公平性解释差异。

Comments EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19250 2026-03-25 cs.CV cs.RO

Background Fades, Foreground Leads: Curriculum-Guided Background Pruning for Efficient Foreground-Centric Collaborative Perception

背景褪色,前景引领:基于课程学习的背景剪枝用于高效前景导向的协同感知

Yuheng Wu, Xiangbo Gao, Quang Tau, Zhengzhong Tu, Dongman Lee

机构 * KAIST(韩国科学技术院) Texas A&M University(德克萨斯A&M大学)

AI总结 本文提出FadeLead框架,通过课程学习策略在训练中学习将背景上下文压缩为紧凑的前景特征,提升协同感知的效率和效果。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20476 2026-03-25 cs.CV cs.MM eess.AS eess.IV

Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio

迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言

Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro

机构 * Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))

AI总结 本文提出首个统一框架,整合手语、唇形和音频生成口语文本,探索多模态协同作用,提升手语翻译性能。

Comments Updated the professional title of the corresponding author. Added an Acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22564 2026-03-25 cs.CV cs.AI cs.LG

PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

PRISM:基于渐进细化和插入的稀疏运动视频数据集压缩

Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim

机构 * Korea AI Safety Institute, ETRI(韩国人工智能安全研究所,ETRI) KAIST(韩国科学技术院) NAVER AI Lab(NAVER AI实验室)

AI总结 PRISM通过将视频视为统一的时空结构,解决视频处理计算成本高和时空依赖性难题,实现高效存储与复杂运动的保留。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07861 2026-03-25 cs.LG cs.AI cs.DS

Streaming Attention Approximation via Discrepancy Theory

通过偏差理论实现流式注意力近似

Ekaterina Kochetkova, Kshiteej Sheth, Insu Han, Amir Zandieh, Michael Kapralov

机构 * EPFL(苏黎世联邦理工学院) KAIST(韩国科学技术院) Google Research(谷歌研究)

AI总结 本文提出BalanceKV算法,基于几何过程选择平衡的Key和Value token,实现流式注意力近似,理论和实验均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22319 2026-03-25 cs.LG cs.AI

Sparsely-Supervised Data Assimilation via Physics-Informed Schrödinger Bridge

通过物理引导的薛定谔桥实现稀疏监督的数据同化

Dohyun Bu, Chanho Kim, Seokun Choi, Jong-Seok Lee

机构 * Department of Industrial \& Systems Engineering, KAIST, Daejeon, Repulic of Korea Department of Mathematical Sciences, KAIST, Daejeon, Repulic of Korea

AI总结 本文提出物理引导的条件薛定谔桥,利用低保真先验向观测条件的高保真后验传输,无需额外推理指导,实现快速且准确的时空场重建。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏