arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-03-24 至 2026-03-24 共收录 15
2603.22275 2026-03-24 cs.CV

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22057 2026-03-24 cs.CV

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

SpatialBoost: 通过语言引导的推理增强视觉表示

Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD NAVER Cloud(NAVER云)

AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。

Comments 35 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05146 2026-03-24 cs.LG cs.AI

Cross-talk based multi-task learning for fault classification of machine system influenced by multiple variables

基于交叉作用的多任务学习用于受多种变量影响的机器系统故障分类

Wonjun Yi, Rismaya Kumar Mishra, Yong-Hwa Park

机构 * Korea Adavanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院)

AI总结 本文提出基于交叉作用的多任务学习框架,用于处理受多种变量影响的机器系统故障分类问题,通过联合学习故障条件和其他变量,提升分类性能。

Comments Submitted to 32th International Congress on Sound and Vibration (ICSV32)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22169 2026-03-24 cs.CV cs.AI

Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization

通过群体相对策略优化实现实时长周期空气质量预报

Inha Kang, Eunki Kim, Wonjeong Ryu, Jaeyo Shin, Seungjun Yu, Yoon-Hee Kang, Seongeun Jeong, Eunhye Kim, Soontae Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院) Ajou University(全州大学) Kunsan University(全州大学)

AI总结 本文提出群体相对策略优化方法,解决传统模型在长周期空气质量预报中的误报问题,通过减少误报率提升预报可靠性。

Comments 31 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04822 2026-03-24 cs.CL

Shared Heritage, Distinct Writing: Rethinking Resource Selection for East Asian Historical Documents

共享遗产,迥异写作:重新审视东亚历史文件的资源选择

Seyoung Song, Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Genentech(基因科技)

AI总结 本文质疑通过古典汉语资源进行跨语言迁移在处理韩日古文历史文件的有效性,实验显示古典汉语数据对模型性能影响有限,强调需谨慎验证而非盲目依赖跨语言迁移。

Comments IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21269 2026-03-24 cs.RO

DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation

DyGeoVLN: 将动态几何基础模型注入视觉-语言导航

Xiangchen Liu, Hanghan Zheng, Jeil Jeong, Minsung Yoon, Lin Zhao, Zhide Zhong, Haoang Li, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(JD探索学院)

AI总结 本文提出DyGeoVLN框架,通过跨分支特征融合将动态几何基础模型注入视觉-语言导航,实现显式3D空间表示和视觉-语义推理,并引入新的无姿态自适应分辨率令牌剪枝策略以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20755 2026-03-24 cs.CV cs.AI

Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

通过动态补丁采样和块跳过实现高效的扩散变换器微调

Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das, Sungrack Yun, Munawar Hayat, Jaegul Choo, Fatih Porikli, Seokeon Choi

机构 * Qualcomm AI Research(高通人工智能研究) KAIST(韩国科学技术院)

AI总结 本文提出DiT-BlockSkip框架,通过动态补丁采样和块跳过减少内存使用,提升扩散变换器微调效率,实现设备端部署。

Comments Accepted to CVPR 2026; 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20686 2026-03-24 cs.SD cs.AI

SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection

SNAP:用于语音深度伪造检测中消除伪影投影的说话人消除

Kyudan Jung, Jihwan Kim, Minwoo Lee, Soyoon Kim, Jeonghoon Kim, Jaegul Choo, Cheonbok Park

机构 * KAIST AI(韩国科学技术院人工智能实验室) NAVER Cloud(NAVER云)

AI总结 针对语音深度伪造检测中说话人信息干扰问题,提出SNAP框架通过消除说话人依赖成分,提升检测器对伪影特征的识别能力。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12918 2026-03-24 cs.CV

VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation

VIRD:通过双轴变换实现视图不变表示的跨视图姿态估计

Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung

机构 * Urban Robotics Lab, School of Electrical Engineering, KAIST(首尔国立大学电气工程学院智能城市机器人实验室) Hanwha Aerospace(韩华航空航天)

AI总结 本文提出VIRD方法,通过双轴变换构建视图不变表示,解决地面与卫星视图间显著视角差异问题,提升跨视图姿态估计精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10057 2026-03-24 cs.IR cs.AI cs.CL cs.LG

Chain of Retrieval: Multi-Aspect Iterative Search Expansion and Post-Order Search Aggregation for Full Paper Retrieval

检索链:多方面迭代搜索扩展与后序搜索聚合用于全文检索

Sangwoo Park, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出Chain of Retrieval框架,通过多方面迭代搜索扩展和后序聚合,提升全文检索效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01013 2026-03-24 cs.LG

TimeXL: Explainable Multi-modal Time Series Prediction with LLM-in-the-Loop

TimeXL:基于LLM的多模态时间序列预测可解释方法

Yushan Jiang, Wenchao Yu, Geon Lee, Dongjin Song, Kijung Shin, Wei Cheng, Yanchi Liu, Haifeng Chen

机构 * School of Computing, University of Connecticut(大学计算机学院) Data Science & System Security Department, NEC Labs America(数据科学与系统安全部,NEC美国实验室) Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院)

AI总结 TimeXL通过集成原型时间序列编码器与三个协作LLM,提升时间序列预测的准确性与可解释性,实验证明在四个真实数据集上AUC提升达8.9%。

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20208 2026-03-24 cs.CL cs.AI cs.CR

RedacBench: Can AI Erase Your Secrets?

RedacBench:AI能否删除你的秘密?

Hyunjun Jeon, Kyuyoung Kim, Jinwoo Shin

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 RedacBench旨在评估多领域多策略的删除能力,通过514篇文本和187项安全政策,量化模型在安全与效用间的平衡,揭示先进模型在提升安全的同时保留效用的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25259 2026-03-24 cs.IR cs.AI cs.LG

TV-Rec: Time-Variant Convolutional Filter for Sequential Recommendation

TV-Rec:用于序列推荐的时间变换单元卷积滤波器

Yehjin Shin, Jeongwhan Choi, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

AI总结 TV-Rec通过引入时间变换单元卷积滤波器,提升了序列推荐中对复杂用户行为交互模式的捕捉能力,同时减少了计算量并加速了推理过程。

Comments The 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏