arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-07-02 至 2026-07-02 共收录 9
2607.00987 2026-07-02 cs.CV 新提交

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

AVSR-Diff: 用于时间一致任意尺度视频超分辨率的尺度无关扩散先验

Geunhyuk Youk, Jeonghyeok Do, Dayeon Kim, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

AI总结 提出AVSR-Diff框架,通过解耦尺度无关的潜在去噪与连续坐标渲染,并引入时间门控特征循环和尺度感知傅里叶细化模块,实现任意尺度下的高保真时间一致视频超分辨率。

Comments Accepted to ECCV 2026. Project page: https://kaist-viclab.github.io/AVSR-Diff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00889 2026-07-02 cs.CV cs.AI 新提交

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

DeWorldSG: 基于世界模型先验的深度感知3D语义场景图生成

Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha, Dooyoung Kim, Eunjae Shin, Benjamin Busam, Woontack Woo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) La Trobe University(拉筹伯大学)

AI总结 提出DeWorldSG框架,通过深度引导滤波估计实例级3D高斯分布,并利用世界模型先验聚合时空证据,生成时空鲁棒的3D语义场景图,在对象和谓词预测上达到最先进性能。

Comments 19 pages, 6 figures, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00581 2026-07-02 cs.LG 新提交

Decision-focused Sparse Tangent Portfolio Optimization

决策聚焦的稀疏切线投资组合优化

Haeun Jeon, Seunghoon Choi, Hyunglip Bae, Yongjae Lee, Woo Chang Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chonnam National University(全南国立大学) Ulsan National Institute of Science and Technology(乌山科学技术院)

AI总结 提出端到端决策聚焦学习框架,通过可微凸优化层和平滑top-k算子直接优化投资组合性能,在四个主要股票市场取得优于基线的样本外夏普比率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00547 2026-07-02 cs.CV cs.AI 新提交

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

EgoGapBench:多智能体场景中自我中心动作选择的基准测试

Jihyeok Jung, Jeewu Lee, Sanghyeop Kim, Chanhee Han, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学) Ministry of Science and ICT(科学技术信息通信部)

AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。

Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00525 2026-07-02 cs.CV 新提交

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation

SPECSIA:用于基于绘图的3D动画中新颖视角增强的风格化数据集

Kyuwon Kim, Sunjae Yoon, Chang D. Yoo

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电子工程学院) Department of AI, Chung-Ang University, Seoul, Republic of Korea(韩国 Chung-Ang 大学人工智能系)

AI总结 提出SPECSIA-15K数据集和DraViE模块,通过数据先验去除新颖视角伪影,提升动画保真度和时间一致性,降低每角色适应成本。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00446 2026-07-02 cs.CV cs.AI 新提交

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学)

AI总结 提出VideoSearch-R1框架,通过软查询细化(SQR)在连续潜空间优化搜索查询,结合GRPO训练,实现大规模视频库的迭代检索与精确时序定位,性能达SOTA。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00409 2026-07-02 cs.CV 新提交

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation

MedCAGD:用于高效医学图像分割的上下文感知门控解码器

Saad Wazir, Patrick Dominique Vibild, Dinh Phu Tran, Seongah Kim, Daeyoung Kim

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Department of Energy, Aalborg University(奥尔堡大学能源系)

AI总结 提出一种上下文感知门控解码器,通过轻量多尺度通道重校准、门控跳跃融合和全局上下文聚合机制,有效利用预训练编码器特征,在11个基准上优于强基线。

Comments Accepted at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00714 2026-07-02 cs.CL cs.AI 新提交

Self-conditioned Flow Map Language Models via Fixed-point Flows

自条件流映射语言模型通过不动点流

Jaehoon Yoo, Wonjung Kim, Floor Eijkelboom, Chanhyuk Lee, Nicholas M. Boffi, Seunghoon Hong, Jinwoo Kim

机构 * KAIST(韩国科学技术院) University of Amsterdam(阿姆斯特丹大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出不动点流框架,将自条件机制解释为不动点迭代,并设计二维流模型同时压缩迭代与流过程,实现少步生成,在OpenWebText上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏