arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1472
2508.16994 2025-12-16 cs.CL cs.AI

GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation

GRADE: 生成多跳问答和细粒度难度矩阵用于RAG评估

Jeongsoo Lee, Daeyong Kwon, Kyohoon Jin

机构 * DATUMO Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

AI总结 GRADE提出了一种新的RAG评估框架,通过多跳问答和细粒度难度矩阵来评估和改进多步推理能力。

Comments Accepted at EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00996 2025-12-15 cs.CV

Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models

具有时间推理的上下文微调用于视频扩散模型的多功能控制

Kinam Kim, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究中心)

AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。

Comments project page: https://kinam0252.github.io/TIC-FT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10321 2025-12-12 cs.CV

Point2Pose: A Generative Framework for 3D Human Pose Estimation with Multi-View Point Cloud Dataset

Point2Pose:基于多视角点云数据集的3D人体姿态估计生成框架

Hyunsoo Lee, Daeum Jeon, Hyeokjae Oh

机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) CS, KAIST(韩国科学技术院计算机科学系) Soulart Inc.(Soulart公司)

AI总结 Point2Pose通过生成模型和大规模数据集提升3D人体姿态估计的准确性与鲁棒性。

Comments WACV 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09778 2025-12-11 quant-ph cs.CC cs.DS cs.IT cs.LG math.IT

Optimal certification of constant-local Hamiltonians

常局部哈密顿量的最优认证

Junseo Lee, Myeongjin Shin

机构 * Team QST, Seoul National University, Seoul 08826, Korea(首尔国立大学QST团队) Quantum AI Team, Norma Inc., Seoul 04799, Korea(Norma公司量子人工智能团队) School of Computational Sciences, KAIST, Seoul 02455, Korea(韩国科学技术院计算科学学院)

AI总结 本文提出了一种无需逆演或受控操作的哈密顿量认证算法,实现常局部性哈密顿量的最优认证性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09310 2025-12-11 cs.RO

Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning

场景无关的双臂任务规划 via 视觉可及性推理

Kwang Bin Lee, Jiho Kang, Sung-Hee Lee

机构 * Graduate School of Culture Technology, Korea Advanced Institute of Science and Technology (KAIST)(文化科技研究生院,韩国科学技术院)

AI总结 本文提出了一种场景无关的双臂任务规划框架,通过视觉可及性推理实现双臂操作的高效规划与执行。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08250 2025-12-11 cs.CV cs.AI cs.LG

Aligning Text to Image in Diffusion Models is Easier Than You Think

在扩散模型中将文本对齐到图像比你想象的更容易

Jaa-Yeon Lee, Byunghee Cha, Jeongsol Kim, Jong Chul Ye

机构 * Kim Jaechul Graduate School of AI, KAIST(金佳哲人工智能研究生院,韩国科学技术院) Department of Bio and Brain Engineering, KAIST(生物与脑工程系,韩国科学技术院)

AI总结 本文提出SoftREPA方法,通过对比学习提升文本与图像表示的对齐效果,减少计算开销,增强语义一致性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08922 2025-12-10 cs.CV

Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration

统一扩散变压器用于高质量文本感知图像恢复

Jin Hyeon Kim, Paul Hyunbin Cho, Claire Kim, Jaewon Min, Jaeeun Lee, Jihye Park, Yeji Choi, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Samsung Electronics(三星电子)

AI总结 UniT通过整合扩散变压器、视觉-语言模型和文本识别模块,实现高质量文本感知图像恢复,有效抑制文本幻觉并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08040 2025-12-10 cs.CV

Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment

迷失在翻译中,发现于嵌入:手语翻译与对齐

Youngjoon Jang, Liliane Momeni, Zifan Jiang, Joon Son Chung, Gül Varol, Andrew Zisserman

机构 * VGG, University of Oxford(Oxford大学视觉几何组) KAIST(韩国科学技术院) University of Zurich(苏黎世大学) LIGM, École des Ponts, IP Paris, UGE, CNRS(图像是巴黎理工学院的LIGM实验室、UGE、CNRS)

AI总结 本文提出统一模型实现手语翻译与对齐,通过轻量视觉主干、滑动感知映射网络和多任务训练策略,在BOBSL数据集上取得SLT和SSA的最先进结果,并展示跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14614 2025-12-09 cs.LG

First Attentions Last: Better Exploiting First Attentions for Efficient Transformer Training

先注意力后:更高效地利用先注意力进行Transformer训练

Gyudong Kim, Hyukju Na, Jin Hyeon Kim, Hyunsung Jang, Jaemin Park, Jaegi Hwang, Namkoo Ha, Seungryong Kim, Young Geun Kim

机构 * Korea University(韩国大学) LIG Nex1 Co., Ltd.(LIG Nex1公司) KAIST AI(韩国科学技术院人工智能)

AI总结 FAL通过重定向第一层注意力输出至后续层MLP输入,减少通信开销并提升训练效率,FAL+进一步优化模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23334 2025-12-09 cs.CL cs.AI cs.IR cs.LG

MUST-RAG: MUSical Text Question Answering with Retrieval Augmented Generation

MUST-RAG: 基于检索增强生成的音乐文本问答

Daeyong Kwon, SeungHeon Doh, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST, South Korea(文化科技研究生院,韩国釜山科学技术院)

AI总结 MUST-RAG通过引入音乐专用数据库和检索增强生成技术,提升通用语言模型在音乐问答任务中的表现。

Comments This is an earlier version of the paper - ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering. The latest version is available at: (arXiv:2512.05430)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05081 2025-12-05 cs.CV

Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression

深度强制:免训练 长视频生成与深度Sink和参与性压缩

Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 深度强制通过深度Sink和参与性压缩机制,在无需微调的情况下实现长视频生成,提升生成质量与动态效果。

Comments Project Page: https://cvlab-kaist.github.io/DeepForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04969 2025-12-05 cs.CV cs.LG

Rethinking the Use of Vision Transformers for AI-Generated Image Detection

重新思考视觉Transformer在AI生成图像检测中的应用

NaHyeon Park, Kunhee Kim, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学)

AI总结 本文提出MoLD方法,通过动态整合多层ViT特征提升AI生成图像检测性能,增强模型泛化能力与现实鲁棒性。

Comments Code: https://github.com/nahyeonkaty/mold

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04012 2025-12-04 cs.CV

Emergent Outlier View Rejection in Visual Geometry Grounded Transformers

视觉几何基础变换器中涌现的异常视图拒绝

Jisang Han, Sunghwan Hong, Jaewoo Jung, Wooseok Jang, Honggyu An, Qianqian Wang, Seungryong Kim, Chen Feng

机构 * KAIST AI(韩国科学技术院人工智能研究所) New York University(纽约大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) UC Berkeley(伯克利加州大学)

AI总结 本文提出通过视觉几何基础变换器中涌现的异常视图拒绝机制,无需额外训练即可提升前馈3D重建在野外条件下的鲁棒性。

Comments Project page: https://cvlab-kaist.github.io/RobustVGGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03913 2025-12-04 cs.RO cs.AI

Hierarchical Vision Language Action Model Using Success and Failure Demonstrations

基于成功与失败示范的分层视觉语言行动模型

Jeongeun Park, Jihwan Yoon, Byungwoo Jeon, Juhan Park, Jinwoo Shin, Namhoon Cho, Kyungjae Lee, Sangdoo Yun, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kim Jaechul Graduate School of AI, KAIST(金在拙人工智能研究生院,韩国科学技术院) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Departmnet of Statistics, Korea University(韩国大学统计系) NAVER AI Lab(NAVER人工智能实验室)

AI总结 VINE通过分层强化学习框架,利用失败数据提升视觉语言行动模型的鲁棒性和执行能力。

Comments https://vine-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18929 2025-12-04 cs.LG

Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training

轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练

Brian Bartoldson, Siddarth Venkatraman, James Diffenderfer, Moksh Jain, Tal Ben-Nun, Seanie Lee, Minsu Kim, Johan Obando-Ceron, Yoshua Bengio, Bhavya Kailkhura

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) KAIST(韩国科学技术院) CIFAR Fellow

AI总结 TBA通过解耦探索与学习,提升LLM后训练的速度和性能,适用于多种任务并支持大规模数据生成。

Comments NeurIPS 2025; 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18212 2025-12-04 cs.AI cs.LG

A Definition of AGI

AGI 的定义

Dan Hendrycks, Dawn Song, Christian Szegedy, Honglak Lee, Yarin Gal, Erik Brynjolfsson, Sharon Li, Andy Zou, Lionel Levine, Bo Han, Jie Fu, Ziwei Liu, Jinwoo Shin, Kimin Lee, Mantas Mazeika, Long Phan, George Ingebretsen, Adam Khoja, Cihang Xie, Olawale Salaudeen, Matthias Hein, Kevin Zhao, Alexander Pan, David Duvenaud, Bo Li, Steve Omohundro, Gabriel Alfour, Max Tegmark, Kevin McGrew, Gary Marcus, Jaan Tallinn, Eric Schmidt, Yoshua Bengio

机构 * Center for AI Safety(AI安全中心) University of California, Berkeley(加州大学伯克利分校) Virtue AI Morph Labs(Morph实验室) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Oxford(牛津大学) Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Gray Swan AI Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Hong Kong Baptist University(香港 Baptist大学) HKUST(香港科技大学) Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Beneficial AI Research(有益AI研究) Conjecture Institute for Applied Psychometrics(应用心理测量研究所) New York University(纽约大学) CSER Université de Montréal(蒙特利尔大学) LawZero

AI总结 本文提出了一种基于卡特尔-霍恩-卡罗尔理论的可量化框架,定义AGI为与受过良好教育的成年人认知能力相匹配,并通过心理测量电池评估AI系统,揭示当前AI在基础认知机制上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03045 2025-12-03 cs.CV

CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models

CAMEO:多视图扩散模型中的对应-注意力对齐

Minkyung Kwon, Jinhyeok Choi, Jiho Park, Seonghu Jeon, Jinhyuk Jang, Junyoung Seo, Minseop Kwak, Jin-Hwa Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(延世大学人工智能研究所)

AI总结 CAMEO通过几何对应监督注意力图,提升多视图扩散模型的训练效率和生成质量。

Comments Project page: https://cvlab-kaist.github.io/CAMEO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02006 2025-12-02 cs.CV

MV-TAP: Tracking Any Point in Multi-View Videos

MV-TAP:多视角视频中的任意点跟踪

Jahyeok Koo, Inès Hyeonsu Kim, Mungyeom Kim, Junghyun Park, Seohyun Park, Jaeyeong Kim, Jung Yi, Seokju Cho, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 MV-TAP通过跨视角注意力机制和大规模数据集,实现了多视角视频中动态物体点的高效准确跟踪。

Comments Project Page: https://cvlab-kaist.github.io/MV-TAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00742 2025-12-02 cs.CY cs.AI

On the Regulatory Potential of User Interfaces for AI Agent Governance

关于用户界面在AI代理治理中的调节潜力

K. J. Kevin Feng, Tae Soo Kim, Rock Yuren Pang, Faria Huq, Tal August, Amy X. Zhang

机构 * University of Washington(华盛顿大学) KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。

Comments RegML workshop at NeurIPS 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00115 2025-12-02 cs.SD cs.CV cs.MM

MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning

MoLT:基于层级令牌的高效音频视觉学习

Kyeongha Rho, Hyeongkeun Lee, Jae Won Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) Sejong University(世宗大学)

AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22865 2025-12-01 cs.RO cs.CV

SUPER-AD: Semantic Uncertainty-aware Planning for End-to-End Robust Autonomous Driving

SUPER-AD:语义不确定性感知的端到端鲁棒自动驾驶规划

Wonjeong Ryu, Seungjun Yu, Seokha Moon, Hojun Choi, Junsung Park, Jinkyu Kim, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

AI总结 SUPER-AD通过语义不确定性感知和驾驶先验知识,提升端到端自动驾驶在复杂不确定性条件下的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15390 2025-12-01 cs.CL cs.LG

Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training

利用词汇频率不平衡性在语言模型预训练中

Woojin Chung, Jeonghoon Kim

机构 * KAIST(韩国科学技术院)

AI总结 本研究通过扩大词汇表降低分词文本复杂性,揭示了语言模型预训练中词汇规模与性能的关系。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22173 2025-12-01 cs.CL

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00642 2025-12-01 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG

Gaussian Universality in Neural Network Dynamics with Generalized Structured Input Distributions

神经网络动力学中的高斯普遍性与广义结构输入分布

Jaeyong Bae, Hawoong Jeong

机构 * Department of Physics, Korea Advanced Institute of Science and Technology(韩国科学技术院物理系) Center of Complex Systems, Korea Advanced Institute of Science and Technology(韩国科学技术院复杂系统中心)

AI总结 本研究通过将输入建模为高斯混合分布,揭示了神经网络动力学在标准化后表现出高斯普遍性,从而增强了深度学习理论的理解。

Comments Accepted for Bridging the Gap Between Practice and Theory in Deep Learning (BGPT) Workshop at ICLR 2024, [v1] 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21477 2025-11-27 cs.CV cs.AI

Frequency-Aware Token Reduction for Efficient Vision Transformer

面向频率的标记减少用于高效的视觉变换器

Dong-Jae Lee, Jiwan Hur, Jaehyun Choi, Jaemyung Yu, Junmo Kim

机构 * KAIST(韩国科学技术院) NAVER AI Lab(NAVER人工智能实验室)

AI总结 本文提出一种面向频率的标记减少策略,通过保留高频标记和聚合低频标记来提升视觉变换器的计算效率和性能。

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21415 2025-11-27 cs.CV

DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models

DiverseVAR: 在不重新训练或微调的情况下提升下一尺度视觉自回归模型的多样性和质量

Mingue Park, Prin Phunyaphibarn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

AI总结 DiverseVAR通过在测试时注入文本嵌入噪声和scale-travel技术,提升视觉自回归模型的多样性与图像质量的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏