arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2603.12110 2026-03-13 cs.LG cs.AI

Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives

驯服对手:通过分数目标实现稳定的最小最大深度确定性策略梯度

Taeho Lee, Donghwan Lee

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院)

AI总结 本文提出MMDDPG框架,通过分数目标平衡任务性能与扰动幅度,以提升连续控制任务中对抗扰动的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11439 2026-03-13 cs.CV

Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述

Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho

机构 * Konkuk University(韩国康 kuk 大学) Sejong University(世宗大学) KAIST(韩国科学技术院)

AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06605 2026-03-13 cs.LG

Structure-Aware Set Transformers: Temporal and Variable-Type Attention Biases for Asynchronous Clinical Time Series

结构感知的集合变换器:用于异步临床时间序列的时序和变量类型注意力偏差

Joohyung Lee, Kwanhyung Lee, Changhun Kim, Eunho Yang

机构 * AITRICS Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出STAR-Set变换器,通过引入时间局部性惩罚和变量类型亲和力,解决异步临床时间序列中变量轨迹和时间局部上下文丢失的问题,提升预测性能。

Comments ICLR 2026 Workshop on Time Series in the Age of Large Models (TSALM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11036 2026-03-13 cs.RO cs.AI

XGrasp: Gripper-Aware Grasp Detection with Multi-Gripper Data Generation

XGrasp:基于多机械臂数据生成的抓取检测

Yeonseo Lee, Jungwook Mun, Hyosup Shin, Guebin Hwang, Junhee Nam, Taeyeop Lee, Sungho Jo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 XGrasp通过多机械臂数据生成和对比学习,实现无需额外训练的抓取检测泛化,提升抓取成功率和推理速度。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05170 2026-03-12 cs.CV

Leveraging Spatial Context for Positive Pair Sampling in Histopathology Image Representation Learning

利用空间上下文进行组织病理图像表示学习中的正对采样

Willmer Rafell Quinones Robles, Sakonporn Noree, Jongwoo Kim, Young Sin Ko, Bryan Wong, Mun Yong Yi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Seegene Medical Foundation(Seegene医学基金会)

AI总结 本文提出一种利用空间上下文提升组织病理图像自监督学习性能的方法,通过改进正对采样策略,在多个数据集上实现了5%-10%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09408 2026-03-11 cs.CV cs.AI cs.LG

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

复兴 ConvNeXt 以实现高效的卷积扩散模型

Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo

机构 * KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) ISTI-CNR(意大利国家研究理事会信息与自动化研究所) University of Pisa(比萨大学)

AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。

Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09222 2026-03-11 cs.CL

LooComp: Leverage Leave-One-Out Strategy to Encoder-only Transformer for Efficient Query-aware Context Compression

LooComp: 通过留一法策略提升仅编码器Transformer的查询感知上下文压缩效率

Thao Do, Dinh Phu Tran, An Vo, Seon Kwon Kim, Daeyoung Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 LooComp通过留一法策略提升仅编码器Transformer的查询感知上下文压缩效率,实现高效压缩与高吞吐量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13672 2026-03-11 cs.LG cs.CV

Directional Textual Inversion for Personalized Text-to-Image Generation

方向性文本反转用于个性化文本到图像生成

Kunhee Kim, NaHyeon Park, Kibeom Hong, Hyunjung Shim

机构 * KAIST(韩国科学技术院) Sookmyung Woman’s University(成均馆女子大学)

AI总结 方向性文本反转通过优化方向提升文本到图像生成的个性化效果,实现更稳定的语义连贯性。

Comments ICLR 2026; Project page: https://kunheek.github.io/dti

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09056 2026-03-11 cs.RO cs.LG

Quality over Quantity: Demonstration Curation via Influence Functions for Data-Centric Robot Learning

质量优于数量:通过影响函数进行演示数据的 curated

Haeone Lee, Taywon Min, Junsu Kim, Sinjae Kang, Fangchen Liu, Lerrel Pinto, Kimin Lee

机构 * KAIST(韩国科学技术院) University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学)

AI总结 本文提出 QoQ 方法,通过影响函数识别高质量演示数据,提升机器人学习性能。

Comments Accepted to ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01549 2026-03-11 cs.CV cs.AI cs.RO

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) LG AI Research(LG人工智能研究) Yonsei University(延世大学) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08313 2026-03-10 cs.CV

HDR-NSFF: High Dynamic Range Neural Scene Flow Fields

HDR-NSFF:高动态范围神经场景流场

Shin Dong-Yeon, Kim Jun-Seong, Kwon Byung-Ki, Tae-Hyun Oh

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) Grad. School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) School of Computing, KAIST(韩国科学技术院计算机科学学院)

AI总结 HDR-NSFF通过4D时空建模实现动态HDR场景的高精度辐射场重建与时空视图合成。

Comments ICLR 2026. Project page: https://shin-dong-yeon.github.io/HDR-NSFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07888 2026-03-10 cs.CV cs.AI cs.LG

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07392 2026-03-10 cs.CL

Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams

大语言模型能否跟上?连续知识流的在线适应基准测试

Jiyeon Kim, Hyunji Lee, Dylan Zhou, Sue Hyun Park, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Sungmin Cha, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Google(谷歌公司) KRAFTON(KRAFTON公司) Adobe Research(Adobe研究院) New York University(纽约大学)

AI总结 本文提出OAKS基准测试,用于评估大语言模型在动态连续知识流中的在线适应能力,发现现有模型在持续更新知识时存在显著局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09021 2026-03-10 cs.LG

A Champion-level Vision-based Reinforcement Learning Agent for Competitive Racing in Gran Turismo 7

一款冠军级基于视觉的强化学习代理用于Gran Turismo 7中的竞争赛车

Hojoon Lee, Takuma Seno, Jun Jet Tai, Kaushik Subramanian, Kenta Kawamoto, Peter Stone, Peter R. Wurman

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Coventry University(科文特大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出了一种基于视觉的自主赛车代理,通过仅使用车载传感器数据和摄像头视角,在Gran Turismo 7中实现了冠军级的赛车性能。

Comments Accepted for Publication at the IEEE Robotics and Automation Letters (RA-L) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06693 2026-03-10 cs.CV cs.LG

Soft Equivariance Regularization for Invariant Self-Supervised Learning

用于不变自监督学习的软等价性正则化

Joohyung Lee, Changhun Kim, Hyunsu Kim, Kwanhyung Lee, Juho Lee

机构 * AITRICS Voronoi Inc. Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出软等价性正则化,通过解耦不变性和等价性强制的层,提升自监督学习在ImageNet-1k和ImageNet-C/P等任务中的性能。

Comments 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10742 2026-03-10 cs.AI cs.HC

Precision Proactivity: Measuring Cognitive Load in Real-World AI-Assisted Work

精度主动性:在真实世界中测量人工智能辅助工作中的认知负荷

Brandon Lepine, Juho Kim, Pamela Mishkin, Matthew Beane

机构 * College of Engineering, UC Santa Barbara(加州大学圣芭芭拉分校工程学院) School of Computing, KAIST(韩国科学技术院计算机科学学院)

AI总结 本文研究了在真实世界中AI辅助工作中的认知负荷测量,通过任务分解和知识图谱开发了评估框架,发现外在负荷对质量影响最大,任务切换是性能下降的最强预测因素。

Comments Major Revision. Substantially rewritten manuscript with new analysis, updated framing, and new title

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05830 2026-03-09 cs.RO

OpenHEART: Opening Heterogeneous Articulated Objects with a Legged Manipulator

OpenHEART: 用腿部机械臂开启异构关节物体

Seonghyeon Lim, Hyeonwoo Lee, Seunghyun Lee, I Made Aswin Nahrendra, Hyun Myung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) KRAFTON

AI总结 本文提出OpenHEART框架,通过SAFE和ArtIEst实现腿部机械臂高效开启异构关节物体,提升跨领域泛化与样本效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23008 2026-03-09 cs.LG cs.AI

Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization

探索性记忆增强型大语言模型代理:通过混合的在线与离线策略优化

Zeyuan Liu, Jeonghye Kim, Xufang Luo, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院)

AI总结 EMPO²通过混合在线与离线策略优化,提升大语言模型在探索性和通用性方面的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05664 2026-03-09 cs.LG

KLASS: KL-Guided Fast Inference in Masked Diffusion Models

KLASS: 在掩码扩散模型中基于KL的快速推理

Seo Hyun Kim, Sunwoo Hong, Hojung Jung, Youngrok Park, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能学院)

AI总结 KLASS通过利用令牌级KL散度实现快速稳定生成,显著提升扩散模型推理速度并保持高质量输出。

Comments NeurIPS 2025 Spotlight. Code: https://github.com/shkim0116/KLASS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00502 2026-03-09 cs.LG

Diffusion Alignment as Variational Expectation-Maximization

扩散对齐作为变分期望最大化

Jaewoo Lee, Minsu Kim, Sanghyeok Choi, Inhyuck Song, Sujin Yun, Hyeongyu Kang, Woocheol Shin, Taeyoung Yun, Kiyoung Om, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila - Quebec AI Institute(魁北克人工智能研究所) University of Edinburgh(爱丁堡大学) Mila, Université de Montréal(魁北克大学Mila) Omelet

AI总结 DAV通过变分期望最大化框架,在文本生成和DNA设计中实现奖励优化与多样性保持。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15805 2026-03-09 cs.LG cs.AI physics.chem-ph

FragFM: Hierarchical Framework for Efficient Molecule Generation via Fragment-Level Discrete Flow Matching

FragFM:基于片段级离散流匹配的高效分子生成分层框架

Joongwon Lee, Seonghwan Kim, Seokhyun Moon, Hyunwoo Kim, Woo Youn Kim

机构 * Department of Chemistry, KAIST(韩国科学技术院化学系) InnoCORE AI-CRED Institute, KAIST(韩国科学技术院InnoCORE AI-CRED研究所) College of Pharmacy, Dongguk University(东国大学药学院) Department of Data Science, KAIST(韩国科学技术院数据科学系)

AI总结 FragFM通过片段级离散流匹配实现高效分子生成,优于原子级方法,并提出NPGen基准评估自然产物生成能力。

Comments Published in International Conference on Learning Representations (ICLR), 2026

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06204 2026-03-09 cs.CL cs.AI cs.HC

The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate

生成AI悖论:它能解决什么,它可能无法评估

Juhyun Oh, Eunsu Kim, Inha Cha, Alice Oh

机构 * School of Computing, KAIST Daejeon, Republic of Korea(韩国釜山国立大学计算机学院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文研究了生成AI在评估任务中的局限性,发现LLMs在生成任务中表现优异,但在评估任务中却存在不忠实的问题,揭示了生成能力与评估能力之间的悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏