arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-03 至 2026-06-03 共收录 14
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02645 2026-06-03 stat.ML cs.AI cs.LG

Target Updates May Stabilize Linear Q-Learning: Periodic and Soft Dynamics

目标更新可能稳定线性Q学习:周期性和软动态

Donghwan Lee

机构 * School of Electrical Engineering, KAIST(韩国成均馆大学电气工程学院)

AI总结 本文通过精确的切换线性系统动力学和联合谱半径分析,证明了在特定谱和步长条件下,周期性硬目标更新和软目标更新可以保证线性Q学习收敛到精确的投影Q-Bellman解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03774 2026-06-03 cs.CV

AmbientEye: A Dataset for Pupil Segmentation under Natural Ambient Infrared Illumination

AmbientEye: 自然环境红外光照下的瞳孔分割数据集

Mingyu Han, Hyunyoung Han, Nitheekulawatn Thommakoon, Gangtae Park, Jieun Han, Xucong Zhang, Ian Oakley

机构 * Electrical Engineering, Korea Advanced Institute of Science and Technology(电子工程系,韩国科学技术院) Intelligent Systems Department, Delft University of Technology(智能系统系,代尔夫特理工大学)

AI总结 本文提出AmbientEye数据集,探索在无主动红外光源、仅依靠环境阳光的户外场景中,利用被动红外相机实现可靠瞳孔检测,并评估现有算法性能下降。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03347 2026-06-03 cs.LG cs.AI stat.ML

AugMask: Training Diffusion Models on Incomplete Tabular Data via Stochastic Augmentation and Masking

AugMask: 通过随机增强和掩码在不完整表格数据上训练扩散模型

Jungkyu Kim, Taeyoung Park, Kibok Lee

机构 * KAIST(韩国科学技术院)

AI总结 提出AugMask训练框架,通过条件随机增强和仅对观测坐标去噪,使标准扩散模型适应缺失表格数据,并连接Rao-Blackwellized目标实现方差加权惩罚,优于专门处理缺失的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03310 2026-06-03 cs.LG cs.AI

Learning Multi-Scale Hypergraph for High-Order Brain Connectivity Analysis

学习多尺度超图用于高阶脑连接分析

Jaeyoon Sim, Soojin Hwang, Seunghun Baek, Guorong Wu, Won Hwa Kim

机构 * KAIST(韩国科学技术院)

AI总结 提出自适应多尺度超边学习框架MuHL,通过构建层次节点特征并动态学习高阶交互,在多个脑网络基准上提升神经退行性疾病分类性能并识别关键脑区。

Comments 24 pages, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03210 2026-06-03 cs.CE cs.LG cs.NA math.NA

Critical evaluation of PINN for FWD inverse analysis and differentiable FEM as an alternative

PINN 在 FWD 反分析中的批判性评估及可微有限元方法作为替代方案

Yongjin Choi, Hyeonbin Moon, Seunghwa Ryu

机构 * KAIST(韩国科学技术院)

AI总结 本文批判性评估了物理信息神经网络(PINN)在多层路面系统落锤式弯沉仪(FWD)反分析中的表现,并提出可微有限元方法(DiffFEM)作为更准确、稳定和高效的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03068 2026-06-03 cs.LG cs.AI

Learn When and Where to Connect: Adaptive Virtual Nodes for Dynamic Message Passing on Graphs

学习何时何地连接:图上动态消息传递的自适应虚拟节点

Jaejun Lee, Joyce Jiyoung Whang

机构 * School of Computing, KAIST(计算机学院,韩国科学技术院) Department of AI Computing, KAIST(人工智能计算系,韩国科学技术院)

AI总结 提出MAVN框架,通过端到端可微分的方式自适应地决定在消息传递神经网络的哪一层为哪些节点引入虚拟节点,并基于双向评分机制建立连接,理论证明其能模拟任意节点-虚拟节点连接模式,实验表明在多个数据集上显著提升骨干网络性能。

Comments 12 pages, 6 figures, 10 tables, 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02588 2026-06-03 cs.LO cs.AI cs.PL

Lean-GAP: A Dataset of Formalized Graduate Algebra Problems

Lean-GAP:形式化研究生代数问题数据集

Seewoo Lee, Byung-Hak Hwang, Hyojae Lim, Jihoon Hyun, Ilkyoo Choi, Yeachan Park, Jineon Baek, Hyukpyo Hong, Keewoo Lee, Jaeseong Heo, Hyungryul Baik, Chul-hee Lee, Kyu-Hwan Lee

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanyang University(翰阳大学) Hufs University(Hufs大学) Sungkyunkwan University(成均馆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Sejong University(世宗大学) University of Connecticut(康涅狄格大学)

AI总结 本文提出Lean-GAP数据集,包含430个来自Dummit和Foote《抽象代数》的形式化研究生代数问题,并开发了从PDF预处理到自动形式化再到验证的可扩展流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20217 2026-06-03 cs.LG cs.AI

KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem

KnapSpec: 通过自适应层选择作为背包问题的自推测解码

Seongjin Cha, Gyuwan Kim, Dongsu Han, Tao Yang, Insu Han

机构 * KAIST(韩国科学技术院)

AI总结 提出KnapSpec,一种无需训练的框架,将草稿模型选择重新表述为背包问题,通过解耦注意力与MLP层并建模其硬件特定延迟,使用并行动态规划算法自适应确定最优草稿配置,实现令牌吞吐量最大化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09685 2026-06-03 cs.IR cs.AI cs.MM cs.SD eess.AS

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation

TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线

Keunwoo Choi, Seungheon Doh, Juhan Nam

机构 * KAIST(韩国科学技术院)

AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。

Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01698 2026-06-03 cs.IR cs.MM cs.SD eess.AS

TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling

TalkPlay-Tools: 基于大语言模型工具调用的对话式音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

AI总结 提出一种基于LLM工具调用的统一检索-重排序流水线,通过布尔过滤、稀疏检索、稠密检索和生成式检索的组合,实现端到端的对话式音乐推荐。

Comments Accepted for publication at The Workshop on AI for Music, Neural Information Processing Systems (NeurIPS-AI4Music)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13713 2026-06-03 cs.IR cs.SD eess.AS

TALKPLAY: Multimodal Music Recommendation with Large Language Models

TALKPLAY: 基于大语言模型的多模态音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

AI总结 提出TALKPLAY系统,通过将推荐转化为token生成问题,利用大语言模型处理多模态音乐特征,实现端到端对话式推荐,显著优于单模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏