arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-06-17 至 2026-06-17 共收录 10
2606.18066 2026-06-17 cs.LG 新提交

NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment

NoiseTilt: 噪声倾斜反向核用于扩散奖励对齐

Jisung Hwang, Yunhong Min, Jaihoon Kim, I-Chao Shen, Minhyuk Sung

机构 * KAIST(韩国科学技术院) The University of Tokyo(东京大学)

AI总结 提出噪声倾斜反向核(NTRK),通过将奖励梯度注入噪声项实现奖励引导采样,保持预训练反向核不变,每步仅需单样本,在奖励对齐任务中超越现有方法且不损失样本质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17826 2026-06-17 cs.CL cs.AI 新提交

When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

当多种文字重要时:在临床环境中评估ASR

Jean Seo, Minkyu Kim, Jeonguk Lee, Jisoo Jung, Wooseok Han, Eunho Yang

机构 * AITRICS University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

AI总结 针对非英语临床场景中ASR受多文字变异性影响的问题,提出MultiClin基准,通过多文字感知评估更公平地衡量识别质量,并发现文字统一化能提升ASR性能。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17584 2026-06-17 cs.CV cs.LG 新提交

Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness

基于轨迹直线度的整流流根选择不动点反演

Semin Kim, Jihwan Yoon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

AI总结 提出SelFix方法,通过选择使逆轨迹更直的不动点解,在整流流中实现精确反演,提升图像重建和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17536 2026-06-17 cs.CV cs.AI 新提交

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) National Taiwan University(国立台湾大学) Wuhan University(武汉大学) Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Jimei University(集美大学)

AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15735 2026-06-17 cs.CL cs.AI 新提交

EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries

EHRNote-ChatQA:一个面向纵向出院总结的基于证据的多轮临床问答基准

Jiyoun Kim, Muhan Yeo, Eunhye Jang, Jeewon Yang, Hangyul Yoon, Su Ji Lee, Hee Jo Han, Hee-Jae Jung, Doyun Kwon, Jun young Lee, Jaehun Lee, Jung-Oh Lee, Sunjun Kweon, Jong Hak Moon, Daseul Kim, Minjae Cho, Edward Choi

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学) Seoul National University Bundang Hospital(首尔大学盆唐医院) SAIHST, Sungkyunkwan University(成均馆大学) Yonsei University College of Medicine(延世大学医学院) Gangnam Severance Hospital(江南塞弗伦斯医院) Severance Hospital(塞弗伦斯医院) Seoul Medical Center(首尔医疗中心) Seoul National University Hospital(首尔大学医院) National Cancer Center(国立癌症中心) Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) Samsung Medical Center(三星医疗中心)

AI总结 提出EHRNote-ChatQA基准,基于MIMIC-IV出院总结构建,包含967个多轮样本和16072个专家验证的QA对,评估LLM在证据支持下的多轮临床问答能力,发现模型在证据定位和多轮错误累积方面存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-06-17 cs.CV cs.CL 新提交

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19697 2026-06-17 eess.AS cs.MM cs.SD 版本更新

Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction

Plug-and-Steer:解耦分离与选择的音视频目标说话人提取

Doyeop Kwak, Suyeon Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 提出Plug-and-Steer方法,通过解耦分离与目标选择,利用冻结的纯音频骨干网络和潜引导矩阵实现高保真音视频目标说话人提取。

Comments Accepted by Interspeech 2026; demo available https://plugandsteer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17356 2026-06-17 cs.CL 版本更新

PACE-RAG: Patient-Aware Contextual and Evidence-Constrained RAG for Clinical Drug Recommendation

PACE-RAG:面向临床药物推荐的患者感知上下文与证据约束RAG

Chaeyoung Huh, Hyunmin Hwang, Jung Hwan Shin, Sungyang Jo, Jinse Park, Jong Chul Ye

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Department of Neurology, Seoul National University Hospital(首尔国立大学医院神经科) Asan Medical Center, University of Ulsan, College of Medicine(釜山大学医学院阿桑医院) Haeundae Paik Hospital, Inje University(庆尚大学医院海undae医院)

AI总结 提出PACE-RAG框架,通过提取患者特定临床特征、检索相关病例并结合当前症状与用药史,实现个性化药物推荐,在帕金森病和MIMIC-IV数据集上取得最优性能。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23116 2026-06-17 cs.LG cs.GT stat.ML 版本更新

Provably Efficient Regularized Online RLHF with Generalized Bilinear Preferences

具有广义双线性偏好的可证明高效正则化在线RLHF

Junghyun Lee, Minju Hong, Kwang-Sung Jun, Chulhee Yun, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) KAIST EE(韩国科学技术院电子工程系) POSTECH CSE/AI(POSTECH 计算科学与人工智能系)

AI总结 研究在线RLHF中正则化最佳响应最大遗憾最小化问题,通过广义双线性偏好模型证明强凸性可导出多对数遗憾,表明快速遗憾不限于KL散度。

Comments 48 pages, 3 figures (ver3: major revisions; ver2: more colorful boxes, fixed some typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04574 2026-06-17 cs.CL 版本更新

FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback

FeedEval: 面向教学法的LLM生成作文反馈评估

Seongyeub Chu, Jongwoo Kim, Munyong Yi

机构 * Graduate School of Data Science, KAIST(数据科学研究生院,韩国科学技术院) Department of Industrial & Systems Engineering, KAIST(工业与系统工程系,韩国科学技术院)

AI总结 提出FeedEval框架,沿特异性、帮助性和有效性三个教学维度评估LLM生成的作文反馈,通过专用评估器筛选高质量反馈,提升下游评分和修订效果。

详情

展开后加载摘要…

URL PDF HTML 收藏