arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-05-20 至 2026-05-20 共收录 16
2605.20079 2026-05-20 cs.CV cs.AI cs.LG eess.IV

Probability-Conserving Flow Guidance

概率守恒的流引导

Parsa Esmati, Junha Hyung, Amirhossein Dadashzadeh, Jaegul Choo, Majid Mirmehdi

机构 * University of Bristol(布里斯托大学) KAIST(韩国科学技术院)

AI总结 本文提出了一种概率守恒的流引导方法AdaMaG,通过分析连续方程,将引导效果分解为发散项和分数平行项,并通过时间依赖的调度和分数平行衰减来控制这两个项,从而在不增加推理成本的情况下提高生成质量并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20006 2026-05-20 cs.AI

GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

GeoX:通过自我对战和可验证奖励掌握地理空间推理

Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha

机构 * KAIST(韩国科学技术院) MPI-SP(马克斯·普朗克研究所) MPI-SWS(马克斯·普朗克研究所)

AI总结 本文提出GeoX框架,通过自我对战和可验证奖励解决图像 grounded 的复杂空间问题,无需大规模人工标注数据,提升了基础视觉语言模型在地理空间理解上的性能。

Comments 26 pages,12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16062 2026-05-20 cs.LG

Gauge-Equivariant Graph Networks via Self-Interference Cancellation

通过自干扰消除的 gauge-等变图网络

Yoonhyuk Choi, Jiho Choi, Jiwoo Kang

机构 * Department of Artificial Intelligence, Sookmyung Women's University, Seoul, South Korea(首尔大学女子大学人工智能系) Korea Advanced Institute of Science and Technology, Seoul, South Korea(韩国科学技术院)

AI总结 本文提出了一种通过自干扰消除的 gauge-等变图网络(GESC),该网络通过投影机制替代传统的加法聚合,有效处理异质图中的自干扰问题,从而提升模型在异质图上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19631 2026-05-20 cs.RO cs.CV

HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models

HEAT: 基于轨迹引导的世界模型实现异构端到端自动驾驶

Hoonhee Cho, Giwon Lee, Jae-Young Kang, Hyemin Yang, Heejun Park, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 本文提出一种基于轨迹引导的学习方法,通过规划轨迹组织训练,使模型能够捕捉驾驶意图的领域不变表示,并结合预测未来潜在特征的世界模型,提高特征一致性并缓解领域偏见,从而在多个异构数据集上实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19355 2026-05-20 cs.GR cs.AI cs.CV cs.LG

Skinned Motion Retargeting with Spatially Adaptive Interaction Guidance

具有空间自适应交互引导的皮肤运动重定向

Soojin Choi, Seokhyeon Hong, Chaelin Kim, Junghyun Nam, Junhyuk Jeon, Junyong Noh

机构 * Visual Media Lab(视觉媒体实验室) KAIST(韩国科学技术院)

AI总结 本文提出了一种几何感知的运动重定向框架,通过在空间自适应锚点上进行接近匹配,保留交互语义,以解决在不同身体形状角色之间重定向运动时保持交互语义(如自接触和近身体接近)的挑战。

Comments SIGGRAPH 2026 / ACM TOG. Project page available at https://suzyn.github.io/space_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19317 2026-05-20 cs.LG cs.AI

Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement

通过迭代部分细化在扩散模型中实现推理时间扩展

Taegu Kang, Jaesik Yoon, Sungjin Ahn

机构 * KAIST(韩国科学技术院)

AI总结 本文提出了一种无需外部验证器的扩散模型推理时间扩展方法Iterative Partial Refinement,通过在混合噪声条件下迭代部分细化生成更一致的样本,在MNIST Sudoku任务中提升了有效解率。

Comments Accepted at the ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19206 2026-05-20 cs.RO

CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation

CLUE: 通过利用统一语义地图实现适应性优先级上下文线索

Taeyun Kim, Alvin Jinsung Choi, Dasol Hong, Hyun Myung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

AI总结 CLUE通过利用统一语义地图,采用适应性优先级上下文线索的方法,有效解决零样本物体-目标导航问题,提高了导航的鲁棒性和效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17889 2026-05-20 cs.LG

CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution

CoX-MoE: 通过AMX启用的CPU-GPU协同执行提升高吞吐量MoE推理的协同专家执行

Muyoung Son, Yi Chen, Seungjae Yoo, Soongyu Choi, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CoX-MoE,一种通过AMX启用的CPU-GPU协同系统,通过协同专家执行和战略工作负载编排优化MoE推理,提升吞吐量。CoX-MoE引入了coalescing-aware orchestration策略和静态专家-aware分层方案,分别优化资源分配和减少PCIe传输开销,从而在吞吐量上比现有框架提升7.1倍和2.4倍。

Comments 7 pages, 8 figures, accepted to DAC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11089 2026-05-20 cs.CV

Structured State-Space Regularization for Generation-Friendly Image Tokenization

结构化状态空间正则化用于生成友好的图像标记化

Jinsung Lee, Jaemin Oh, Namhun Kim, Dongwon Kim, Byung-Jun Yoon, Suha Kwak

机构 * POSTECH Brown University(布朗大学) KAIST(韩国科学技术院) Texas A&M University(德克萨斯大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

AI总结 本文提出结构化状态空间正则化方法,通过诱导潜在空间的频谱结构提升图像标记化生成性能,同时保持重建保真度。

Comments Related blog posts in https://jinsingsangsung.github.io/collections/blog/ : Towards 2-Dimensional State-Space Models series

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16112 2026-05-20 cs.AI

IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra

IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构

Heewoong Noh, Namkyeong Lee, Gyoung S. Na, Kibum Kim, Chanyoung Park

机构 * KAIST(韩国科学技术院) KRICT(韩国信息通信技术研究院)

AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08248 2026-05-20 cs.CV

TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation

TextBoost: 通过文本编码器提升文本到图像生成的个性化

NaHyeon Park, Kunhee Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。

Comments Project page: https://textboost.github.io. Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18899 2026-05-20 cs.LG cs.AI

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target

不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标

Taesan Kim, Hyeongjun Yun, Jaegul Choo, Chung Park

机构 * SK Telecom(SK电信) KAIST(韩国科学技术院)

AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18864 2026-05-20 cs.LG cs.AI cs.CL

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

SAGE: 通过塑造锚点引导LLMs的RLVR探索

Chanuk Lee, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18766 2026-05-20 cs.IR cs.AI cs.CL

Retrieve Only Relevant Tables Whether Few or Many: Adaptive Table Retrieval Method

仅检索相关表格,无论多少:自适应表格检索方法

Taehee Kim, Seungbin Yang, Jihwan Kim, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 本文提出了一种自适应表格检索方法,根据查询需求调整检索表格数量,通过自适应阈值机制和滑动窗口重排序算法,有效解决传统top-k检索策略的局限性,提升检索和下游任务性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏