arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

共收录 1464
2601.20867 2026-04-21 cs.SD cs.AI eess.AS

Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion

通过语义扩展实现音频-语言模型的通用提示微调

Jaehyuk Jang, Wonjun Lee, Kangwook Ko, Changick Kim

机构 * KAIST(韩国科学技术院)

AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22215 2026-04-21 cs.IR cs.CV

Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy

混合向量检索用于视觉丰富文档:结合单向量效率和多向量准确性

Juyeon Kim, Geon Lee, Dongwon Choi, Taeuk Kim, Kijung Shin

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

AI总结 本文提出HEAVEN框架,通过单向量高效检索与多向量精确排序相结合,提升视觉丰富文档检索效率与准确性,同时引入ViMDoc基准测试。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02025 2026-04-21 cs.CL

Style over Story: Measuring LLM Narrative Preferences via Structured Selection

风格胜过故事:通过结构化选择测量大语言模型的叙事偏好

Donghoon Jung, Jiwoo Choi, Songeun Chae, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST(数字人文与计算社会科学学院,韩国科学技术院)

AI总结 通过结构化选择实验测量大语言模型的叙事偏好,发现模型在风格优先于叙事内容方面表现一致,且风格偏好稳定,而内容元素则存在模型间差异和指令敏感性。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21042 2026-04-21 cs.CL cs.LG

LayerNorm Induces Recency Bias in Transformer Decoders

层归一化在Transformer解码器中诱导近期偏差

Junu Kim, Xiao Liu, Zhenghao Lin, Lei Ji, Yeyun Gong, Edward Choi

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

AI总结 研究揭示Transformer解码器中层归一化与自注意力机制相互作用导致近期偏差的机制,分析残差连接和输入嵌入分布的影响,提出改进位置编码的新思路。

Comments Codes available at: https://github.com/starmpcc/layernorm_recency_bias

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11206 2026-04-21 cs.HC cs.AI cs.CL

Evalet: Evaluating Large Language Models through Functional Fragmentation

Evalet:通过功能碎片化评估大型语言模型

Tae Soo Kim, Heechan Lee, Yoonjoo Lee, Joseph Seering, Juho Kim

机构 * School of Computing, KAIST(韩国庆北大学计算机学院) Computer Science and Engineering, University of Michigan(美国密歇根大学计算机科学与工程学院)

AI总结 本文提出通过功能碎片化方法,分析生成AI输出中的关键片段,揭示其在评估标准下的作用,帮助用户发现更多模型输出中的问题。

Comments The first two authors hold equal contribution. Presented at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17785 2026-04-21 cs.CL cs.AI cs.LG

Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens

忘却重要信息,保留其余:信息性标记的选择性反学习

Seunghee Koh, Sunghyun Baek, Youngdong Kim, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Hanbat National University, South Korea(汉阳大学)

AI总结 本文提出ETW方法,通过熵引导标记加权实现信息性标记的选择性反学习,提升模型效用。

Comments Accepted to ACL 2026 Main Conference. 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03692 2026-04-21 cs.CV cs.AI

Error as Signal: Stiffness-Aware Diffusion Sampling via Embedded Runge-Kutta Guidance

误差作为信号:通过嵌入式龙格-库塔引导的刚性感知扩散采样

Inho Kong, Sojin Lee, Youngjoon Hong, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Korea Institute for Advanced Study(韩国高级研究院)

AI总结 本文提出嵌入式龙格-库塔引导方法,通过识别刚性区域减少局部截断误差,提升扩散模型采样稳定性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03122 2026-04-21 cond-mat.mtrl-sci cs.AI cs.LG

EGMOF: Efficient Generation of Metal-Organic Frameworks Using a Hybrid Diffusion-Transformer Architecture

EGMOF:一种高效生成金属有机框架的混合扩散-Transformer架构

Seunghee Han, Yeonghun Kang, Taeun Bae, Junho Kim, Younghun Kim, Varinia Bernales, Alan Aspuru-Guzik, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院化学与生物分子工程系) Department of Chemistry, University of Toronto(多伦多大学化学系) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Department of Chemistry, Sungkyunkwan University(成均馆大学化学系) Acceleration Consortium(加速联盟) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) NVIDIA

AI总结 EGMOF通过模块化流程实现高效MOF逆向设计,利用扩散模型与Transformer模型生成结构,仅需1000个训练样本即取得显著提升,适用于多种属性数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19028 2026-04-21 cs.CL

Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues

他们是恋人还是朋友?评估LLMs在英语和韩语对话中的社交推理能力

Eunsu Kim, Junyeong Park, Juhyun Oh, Kiwoong Park, Seyoung Song, A. Seza Doğruöz, Alice Oh, Najoung Kim

机构 * KAIST(韩国科学技术院) LT3 IDLab(ID实验室) Universiteit Gent(根特大学) Boston University(波士顿大学)

AI总结 本文通过SCRIPTS数据集评估LLMs在英语和韩语对话中推断人物关系的能力,发现当前模型在英语和韩语中的准确率分别为75-80%和58-69%,且存在显著的社交推理局限性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24328 2026-04-21 cs.CL

Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding

推测验证:利用信息增益来细化推测解码

Sungkyun Kim, Jaemin Kim, Dogyung Yoon, Jiho Shin, Junyeol Lee, Jiwon Seo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST(韩国科学技术院) Machine Learning Systems Lab(机器学习系统实验室)

AI总结 本文提出推测验证(SV),通过动态预测推测准确性并调整验证长度来提升推测解码效率,实验证明SV在多个NLP任务中显著优于SD和标准解码。

Comments 16 pages, 8 figures, accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23941 2026-04-21 cs.LG cs.CV

Vision Language Models are Biased

视觉语言模型存在偏见

An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri, Vy Tuong Dang, Anh Totti Nguyen, Daeyoung Kim

机构 * KAIST(韩国科学技术院) College of William and Mary(威廉与玛丽学院) University of Alberta(阿尔伯塔大学) Auburn University(阿伯茨维尔大学)

AI总结 研究探讨了视觉语言模型在计数和识别任务中的偏见问题,发现其在不同领域表现不佳,去除背景可显著提升准确率,揭示上下文视觉线索导致偏见。

Comments Code and qualitative examples are available at: vlmsarebiased.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09514 2026-04-21 cond-mat.mtrl-sci cs.LG physics.app-ph

Machine Learning Based Prediction of Proton Conductivity in Metal-Organic Frameworks

基于机器学习的金属有机框架中质子导电性预测

Seunghee Han, Byeong Gwan Lee, Dae Woon Lim, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(化学与生物分子工程系,韩国科学技术院) Department of Chemistry and Medical Chemistry, Yonsei University(化学与医学化学系,延世大学)

AI总结 本文利用机器学习方法构建了质子导电性MOF数据库,通过描述符和Transformer模型预测质子导电性,发现Transformer迁移学习模型具有最佳性能,MAE为0.91,为设计质子导电性MOF提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17054 2026-04-21 cs.CV cs.AI

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17020 2026-04-21 cs.CL cs.AI

Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation

超越静态基准:基于人设的模拟合成有害内容以实现稳健评估

Huije Lee, Jisu Shin, Hoyun Song, Changgeon Ko, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出基于人设的模拟合成有害内容框架,通过整合人口统计信息与主题兴趣,生成多样化且情境相关的有害交互,验证了其在有害性、挑战性和多样性方面的有效性,为评估检测系统提供更鲁棒的测试工具。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16388 2026-04-21 cs.RO cs.CV

Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering

基于可微渲染的视觉-RRT:通过可微渲染寻找视觉目标路径

Sebin Lee, Jumin Lee, Taeyeon Kim, Younju Na, Woobin Im, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Samsung Electronics(三星电子)

AI总结 本文提出视觉-RRT,结合可微机器人渲染与RRT采样探索,实现视觉目标路径规划,实验表明其在模拟和现实环境中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15857 2026-04-20 cs.CV

AHS: Adaptive Head Synthesis via Synthetic Data Augmentations

AHS: 通过合成数据增强实现自适应头部合成

Taewoong Kang, Hyojin Jang, Sohyun Jeong, Seunggi Moon, Gihwi Kim, Hoon Jin Jung, Jaegul choo

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学) FLIPTION

AI总结 本文提出AHS方法,通过合成数据增强解决头部合成中视角和表情多样性的限制,提升真实场景下的泛化能力。

Comments CVPR 2026, Project Page : https://keh0t0.github.io/AHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15809 2026-04-20 cs.CV

Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

对视觉-语言模型所见所感知进行对齐与适应性信息流

Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

AI总结 本文提出通过调节信息流提升视觉-语言模型的感知能力,通过动态令牌方法确定视觉令牌的重要性,从而提高视觉问答、视觉定位等任务的性能。

Comments CVPR 2026. Project page: https://cxliu0.github.io/AIF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15612 2026-04-20 cs.RO cs.CV

GaussianFlow SLAM: Monocular Gaussian Splatting SLAM Guided by GaussianFlow

GaussianFlow SLAM:基于GaussianFlow的单目Gaussian Splatting SLAM

Dong-Uk Seo, Jinwoo Jeon, Eungchang Mason Lee, Hyun Myung

机构 * School of Electrical Engineering, KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院电子工程学院)

AI总结 本文提出GaussianFlow SLAM,通过光学流引导场景结构和相机姿态优化,提升单目SLAM的映射质量和跟踪精度。

Comments 8 pages, 5 figures, 7 tables, accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15555 2026-04-20 cs.CV

CXR-LT 2026 Challenge: Multi-Center Long-Tailed and Zero Shot Chest X-ray Classification

CXR-LT 2026挑战:多中心长尾和零样本胸片分类

Hexin Dong, Yi Lin, Pengyu Zhou, Fengnian Zhao, Alan Clint Legasto, Juno Cho, Dohui Kim, Justin Namuk Kim, Mingeon Kim, Sunwoo Kwak, Gabriel Moyà-Alcover, Ky Trung Nguyen, Thanh-Huy Nguyen, Ha-Hieu Pham, Huy-Hieu Pham, Huy Le Pham, Nikhileswara Rao Sulake, Aina Tur-Serrano, Ruichi Zhang, Ang Zu, Adam E. Flanders, Zhiyong Lu, Ronald M. Summers, Mingquan Lin, Hao Chen, Yuzhe Yang, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与公共卫生科学系) Department of Radiology, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院阜外医院心血管病国家中心放射科) Department of Radiology, West China School of Medicine, Sichuan University(四川大学西昌医学院放射科) Sichuan University Affiliated Chengdu Second People’s Hospital(四川大学附属成都第二人民医院) Department of Radiology, Weill Cornell Medicine(韦尔·科恩医学中心放射科) School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院) Gwangju Institute of Science and Technology(光州科学技术院) Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系) School of Electrical and Computer Engineering, Cornell Tech(康奈尔科技学院电气与计算机工程系) Department of Mathematics and Computer Science, Universitat de les Illes Balears(巴利阿里大学数学与计算机科学系) School of Computer Science and Engineering, VNU-HCM International University(VNU-HCM国际大学计算机科学与工程系) Vietnam National University, Ho Chi Minh City(越南国家大学河内市分校) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) VNU-HCM University of Science, Ho Chi Minh City(VNU-HCM科技大学河内市分校)

AI总结 本文提出CXR-LT 2026挑战,通过多中心数据集和零样本任务,研究长尾分布和开放世界下的胸片分类问题,评估视觉语言模型在罕见疾病检测中的表现。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25897 2026-04-20 cs.CL cs.AI cs.CY

RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity

RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准

Jisu Shin, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15075 2026-04-17 cs.SE cs.LG

Atropos: Improving Cost-Benefit Trade-off of LLM-based Agents under Self-Consistency with Early Termination and Model Hotswap

Atropos:通过早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡

Naryeong Kim, Shin Yoo

机构 * KAIST(韩国明知大学)

AI总结 本文提出Atropos技术,通过预测早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡,实验表明其能将性能提升至闭合LLM的74.35%,成本降低至23.9%。

Comments Will appear at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14644 2026-04-17 cs.CL cs.LG

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

CURaTE:在实时中实现连续反学习以确保大语言模型知识的保留

Seyun Bae, Seokhan Lee, Eunho Yang

机构 * KT Corporation(KT公司) KAIST(韩国科学技术院)

AI总结 本文提出CURaTE方法,通过训练句子嵌入模型实现实时连续反学习,有效提升遗忘效果并保持知识完整性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18107 2026-04-17 cs.LG stat.ML

Active Learning with Selective Time-Step Acquisition for PDEs

用于PDEs的选时段获取的主动学习

Yegon Kim, Hyunsu Kim, Gyeonghoon Ko, Juho Lee

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出STAP方法,通过选择性获取关键时间步减少计算成本,提升PDE代理模型的主动学习效率。

Comments This manuscript is an improvement over the camera-ready version in ICML 2025. We have added a clearer motivation for our acquisition function. (See Sections 2.3 and 3.2)

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14004 2026-04-16 cs.AI cs.CL

Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents

记忆迁移学习:编码代理跨领域记忆是如何转移的

Kangsan Kim, Minki Kang, Taeil Kim, Yanlai Yang, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) New York University(纽约大学)

AI总结 本文研究了记忆迁移学习,通过统一的记忆池跨异构领域提升编码代理性能,发现高层抽象优于低层痕迹,记忆池规模影响迁移效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00695 2026-04-16 cs.RO cs.CV

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

HAMLET: 将视觉-语言-动作模型转换为历史感知策略

Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) UC Berkeley(伯克利大学)

AI总结 本文提出HAMLET框架,通过引入时刻标记和轻量记忆模块,使视觉-语言-动作模型能关注历史上下文,提升长周期任务表现,实验显示在多个基准测试中均取得显著提升。

Comments ICLR 2026. Project page: https://myungkyukoo.github.io/hamlet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05407 2026-04-16 cs.AI cs.CL

H-AdminSim: A Multi-Agent Simulator for Realistic Hospital Administrative Workflows with FHIR Integration

H-AdminSim:一种用于真实医院行政工作流的多智能体模拟器,集成FHIR

Jun-Min Lee, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心)

AI总结 H-AdminSim通过结合真实数据生成与多智能体模拟,系统评估LLM在医院行政工作流中的表现,利用FHIR实现跨异构环境的标准化测试平台。

Comments Accepted at CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17247 2026-04-16 eess.AS cs.SD

DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis

DeepASA: 一种面向多用途的面向对象网络用于听觉场景分析

Dongheon Lee, Younghoo Kwon, Jung-Woo Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 DeepASA提出了一种多用途模型,通过统一框架实现多输入多输出声源分离、消回声、声音事件检测、音频分类和到达方向估计。采用面向对象处理策略,通过链式推理机制提升任务鲁棒性。

Comments 21 pages, 13 figures, 11 tables, published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12762 2026-04-15 cs.CV cs.AI cs.MA

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

ARGOS:智能多摄像机人像搜索中的谁、哪里和何时

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

机构 * KAIST(韩国科学技术院) University of Seoul(首尔大学) KIST(韩国科学技术院)

AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。

Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)

详情

展开后加载摘要…

URL PDF HTML 收藏