arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-20 至 2026-05-20 共收录 94 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2605.18984 2026-05-20 cs.CV 77%

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

Artifact-Bench: 评估MLLMs在检测和评估AI生成视频中的伪影

Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang, Haotian Wang, Yuanxing Zhang, Pengfei Wan

机构 * Kling Team(Kling团队) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Artifact-Bench,一个用于评估多模态大语言模型在检测和分析AI生成视频伪影能力的基准,揭示了现有模型在伪影感知和推理上的显著局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22258 2026-05-20 cs.CV cs.AI 62%

Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks

超越分类准确度:Neural-MedBench与更深层次推理基准的需求

Miao Jing, Mengting Jia, Junling Lin, Zhongxia Shen, Huan Gao, Mingkun Xu, Shangyang Li

机构 * School of Physics Science and Technology, Beijing University of Posts and Telecommunications(北京邮电大学物理科学与技术学院) Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院) Beijing Chaoyang Hospital, Capital Medical University(北京朝阳医院) Sleep Medical Center, Huzhou Third Municipal Hospital, Affiliated Hospital of Wenzhou Medical University(湖州第三人民医院睡眠医学中心,温州医科大学附属医院) University of Macau(澳门大学) Renyixun Health Technology Co., Ltd(仁颐讯健康科技有限公司) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学交叉学科研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Neural-MedBench,一个专门用于测试多模态神经病学推理能力的基准,揭示现有医疗数据集过于强调分类准确度的问题,并通过系统评估发现模型推理失败而非感知误差主导性能下降,强调需要兼顾广度与深度的评估框架。

Comments 23 pages, 12 figures

Journal ref ICLR'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20164 2026-05-20 cs.AI 57%

Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

并非每个评分标准都等同教学:面向RLVR的政策感知评分奖励

Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei, Daniel George, Anas Mahmoud, Jackson Lee, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出POW3R框架,通过保留人类权重和类别平衡,改进评分奖励机制,使评分标准更符合最终答案的要求,从而在多模态和纯文本设置中提升性能。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19522 2026-05-20 cs.CV 57%

iDiff: Interpretable Difference-aware Framework for Pairwise Image Quality Assessment

iDiff:用于成对图像质量评估的可解释差异感知框架

Xinli Yue, JianHui Sun, Tao Shao, Liangchao Yao, Fan Xia, Yuetang Deng

机构 * Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出iDiff框架,通过双分支设计结合可解释的差异建模和结构化多模态推理,提升成对图像质量评估的鲁棒性和可解释性,并在NTIRE 2026 RAIM挑战中取得第一名。

Comments Accepted to CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19390 2026-05-20 cs.CV 57%

LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

LMM-Track4D: 通过轨迹引导的对话激发LMM中的4D动态推理

Chaoyue Li, Yongxue Xu, Jie Feng, Jiayu Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Beihang University(北航) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LMM-Track4D任务,通过轨迹引导的多轮时空对话,结合RTGE、TRK和OSK-RA解码器,提升LMM在4D动态推理中的性能,实验表明显式动态状态建模是有效设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21464 2026-05-20 cs.CV 57%

CXR-LanIC: Language-Grounded Interpretable Classifier for Chest X-Ray Diagnosis

CXR-LanIC:基于语言的可解释分类器用于胸部X光诊断

Yiming Tang, Wenjia Zhong, Rushi Shah, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CXR-LanIC,一种基于语言的可解释分类器,通过任务对齐的模式发现解决胸部X光诊断的可解释性挑战,通过训练稀疏自编码器提取可解释的视觉模式,实现高准确率的诊断并支持自然语言解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10075 2026-05-20 cs.AI 57%

Active Testing of Large Language Models via Approximate Neyman Allocation

通过近似奈曼分配主动测试大型语言模型

Zeli Liu, Jiancheng Zhang, Cong Liu, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种针对生成任务的主动测试算法,利用语义熵进行分层并基于代理模型提取的信号进行近似奈曼分配,从而在多个语言和多模态基准测试中显著提升性能,实现高达28%的均方误差降低和22.9%的预算节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19136 2026-05-20 cs.RO 50%

Automatically Improving Simulation Physics for Articulated Objects

自动提升仿真的物理特性用于关节物体

Anh-Quan Pham

机构 * Penn(宾夕法尼亚大学) PennPAL Lab(宾夕法尼亚大学PAL实验室)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文研究了如何通过量化评估框架和多模态仿真反馈方法,提升关节物体在仿真中的物理真实性和稳定性,从而提高机器人学习的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19132 2026-05-20 cs.LG 50%

CLIC: Contextual Language-Informed Cardiac Pathology Classification

CLIC: 基于上下文的语言引导心脏病理分类

Giovani D. Lucafo, Rafael da Costa Silva, João Lucas Luz Lima Sarcinelli, Andre Guarnier De Mitri, Diego Furtado Silva

机构 * Institute of Mathematical and Computer Sciences(数学与计算机科学学院) Universidade de São Paulo(圣保罗大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出CLIC框架,通过将患者上下文数据转化为描述性文本,利用自然语言编码技术提升心脏病理诊断的精确度,同时探索大语言模型生成的临床描述在下游分类任务中的应用。

Comments 6 pages, 2 figures, accepted at the ICLR 2026 Workshop on Time Series in the Age of Large Models (TSALM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19110 2026-05-20 cs.CE 50%

IterSIMP-σ: Evaluating LLM-Assisted Spatial Interventions in Stress-Aware Topology Optimization

IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预

Shaoliang Yang, Jun Wang, Yunsheng Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。

Comments 44 pages, 19 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2605.18758 2026-05-20 cs.HC cs.AI 85%

OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments

OmniGUI: 评估多模态智能手机环境中的GUI代理的基准测试

Felix Henry, Xiaochen Lin, Jiangyou Zhu, Yangfan, Bingqian Zhang, Min Chen, Shiyu Huang

机构 * XPeng Motors(小鹏汽车)

专题命中 多模态Agent :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出OmniGUI基准测试,用于评估在多模态智能手机环境中GUI代理的能力,通过连续的多模态输入(包括静态图像、同步音频和视频片段)来模拟真实世界交互,发现当前模型在需要同步时间和听觉信号的环境中表现下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20176 2026-05-20 cs.CL 79%

ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning

ClinSeekAgent: 自动化多模态证据检索以实现代理临床推理

Juncheng Wu, Letian Zhang, Yuhan Wang, Haoqin Tu, Hardy Chen, Zijun Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出ClinSeekAgent,一种自动化代理框架,用于动态多模态证据检索,旨在从异构来源主动检索、迭代规划和综合多模态证据,从而提升临床决策支持。

Comments 24 pages, 9 figures; Project Page: https://ucsc-vlaa.github.io/ClinSeekAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 67%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19484 2026-05-20 cs.CV cs.AI cs.GR cs.HC 62%

CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing

CutVerse: 一个用于媒体后期制作编辑的组合式GUI代理基准测试

Haobo Hu, Xiangwu Guo, Zhiheng Chen, Difei Gao, Haotian Liu, Libiao Jin, Qi Mao

机构 * MIPG, Communication University of China(MIPG,中国传媒大学) National University of Singapore(新加坡国立大学) USEIT AI(USEIT人工智能)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CutVerse,一个用于评估自主GUI代理在真实媒体后期制作环境中的能力的基准测试,揭示现有代理在复杂、长周期媒体后期制作工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19260 2026-05-20 cs.AI cs.CV cs.MA 62%

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

AQuaUI: 用于GUI代理的视觉令牌减少方法基于自适应四叉树

Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AQuaUI,一种无需训练的推理时GUI代理模型的视觉令牌减少方法,利用屏幕截图中的非均匀信息密度,通过自适应四叉树结构保持令牌位置以确保一致性,并通过条件四叉树算法提升多步骤GUI交互的时序一致性,实验表明其在准确性和效率之间取得了改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 57%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09872 2026-05-20 cs.LG cs.AI 57%

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

WARC-Bench:基于网络存档的GUI子任务执行基准

Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

机构 * Uniphore

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出WARC-Bench,一个基于网络存档的GUI子任务执行基准,通过438个任务评估多模态AI代理在子任务上的能力,实验表明SFT和RLVR方法在提升子任务执行效果上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2505.23747 2026-05-20 cs.CV cs.AI cs.LG 91%

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20035 2026-05-20 cs.CV 85%

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

面向高效多模态大语言模型的阶段自适应令牌选择

Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出SEATS方法,通过阶段自适应的令牌选择技术,有效提升多模态大语言模型的推理效率,在保留96.3%原始性能的同时,实现9.3倍的FLOPs减少和4.8倍的prefill加速。

Comments Code Link: https://github.com/xxayt/SEATS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 85%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18988 2026-05-20 cs.CR cs.AI 83%

Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks

在不可见中存活:面向新颖多轮多模态攻击的预测防御

Doohee You

机构 * Trust and Safety, Google(谷歌信任与安全部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种预测性防御方法,用于应对新颖多轮多模态攻击,通过动态生存预测和轨迹动态问题来解决静态防御机制的不足,建立了一个计算高效且可解释的安全保障框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19135 2026-05-20 cs.LG 78%

Identifiable Multimodal Causal Representation Learning under Partial Latent Sharing

部分潜在变量共享下的可识别多模态因果表示学习

Manal Benhamza, Marianne Clausel, Myriam Tami

机构 * Paris-Saclay University, CentraleSupélec, MICS Lab(巴黎-萨克雷大学,中央理工-巴黎高等电力学院,MICS实验室) Lorraine University, CRAN(洛林大学,CRAN)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在部分潜在变量共享设定下多模态因果表示学习的可识别性问题,通过非线性混合函数生成各模态数据,并在不假设潜在变量分布的情况下,建立了因果潜在表示的组件可识别性保证,进一步验证了在欠定情况下方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16353 2026-05-20 cs.CV cs.AI 73%

StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

StrLoRA: 向流式连续视觉指令微调迈进以适应大规模多模态语言模型

Chang Che, Ziqi Wang, Hui Ma, Cheems Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出StrLoRA,一种流式连续视觉指令微调方法,旨在解决动态任务流中模型持续学习的问题,通过任务感知的专家路由框架提升模型在不断变化的数据流中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19660 2026-05-20 cs.LG cs.CL 70%

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

OScaR:LLMs及更广泛场景中的极压缩KV缓存量化之奥卡姆之刀

Zunhai Su, Rui Yang, Chao Zhang, Yaxiu Liu, Yifan Zhang, Wei Wu, Jing Xiong, Dayou Du, Xialie Zhuang, Yulei Qian, Yuchen Xie, Yik-Chung Wu, Hongxia Yang, Ngai Wong

机构 * Tsinghua University(清华大学) Meituan LongCat Team(美团LongCat团队) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学) UCAS(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 本文针对LLMs中KV缓存极压缩时的量化保真问题,提出OScaR框架,通过Canalized Rotation和Omni-Token Scaling有效缓解Token Norm Imbalance,实现近无损的INT2量化性能,同时提升解码速度和吞吐量。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16200 2026-05-20 cs.LG cs.CV 57%

Feature-Space Smoothing: Certified Robustness of Deep Representations

特征空间平滑:深度表示的认证鲁棒性

Song Xia, Meiwen Ding, Chenqi Kong, Wenhan Yang, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(快速-丰富目标搜索实验室,电气电子工程学院,南洋理工大学,新加坡) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种特征空间平滑(FS)框架,通过在特征表示层面提供认证鲁棒性,以解决深度学习模型对恶意输入的脆弱性问题,核心方法是通过特征平滑保证清洁和对抗特征之间的余弦相似度下界,并引入高斯平滑增强器(GSB)提升编码器的高斯鲁棒性得分,从而提升模型的鲁棒性并保持下游任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19727 2026-05-20 cs.CV 57%

Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

Tango3D: 向全局和局部2D-3D对应关系对齐迈进

Zebin He, Mingxin Yang, Shuhui Yang, Hanxiao Sun, Xintong Han, Chunchao Guo, Wenhan Luo

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Tango3D,一种统一密集对应和全局检索的3D基础模型,通过几何感知的2D视觉骨干网络和预训练的3D VAE将图像编码为2D片段,点云编码为3D标记,并映射到共享空间以实现局部像素-点对齐和全局语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19322 2026-05-20 cs.CV 57%

DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs

DynaTok: 时序自适应和位置偏见感知的视频大语言模型token压缩

Minyoung Park, Taehun Kong, Sangjun Ahn

机构 * LG Electronics, Seoul, South Korea(LG电子,首尔,韩国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DynaTok,一种无需训练的时序自适应和位置偏见感知的token压缩框架,通过在时序和空间维度上分配token预算,有效减少冗余的时空覆盖,提升视频大语言模型的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19227 2026-05-20 cs.CR cs.AI 57%

Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

逐token被入侵:统一自回归模型中的后门漏洞

Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了统一自回归模型中的后门漏洞问题,提出了一种名为Token by Token Backdoor Attack (ToBAC)的攻击方法,展示了如何通过数据和模型污染策略在多模态生成中引发有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09203 2026-05-20 cs.CV cs.RO 57%

3D Modeling and Automated Measurement of Concrete Cracks via Segment Anything Refinement and Visual Inertial LiDAR Fusion

通过段落任何精修和视觉惯性LiDAR融合进行混凝土裂缝的3D建模与自动测量

Pengru Deng, Jiapeng Yao, Chun Li, Su Wang, Xinrun Li, Varun Ojha, Xuhui He

机构 * School of Civil Engineering(土木工程学院) Central South University(中南大学) Hunan Provincial Key Laboratory for Disaster Prevention and Mitigation of Rail Transit Engineering Structures(湖南省铁路工程结构灾害预防与 mitigation 工程结构重点实验室) Nvidia School of Computing(计算学院) Newcastle University(新castle大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种结合计算机视觉技术和多模态同时定位与建图(SLAM)的创新框架,用于二维裂缝检测、三维重建和三维自动裂缝测量,解决了现有方法在适应性和鲁棒性方面的不足,特别是在处理曲线或复杂几何形状时的挑战。

Comments Title and author list updated

Journal ref Computer-Aided Civil and Infrastructure Engineering, Volume 45, 2026, 100019, ISSN 1093-9687

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18837 2026-05-20 cs.LG cs.AI eess.SP 57%

VCR: Learning Valid Contextual Representation for Incomplete Wearable Signals

VCR:学习不完整可穿戴信号的有效上下文表示

Yuxuan Weng, Wenhan Luo, Qijia Shao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VCR框架,通过学习鲁棒于模态缺失的表示,解决可穿戴信号不完整问题,提升在多种健康监测任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏