arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2504.02132 2026-04-03 cs.CL cs.CR cs.CV cs.IR 62%

One Pic is All it Takes: Poisoning Visual Document Retrieval Augmented Generation with a Single Image

一张图片足矣:通过单张图片对视觉文档检索增强生成进行污染攻击

Ezzeldin Shereen, Dan Ristea, Shae McFadden, Burak Hasircioglu, Vasilios Mavroudis, Chris Hicks

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究了视觉文档检索增强生成(VD-RAG)对污染攻击的脆弱性,通过单张恶意图片实现针对性和通用性攻击,展示了VD-RAG在目标和通用设置下的漏洞,但在黑盒攻击下表现出一定的鲁棒性。

Comments Published in Transactions on Machine Learning Research (03/2026)

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01598 2026-04-03 cs.CV 57%

Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition

Riemannian和Symplectic几何用于层次化文本驱动的位置识别

Tianyi Shang, Zhenyu Li

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SympLoc框架,通过多级对齐策略提升文本到点云定位的鲁棒性,实验显示在KITTI360Pose数据集上Top-1召回率提升19%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 8 篇

2604.02289 2026-04-03 cs.CV cs.AI 73%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 57%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01964 2026-04-03 cs.CV 57%

Automated Prostate Gland Segmentation in MRI Using nnU-Net

使用nnU-Net进行MRI中前列腺的自动分割

Pablo Rodriguez-Belenguer, Gloria Ribas, Javier Aquerreta Escribano, Rafael Moreno-Calatayud, Leonor Cerda-Alberich, Luis Marti-Bonmati

机构 * Biomedical Imaging Research Group (GIBI230), Instituto de Investigación Sanitaria La Fe, Valencia, Spain(生物医学影像研究组(GIBI230),拉菲健康研究所,巴伦西亚,西班牙)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于nnU-Net的深度学习方法,利用多模态MRI数据实现前列腺自动分割,通过交叉验证和外部验证显示其高精度和泛化能力,优于通用工具。

Comments 9 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 57%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 57%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01361 2026-04-03 cs.CV 57%

IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation

IGLOSS:面向激光雷达开放词汇语义分割的图像生成

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种新的方法,用于3D汽车激光雷达数据的零样本开放词汇语义分割。通过文本生成图像创建原型,利用2D视觉基础模型提取3D网络特征,实现点云标注,方法在nuScenes和SemanticKITTI上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16804 2026-04-03 cs.CV 57%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01567 2026-04-03 cs.RO 50%

AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation

AnchorVLA:基于锚定扩散的高效端到端移动操作

Jia Syuen Lim, Zhizhen Zhang, Peter Bohm, Brendan Tidd, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Robotics and Autonomous Systems Group, CSIRO(CSIRO机器人与自主系统组)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出AnchorVLA,一种基于扩散的VLA策略,通过锚定扩散头在局部去噪以保留多模态动作生成,减少推理成本并提高移动操作的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 16 篇

2604.01634 2026-04-03 cs.LG cs.CL 85%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CL

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01916 2026-04-03 cs.CL 79%

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

SURE:用于对话中多模态情绪识别的协同不确定性推理

Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen, Yun Xue, Julia Hirschberg, Ziwei Gong

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials(广东省量子工程与量子材料重点实验室) School of Electronic Science and Engineering (School of Microelectronics), South China Normal University(华南师范大学电子科学与工程学院(微电子学院)) Shenzhen University(深圳大学) Columbia University(哥伦比亚大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 SURE通过整合多模态信号并增强鲁棒性和上下文建模,改进了对话中情绪识别的不确定性处理和细粒度推理能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01433 2026-04-03 cs.ET cs.AI eess.SP 79%

Semantically Annotated Multimodal Dataset for RF Interpretation and Prediction

语义标注的多模态数据集用于射频解释与预测

Steve Blandino, Jelena Senic, Raied Caromi, Samuel Berweger, Anuraag Bodi, Camillo Gentile, Nada Golmie

机构 * National Institute of Standards and Technology (NIST)(美国国家标准与技术研究院) Prometheus Computing LLC(普罗米修斯计算有限责任公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出结合射频测量与视觉数据的多模态数据集,用于提升射频信号与物理环境的解释与预测能力。

Journal ref NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 79%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-04-03 cs.DB 78%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 67%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 62%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI 62%

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18588 2026-04-03 cs.CV cs.MM 62%

A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis

一种基于FACS的解剖学对齐的面部行为描述范式用于细粒度面部行为合成

Jiahe Wang, Cong Liang, Xuandong Huang, Yuxin Wang, Xin Yun, Yi Wu, Yanan Chang, Shangfei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于FACS的面部行为合成新范式,通过解剖学驱动的自然语言控制信号,构建了首个大规模文本-图像配对数据集,并提出AAAD指标和VQ-AUFace框架,显著提升了合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02328 2026-04-03 cs.CV 57%

Modulate-and-Map: Crossmodal Feature Mapping with Cross-View Modulation for 3D Anomaly Detection

调制与映射:用于3D异常检测的跨模态特征映射与跨视图调制

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

机构 * CVLab, University of Bologna(博洛尼亚大学CVLab) Ca’ Foscari University of Venice(威尼斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ModMap提出一种多视图多模态框架,通过跨模态特征映射和视图依赖关系建模,实现3D异常检测与分割,采用跨视图训练策略提升异常评分。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02040 2026-04-03 cs.CV 57%

Efficient Reasoning via Thought Compression for Language Segmentation

通过思维压缩实现高效的语言分段推理

Qing Zhou, Shiyu Zhang, Yuyu Jia, Junyu Gao, Weiping Ni, Junzheng Wu, Qi Wang

机构 * Northwestern Polytechnical University, China(西北工业大学) Northwest Institute of Nuclear Technology, China(西北核技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 WISE通过压缩推理过程提升语言分段性能,采用自蒸馏目标确保简洁总结与详细解释的语义一致性,实验显示其在ReasonSeg基准上达到58.3 cIoU,推理长度减少近5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01354 2026-04-03 cs.CL 57%

Open-Domain Safety Policy Construction

开放领域安全政策构建

Di Wu, Siyue Liu, Zixiang Ji, Ya-Liang Chang, Zhe-Yu Liu, Andrew Pleffer, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Taboola

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Deep Policy Research(DPR),通过仅使用人类撰写的种子领域信息,构建完整的内容审核政策。DPR利用单一网络搜索工具和轻量级框架,迭代提出搜索查询,提炼多样化网络资源为政策规则,并将规则组织成索引文档。

Comments EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29200 2026-04-03 cs.LG cs.AI 57%

Improving Ensemble Forecasts of Abnormally Deflecting Tropical Cyclones with Fused Atmosphere-Ocean-Terrain Data

通过融合大气-海洋-地形数据提升异常偏转热带气旋集合预报

Qixiang Li, Yuan Zhou, Shuwei Huo, Chong Wang, Xiaofeng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Center for Ocean Mega-Science, Chinese Academy of Sciences(中国科学院海洋大科学研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AOT-TCs多源多模态数据集及首个融合大气-海洋-地形耦合架构的预报模型,显著提升正常和异常偏转热带气旋的预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21687 2026-04-03 cs.AI 57%

MIRAGE: The Illusion of Visual Understanding

MIRAGE:视觉理解的幻觉

Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, Euan Ashley

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12324 2026-04-03 cs.CR cs.AI 57%

UniMark: Artificial Intelligence Generated Content Identification Toolkit

UniMark:人工智能生成内容识别工具包

Meilin Li, Ji He, Yi Yu, Jia Xu, Shanzhe Lei, Yan Teng, Yingchun Wang, Xuhong Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shandong University(山东大学) Shanghai Information Security Testing Evaluation and Certification Center(上海市信息安全测评认证中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 UniMark通过统一框架和双操作策略,解决AI生成内容识别的碎片化问题,支持隐水印和可见标记,提供标准化评估框架以提升内容治理透明度和安全性。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-04-03 cs.AI cs.MA 57%

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 5 篇

2604.02097 2026-04-03 cs.CV cs.LG 79%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01007 2026-04-03 cs.AI 79%

Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory

Omni-SimpleMem:自主研究引导的终身多模态代理记忆发现

Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin Tu, Zeyu Zheng, Cihang Xie, Charles Fleming, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Pennsylvania(宾夕法尼亚大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California Berkeley(加州大学伯克利分校) Cisco(思科)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Omni-SimpleMem,通过自主研究流程发现多模态记忆框架,提升AI代理的长期记忆能力,其核心贡献在于通过自动实验发现架构改进、数据管道修复等关键突破,超越传统AutoML。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 62%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏