arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 58 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 85%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 83%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01638 2026-05-05 cs.CV 83%

Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection

Omni-Fake:面向社交媒体的统一多模态深度伪造检测基准测试

Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Jason Li, Guangliang Cheng

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Omni-Fake多模态深度伪造检测基准,包含大规模数据集和分布外基准,支持联合检测-定位-解释协议,并提出基于强化学习的多模态检测器,提升检测准确性和可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01250 2026-05-05 cs.AI 83%

EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents

EO-Gym: 一种多模态、交互式环境用于地球观测代理

Sai Ma, Zhuang Li, Sichao Li, Xinyue Xu, Ruibiao Zhu, Tony Boston, John A. Taylor

机构 * The Australian National University(澳大利亚国立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 EO-Gym通过构建多模态交互环境,解决地球观测分析中不确定性处理问题,提供9078条轨迹和34604步的基准数据,评估10种VLMs显示通用模型在时空和跨模态任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01384 2026-05-05 q-fin.CP 82%

SBCA: Cross-Modal BERT-driven Actor-Critic for Multi-Asset Portfolio Optimization

SBCA:跨模态BERT驱动的Actor-Critic多资产组合优化框架

Jinfeng Pan, Jiahao Chen

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 本文提出SBCA框架,通过跨模态门控融合机制整合价格数据与文本语义,结合风险与交易成本约束,提升多资产组合优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 81%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01424 2026-05-05 cs.LG cs.AI 79%

Quantifying Multimodal Capabilities: Formal Generalization Guarantees in Pairwise Metric Learning

量化多模态能力:成对度量学习中的形式泛化保证

Richeng Zhou, Xuelin Zhang, Liyuan Liu

机构 * College of Informatics, Huazhong Agricultural Univeristy, Wuhan, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过理论分析多模态度量学习模型的泛化性质,揭示模态选择与算法性能的关系,推导新的泛化误差界,证明细粒度模态特征能降低假设空间复杂度,提升多模态学习系统的收敛速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 62%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01496 2026-05-05 cs.CV 57%

SF20K Competition 2025: Summary and findings

SF20K竞赛2025:总结与发现

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * SLoMO Workshop(SLoMO工作坊) Hugging Face

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 57%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 57%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01238 2026-05-05 cs.HC cs.CV 57%

EduGage: Methods and Dataset for Sensor-Based Momentary Assessment of Engagement in Self-Guided Video Learning

EduGage:基于传感器的自我引导视频学习中即时参与度评估的方法与数据集

Zikang Leng, Edan Eyal, Yingtian Shi, Jiaman He, Yaqi Liu, Thomas Plötz

机构 * School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EduGage方法与数据集,通过可穿戴和摄像头设备收集生理和运动信号,评估学习者参与度,实验显示多模态建模在参与度评估中有效,且轻量级的生理与行为信号组合优于全多模态设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01234 2026-05-05 cs.CV 57%

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

TT4D:一个用于从单目视频中进行乒乓球4D重建的流水线和数据集

Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry

机构 * University of California, Berkeley(加州大学伯克利分校) University of Augsburg(奥格斯堡大学) University of Tübingen(图宾根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TT4D数据集,通过创新的重建流水线实现大规模高精度乒乓球比赛重建,解决单目视频中遮挡和视角变化带来的重建难题,支持虚拟回放和机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15311 2026-05-05 cs.CV cs.ET 57%

A Comprehensive Review of Fish Feeding Behavior Analysis in Aquaculture: Tasks, Techniques, and Applications

水产养殖中鱼类摄食行为分析的全面综述:任务、技术与应用

Shulong Zhang, Daoliang Li, Jiayin Zhao, Mingyuan Yao, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(数字渔业国家创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock(水产动植物智能养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业用水高效利用国家重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了水产养殖中鱼类摄食行为分析的任务定义、技术支撑及应用现状,探讨了计算机视觉、声学、传感器及多模态融合技术的发展,分析了其在智能投喂和养殖管理中的应用价值及未来研究方向。

Comments 37 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 1 篇

2605.01245 2026-05-05 cs.HC cs.AI 57%

The Garden of Forking Paths: Narrative Arc-Conditioned Gameplay Planning

分叉花园:叙事弧条件下的游戏玩法规划

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

机构 * New York University(纽约大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Forking Garden框架,通过用户提供的故事情节生成分支游戏,采用弧引导约束算法构建 dungeon 图,实现游戏元素的多模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2510.05109 2026-05-05 cs.DC cs.AI cs.CL eess.SP 81%

Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices

小巧但强大:一种软件硬件协同设计方法,用于电池供电小型设备上的高效多模态推理

Yilong Li, Shuai Zhang, Yijing Zeng, Hao Zhang, Xinmiao Xiong, Jingyu Liu, Pan Hu, Suman Banerjee

机构 * University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Amazon Web Services AI(亚马逊网络服务人工智能) Uber(优步)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Nanomind框架,通过将多模态模型分解为模块化组件并分配到最佳计算单元,从而降低能耗并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01061 2026-05-05 cs.MM 79%

PRISM: Exposing and Resolving Spurious Isolation in Federated Multimodal Continual Learning

PRISM:揭示并解决联邦多模态持续学习中的虚假隔离

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出PRISM方法,通过维护专家梯度子空间基底和重新解释MoE路由,解决联邦多模态持续学习中路由隔离失效、遗忘积累和梯度冲突问题,实验表明其在多个数据集上优于现有基线。

Comments submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00973 2026-05-05 cs.LG cs.AI eess.SP 79%

Physiology-Aware Masked Cross-Modal Reconstruction for Biosignal Representation Learning

生理感知的跨模态掩码重建用于生物信号表示学习

Hao Zhou, Simon A. Lee, Cyrus Tanade, Keum San Chun, Juhyeon Lee, Migyeong Gwak, Megha Thukral, Justin Sung, Eugene Hwang, Mehrab Bin Morshed, Li Zhu, Viswam Nathan, Md Mahbubur Rahman, Subramaniam Venkatraman, Sharanya Arcot Desai

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Samsung Research America(三星美国研究院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出xMAE框架,通过跨模态掩码重建捕捉生物信号的时序关系,提升表示学习效果,在15/19下游任务中优于基线模型。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 79%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10320 2026-05-05 cs.CV eess.IV 79%

Boosting Multimodal Remote Sensing Image Classification with Transformer-based Heterogeneously Salient Graph Representation

通过基于变换器的异质显著图表示提升多模态遥感图像分类

Jiaqi Yang, Bo Du, Rong Liu, Zhu Mao, Liangpei Zhang

机构 * Department of Forest Sciences, University of Helsinki(赫尔辛基大学森林科学系) School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(武汉大学计算机学院、国家多媒体软件工程研究中心、人工智能研究院、湖北省多媒体与网络通信工程重点实验室,武汉,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于变换器的异质显著图表示方法,解决多模态遥感图像分类中特征表示不充分、长距离依赖建模复杂及过拟合问题,通过异质图编码器、多卷积调节器和均值前向策略提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00930 2026-05-05 q-bio.GN cs.AI 70%

CellxPert: Inference-Time MCMC Steering of a Multi-Omics Single-Cell Foundation Model for In-Silico Perturbation

CellxPert:一种多组学单细胞基础模型的推理时间MCMC引导方法用于计算机模拟扰动

Andac Demir, Erik W. Anderson, Jeremy L. Jenkins, Srayanta Mukherjee

机构 * Novartis Biomedical Research(诺华生物医学研究)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 CellxPert通过整合多组学数据,实现了对单细胞和空间多组学的统一表示,支持细胞类型注释、扰动响应预测和多组学整合,采用MCMC方法提升生物可解释性。

Journal ref ICLR Machine Learning for Genomics Explorations Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01365 2026-05-05 cs.CV cs.RO 57%

VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

VoxAfford:多尺度体素-标记融合用于开放词汇3D affordance检测

Haowen Sun, Shaolong Zhang, Mingyang Li, Chengzhong Ma, Xinzhe Chen, Qiongjie Cui, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家级实验室,人工智能与机器人研究所,西安交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VoxAfford,通过多尺度几何特征增强输出标记,提升3D affordance检测的定位精度,实验显示mIoU提升8%,并验证了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 57%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 57%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2511.21678 2026-05-05 cs.AI cs.LG 79%

Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

具有生长与细化多模态语义记忆的智能学习者

Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(AIML,阿德莱德大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ViLoMem框架,通过双流记忆系统整合视觉与逻辑知识,提升多模态任务表现,减少重复错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01198 2026-05-05 stat.CO stat.ME 78%

Modular Markov chain Monte Carlo with application to multimodal sampling

模块化马尔可夫链蒙特卡洛方法及其在多模采样中的应用

Joonha Park

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出模块化MCMC方法,通过并行构建约束于目标空间子集的马尔可夫链,结合加权估计以减少方差,应用于多模分布的采样,提升温控方法的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00187 2026-05-05 cs.HC cs.AI cs.ET 57%

Explainable AI for Blind and Low-Vision Users: Navigating Trust, Modality, and Interpretability in the Agentic Era

可解释AI用于盲人和低视力用户:在智能体时代导航信任、模态和可解释性

Abu Noman Md Sakib, Protik Dey, Zijie Zhang, Taslima Akter

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了盲人和低视力用户在智能体时代对可解释AI的独特需求,指出需多模态界面和责任意识设计以提升可解释性与信任度。

Comments Proceedings of the CHI 2026 Workshop on Human-Centered Explainable AI (HCXAI), April 13-17, 2026, Barcelona, Spain

Journal ref Proceedings of the CHI 2026 Workshop on Human-Centered Explainable AI (HCXAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01434 2026-05-05 cs.RO 50%

High-Speed, Scalable Sensor Readout for Dexterous Robotic Hands via Shift-Register Multiplexing

通过移位寄存器多路复用实现高吞吐量的可扩展传感器读取用于灵巧机械手

Jaehoon Kim, Lazaros Christoforidis, Michalis Papadakis, Victor Kartsch, Robert K. Katzschmann

机构 * Soft Robotics Lab, IRIS, D-MAVT, ETH Zurich(软机器人实验室,IRIS,D-MAVT,苏黎世联邦理工学院) Integrated Systems Laboratory, ETH Zurich(集成系统实验室,苏黎世联邦理工学院)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于串入并出移位寄存器原理的可扩展模拟传感器读取架构,支持异构模拟输出传感器的集成与扩展,实现高吞吐量的传感器数据采集,验证了其在机械手上的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏