arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-07 至 2026-08-07 共收录 91 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 84%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03571 2026-08-07 cs.CV 版本更新 79%

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

超越单纯的环境规模扩展:为多模态智能体学习设计有效的环境分布

Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao, Kang Liu, Jun Zhao

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态智能体学习中单纯扩展环境数量无效的问题,提出AES与HDC两种方法优化环境分布,提升了智能体训练效果。

Comments Code: https://github.com/GaryStack/Beyond-MMEnv-Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05966 2026-08-07 cs.HC 新提交 78%

A Modular Workflow for Multimodal Reading Experiments

多模态阅读实验的模块化工作流程

Thomas Krämer, Thomas Kosch, Dagmar Kern, Daniel Hienert

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究提出一种基于网络的模块化工作流程,整合眼动、EEG等多模态数据,可适配不同实验设置,用于在线阅读的多模态研究,支持生态情境下的实证验证。

Comments In Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03327 2026-08-07 cs.AI 版本更新 74%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06270 2026-08-07 cs.AI 新提交 70%

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 57%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 57%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 21 篇

2608.05909 2026-08-07 cs.CR 新提交 87%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05997 2026-08-07 cs.CV cs.AI 版本更新 86%

MM-ISTS: Cooperating Irregularly Sampled Time Series Forecasting with Multimodal Vision-Text LLMs

MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测

Zhi Lei, Chenxi Liu, Hao Miao, Wanghui Qiu, Bin Yang, Chenjuan Guo

机构 * East China Normal University Shanghai China Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China Department of Computing, The Hong Kong Polytechnic University Hong Kong China East China Normal University Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Department of Computing, The Hong Kong Polytechnic University

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05967 2026-08-07 cs.MM 新提交 85%

M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝

Taolin Zhang, Weizi shao, Zijie Zhou, Chen Chen, Daiyang Yu, Tingyuan Hu, Chengyu Wang, Xiaofeng He

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.MM

AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 81%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05608 2026-08-07 cs.LG cs.AI 新提交 79%

GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification

GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控

Yunping Shi, En Yu, Kairui Guo, Jie Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对不完整多模态分类问题,提出轻量型GAUGE框架,通过细粒度反事实证据门控实现更优性能,为模态不完整下的证据控制提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05131 2026-08-07 cs.CV cs.AI 版本更新 79%

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

OPD-V:结合模态平衡的视觉在线策略自蒸馏

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。

Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05647 2026-08-07 cs.RO 新提交 78%

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

KILVO:面向人形机器人的具备鲁棒多模态自适应的运动学-惯性-激光雷达-视觉里程计

Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出面向人形机器人的KILVO里程计,基于ESIKF整合多传感器并设计多模态自适应与接触估计模块,实验显示其精度、效率及鲁棒性优于现有方法,代码与数据集已开源。

Comments This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11981 2026-08-07 math.NA cs.NA eess.SP 版本更新 78%

RJD-BASE: Multi-Modal Spectral Clustering via Randomized Joint Diagonalization

RJD-BASE:基于随机联合对角化的多模态谱聚类

Haoze He, Artemis Pados, Daniel Kressner

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出RJD-BASE方法,通过随机凸组合拉普拉斯矩阵结合BASE选择规则实现多模态谱聚类,在低计算成本下优于经典多模态聚类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05683 2026-08-07 cs.CV cs.AI cs.MM 新提交 75%

DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

DistMedVL:面向不确定性感知医学图像分割的分布视觉-语言对齐方法

Jiaxuan Li, Qing Xu, Xiangjian He, Yue Li, Daokun Zhang, Fiseha B. Tesema, Rong Qu

机构 * University of Nottingham Ningbo China(宁波诺丁汉大学) University of Nottingham(诺丁汉大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对医学图像分割中视觉-语言跨模态对齐的不确定性问题,提出DistMedVL概率框架,含PCM-Adapter等模块,在8个基准上以6.3M参数实现优于SOTA的性能,数据效率等更优。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14243 2026-08-07 cs.CV 版本更新 74%

Multi-Representation Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition

多表示几何层次融合:一种用于鲁棒三维地点识别的隐式子图驱动框架

Xiaohui Jiang, Haijiang Zhu, Chade Li, Ning An

机构 * College of Information and Technology, Beijing University of Chemical Technology(信息与技术学院,北京化工大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Research Institute of Mine Artificial Intelligence, China Coal Research Institute(矿山人工智能研究院,中国煤炭科研院)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 针对激光雷达地点识别中描述子不稳定与表示脆弱性问题,本文提出隐式神经点驱动的多表示几何层次融合框架,在多数据集上实现鲁棒性能,平衡了精度、效率与内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06146 2026-08-07 cs.AI 新提交 70%

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

PaDoc:基于布局的文档并行解码方法

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05671 2026-08-07 cs.CV 新提交 70%

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation

URNet:用于高效RGB-D语义分割的统一重参数化网络

Guoan Xu, Zhengxue Wang, Yang Xiao, Ligeng Chen, Guangwei Gao, Dongchen Zhu

机构 * University of Technology Sydney(悉尼科技大学) Nanjing University of Science and Technology(南京理工大学) Honor Device Co., Ltd.(荣耀终端有限公司) Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新 70%

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06205 2026-08-07 cs.CV 新提交 57%

CFGPNet: Cross-Attention-Based Fused Gradient Programmed Network Framework for Multispectral Object Detection

CFGPNet:用于多光谱目标检测的基于交叉注意力的融合梯度编程网络框架

Nima Hatami, Karim Faez, Saeed Sharifian, Hamidreza Amindavar

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有RGB-T目标检测方法的跨模态交互不足等问题,提出CFGPNet框架,采用改进GELAN骨干、CrossCEA模块等设计,在五个多光谱基准数据集上取得优异性能,实现精度与效率的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05843 2026-08-07 cs.CV 新提交 57%

Overcoming Attention Drift: Homogeneity-Heterogeneity Guided Feature Aggregation for Low-Light Remote Sensing Image Enhancement

克服注意力漂移:面向低光照遥感图像增强的同质性-异质性引导特征聚合

Yaozi Zhong, Xingxing Yang, Shaohui Mei, Mingyang Ma

机构 * School of Information and Artificial Intelligence, Yunnan University of Finance and Economics(云南财经大学信息与人工智能学院) Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系) School of Electronics and Information, Northwestern Polytechnical University(西北工业大学电子信息学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对低光照遥感图像增强中现有方法的注意力漂移问题,提出双先验驱动的HALO框架,通过H2CAM模块融合同质性与异质性先验,在8个基准上实现SOTA性能,提升边界清晰度与色彩保真度。

Comments 10 pages, 7 figures, 7 tables. Yaozi Zhong and Xingxing Yang contributed equally. Code: https://github.com/AlexYangxx/HALO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05258 2026-08-07 cs.CV 新提交 57%

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

用于视觉Transformer的Grad-CAM:可解释AI中方法歧义的系统分类与审计

Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

机构 * University of South Dakota(南达科他大学) USD Artificial Intelligence Research(南达科他大学人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文对175篇应用Grad-CAM于视觉Transformer(ViT)的论文开展审计,提出ViT Grad-CAM适配的系统分类,指出其常被误为CNN版Grad-CAM的简单扩展,存在方法选择未明确的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05896 2026-08-07 cs.AI cs.IT math.IT 新提交 57%

GSBF: Gaussian Splatting for Environment-Aware Beamforming

GSBF:面向环境感知波束成形的高斯溅射

Yijie Bian, Wei Guo, Zixin Wang, Shenghui Song, Jun Zhang, Khaled B. Letaief

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新 57%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 50%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 50%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05595 2026-08-07 quant-ph cs.DC cs.LG 新提交 50%

How Much Reconstruction Does Quantum Machine Learning Need? Late Fusion of Independently Trained Quantum Subcircuits

量子机器学习需要多少重构?独立训练量子子电路的后期融合

Prabhjot Singh, Adel N. Toosi, Rajkumar Buyya

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对电路切割量子机器学习中重构成本过高的问题,提出后期融合方法,其准确率与完全重构差距极小但成本指数级降低,且鲁棒性更强,是重构的高效替代方案。

Comments 11 pages, 6 figures. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 3 篇

2608.05684 2026-08-07 cs.RO cs.AI cs.LG cs.SY eess.SY 新提交 57%

Nonvisual Classification of Ground-Condition by Artificial Proprioception in an Amoeba-Inspired Autonomous Walking Robot

变形虫启发的自主步行机器人中基于人工本体感觉的地面状况非视觉分类

Hyoto Yamaguchi, Zenji Yatabe, Seiya Kasai

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究为变形虫启发的自主步行机器人,整合传感器与储备池计算实现人工本体感觉,完成地面状况非视觉分类,可依地面切换步态并分析传感器贡献。

Comments 5 pages, 7 figures, The paper has been submitted to IEEE SCIS ISIS 2026 for consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05454 2026-08-07 cs.LG stat.ML 新提交 50%

Hybrid Probabilistic Zonotopes for Identifiable and Refinable Predictive Uncertainty

用于可识别和可细化预测不确定性的混合概率 zonotope

Zhen Zhang, Amr Alanwar

专题命中 其他多模态 :multi-modal(abstract)

AI总结 该研究提出混合概率 zonotope(HProbZ)作为神经网络预测头,分离三种不确定性来源,可细化多步预测分布,具备独特结构特性,在基准测试中优于同编码器混合基线。

详情

展开后加载摘要…

URL PDF HTML 收藏