arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 106 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 19 篇

2606.03995 2026-06-04 cs.LG cs.AI q-bio.QM 57%

Early Detection of Alzheimer's Disease Using Explainable Machine Learning on Clinical Biomarkers: A Multi-Class Classification Study Using the Alzheimer's Disease Neuroimaging Initiative (ADNI) Dataset

使用可解释机器学习基于临床生物标志物早期检测阿尔茨海默病:基于阿尔茨海默病神经影像学倡议(ADNI)数据集的多分类研究

Afshan Hashmi

机构 * TRDC, Tuwaiq Academy(TRDC,图瓦伊克学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究使用XGBoost分类器,基于ADNI数据集的8个临床特征(MMSE、CDR Global、CDR-SB、MoCA、FAQ、年龄、性别、教育程度)进行三分类(正常认知、轻度认知障碍、阿尔茨海默病)检测,通过SMOTE处理类别不平衡,Optuna优化超参数,SHAP提供可解释性,在测试集上达到macro AUC 0.982、准确率0.943,并揭示了临床合理的特征重要性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.05468 2026-06-04 math.NA cs.NA 50%

Digital Cultural Heritage imaging via osmosis filtering

通过渗透过滤进行数字文化遗址成像

Simone Parisotto, Luca Calatroni, Claudia Daffara

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出利用渗透过滤模型解决文化遗址成像中因不同光谱区域数据获取导致的强度不均匀问题,通过多模态成像整合信息,提升文物修复的物理特性辨识能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 10 篇

2605.29456 2026-06-04 cs.SE cs.HC 85%

Usability Analysis of Configurator User Interfaces with Multimodal Large Language Models

配置器用户界面的可用性分析:基于多模态大语言模型

Sebastian Lubos, Alexander Felfernig, Damian Garber, Adnan Kraljić, Tarik Kraljić, Viet-Man Le, Thi Ngoc Trang Tran, Gerhard Leitner, Julian Schwazer, Doris Suppan, Reinhard Willfort, Ivan Dukic, Jeremias Fuchs, Manuel Henrich

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文通过合成18个配置器特定可用性标准,利用多模态大语言模型对16个实际配置器进行半自动化可用性分析,验证了MLLMs能可靠识别问题并提供领域感知改进建议。

Comments Accepted for publication at the International Conference on Software and Systems Reuse, Product Lines, and Configuration (VARIABILITY 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL 84%

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29861 2026-06-04 cs.CL cs.AI 84%

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.08830 2026-06-04 eess.SY cs.CR cs.LG cs.SY 78%

Catching Anomalous Distributed Photovoltaics: An Edge-based Multi-modal Anomaly Detection

捕捉异常分布式光伏:基于边缘的多模态异常检测

Devu Manikantan Shilay, Kin Gwn Lorey, Tianshu Weiz, Teems Lovetty, Yu Cheng

机构 * University of California, Riverside, California, 92507(加州大学河滨分校) Illinois Institute of Technology, Chicago, Illinois 60616(伊利诺伊理工学院)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于边缘的多模态异常检测方法,用于识别分布式光伏等设备的异常行为,通过融合多源时间序列数据,提升对电网安全的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-06-04 cs.LG cs.AI cs.CV cs.RO cs.SY eess.SY 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01961 2026-06-04 cs.AI 57%

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

AutoMedBench: 迈向基于智能体AI模型的医学自动研究

Junqi Liu, Selena Song, Yuhan Wang, Jiawei Mao, Hardy Chen, Xiaoke Huang, Tianhao Qi, Pengfei Guo, Yucheng Tang, Yufan He, Can Zhao, Andriy Myronenko, Dong Yang, Daguang Xu, Yuyin Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04799 2026-06-04 cs.SE 50%

UModel: An Agent-Ready Observability Data Modeling Method at Scale

UModel: 一种面向智能体的可观测性数据规模化建模方法

Changhua Pei, Zheyuan Li, Zexin Wang, Hang Cui, Xiaohui Nie, Qi Zhou, Fang Situ, Cheng Zhang, Xin Zhang, Xidao Wen, Gaogang Xie, Jingjing Li, Dan Pei

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对现有可观测性框架数据孤岛、模式不兼容及语义元数据不足导致根因分析困难的问题,提出UModel统一本体框架,通过对象中心化建模和语义图连接异构数据,并引入U-SPL管道查询接口,使智能体自主探索系统拓扑并关联多模态数据,在AIOps 2025挑战赛数据集上根因定位精度提升8%,已在阿里云部署超一年,服务数万用户,支撑每秒数百万操作和亚秒级查询延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 50%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.03641 2026-06-04 math.OC cs.SY eess.SY 50%

Role of Iso-connectivity Topologies in Multi-agent Interactions

等连通拓扑在多智能体交互中的作用

Rajdeep Dutta, Daniel Pack

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了等连通拓扑在多智能体系统动态中的作用,通过分析不同拓扑结构对信息共享能力的影响,提出了解决多智能体图结构确定问题的方法。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.04634 2026-06-04 cs.RO cs.SY eess.SY 50%

Motion Planning for Global Localization in Non-Gaussian Belief Spaces

非高斯信念空间中的全局定位运动规划

Saurav Agarwal, Amirhossein Tamjidi, Suman Chakravorty

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种在不确定环境下进行运动规划的方法,用于处理模糊数据关联导致的多模态假设。通过递推方法逐步消除多模态信念,实现有限时间内精确定位。

Comments extends previous submission with updated figures, analysis and justifications. arXiv admin note: text overlap with arXiv:1506.01780

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 13 篇

2606.04719 2026-06-04 cs.CL 88%

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

基于查询的跨模态投影器增强Mamba多模态大语言模型

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) Korea University / Korea, Republic of(韩国大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04448 2026-06-04 cs.IR 85%

Bridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning

连接短视频与直播:推理引导的多模态大语言模型用于跨域表示学习

Le Zhang, Xiaolan Zhu, Yuchen Wang, Shilong Kang, Jiaqi Xue, Xiaoyu Zhang, Xiang Chen, Yalong Guan, Xiangyu Wu, Shijun Wang, Lantao Hu, Kun Gai

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 针对短视频到直播的跨域推荐冷启动问题,提出推理引导的跨域表示学习框架RGCD-Rep,利用多模态大语言模型生成结构化推理知识并蒸馏到轻量模型,通过两阶段训练学习可迁移的物品表示,在快手部署后显著提升核心业务指标。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04434 2026-06-04 cs.CV cs.LG 83%

Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

Hyper-ICL:基于双曲锚点蒸馏的注意力校准用于多模态上下文学习

Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh Afghah

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出Hyper-ICL,一种轻量级训练框架,通过低秩logit适配器和双曲锚点蒸馏损失校准注意力分布,无需推理时提供上下文示例即可重建演示效果,提升多模态上下文学习的准确性和稳定性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02576 2026-06-04 cs.CV cs.LG 83%

ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

ProtoAda: 原型引导的自适应适配器扩展与几何整合用于多模态持续指令微调

Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出ProtoAda框架,通过格式感知任务原型和几何感知参数整合,解决多模态持续指令微调中任务路由错误和梯度干扰问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.06040 2026-06-04 stat.ME cs.NA math.NA stat.AP stat.ML 78%

Tensor Analysis and Fusion of Multimodal Brain Images

张量分析与多模态脑图像融合

Esin Karahan, Pedro A. Rojas-Lopez, Maria L. Bringas-Vega, Pedro A. Valdes-Hernandez, Pedro A. Valdes-Sosa

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用张量结构分析多模态神经影像数据,引入马尔可夫-彭罗斯图进行建模,首次将Granger因果分析视为张量回归问题,展示其在脑网络分解中的潜力。

Comments 23 pages, 15 figures, submitted to Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03564 2026-06-04 cs.CV cs.AI 73%

CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

CR-Seg:注意力引导与CoT增强的由粗到精推理分割

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05109 2026-06-04 cs.LG 67%

RePercENT: Scaling Disentangled Representation Learning Beyond Two Modalities

RePercENT:将解耦表示学习扩展到两种模态之外

Vasiliki Rizou, Pascal Frossard, Dorina Thanou

机构 * EPFL(瑞士联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 提出RePercENT框架,通过多模态即插即用架构和联合优化目标,实现超过两种模态的可扩展成对解耦,无需联合预训练并降低计算复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19758 2026-06-04 cs.CV cs.AI cs.LG 62%

LaVIDE: Language-Prompted Satellite Change Detection via Map-Image Alignment

LaVIDE: 通过地图-图像对齐的语言提示卫星变化检测

Shuguo Jiang, Fang Xu, Chuandong Liu, Hong Tan, Shengyang Li, Lei Yu, Wen Yang, Sen Jia, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Technology and Engineering Center for Space Utilization and the Key Laboratory of Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与重点实验室) School of Aeronautics and Astronautics, University of Chinese Academy of Sciences(中国科学院大学航空宇航学院) School of Electronic Information, Wuhan University(武汉大学电子信息学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出LaVIDE框架,利用受限提示学习和对象感知嵌入增强,通过语言弥合高层地图类别与低层图像细节之间的语义鸿沟,实现跨模态对齐,在多类与单类变化检测任务上分别提升IoU 18.4%和5.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03937 2026-06-04 cs.AI 57%

Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

熵是不够的:通过视觉锚定令牌选择解锁视觉推理的有效强化学习

Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对视觉推理中基于熵的信用分配机制失效问题,提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合实现梯度信用重定向,显著提升多模态强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04209 2026-06-04 cs.LG 50%

A Geometric View of Counterfactual Behavior: Interaction of Boundary Proximity and Local Support

反事实行为的几何视角:边界接近度与局部支持的交互作用

Ioanna Gemou, Matteo Gamba, Randall Balestriero, Ritambhara Singh

机构 * Brown University(布朗大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文通过几何视角研究反事实行为,发现决策边界接近度与局部数据支持的交互作用决定了反事实的可行性,且反事实行为是独立于预测性能的维度,可在不改变准确率的情况下被改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04180 2026-06-04 cs.LG cs.IT math.IT 50%

KODA: Contrastive Representation Comparison and Alignment for Vision-Language Foundation Models

KODA: 视觉-语言基础模型的对比表示比较与对齐

Youqi Wu, Mohammad Jalali, Farzan Farnia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出KODA框架,通过核优化方法对比分析视觉-语言基础模型的表示差异,并识别弱聚类与强聚类的样本子集,实现表示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.03199 2026-06-04 q-bio.QM cs.SY eess.SY q-bio.NC 50%

From sample to knowledge: Towards an integrated approach for neuroscience discovery

从样本到知识:面向神经科学发现的综合方法

William Gray Roncal, Eva L Dyer, Doga Gürsoy, Konrad Kording, Narayanan Kasthuri

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出从样本到知识的整合方法,旨在通过反馈循环优化神经科学数据采集与处理流程,提升知识提取效率。

Comments first two authors contributed equally. 8 pages, 2 figures. v2: added acknowledgments

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.07603 2026-06-04 eess.SY cs.SY 50%

Analytic MMSE Bounds in Linear Dynamic Systems with Gaussian Mixture Noise Statistics

线性动态系统中高斯混合噪声统计的解析MMSE界限

Leila Pishdad, Fabrice Labeau

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文研究线性动态系统在高斯混合噪声下的MMSE估计,提出解析上界和下界,通过高斯混合分布形状选择紧致上界,并验证在高多模噪声下MMSE收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 21 篇

1904.10379 2026-06-04 cs.GR cs.CV cs.NA math.NA 79%

Multi-modal 3D Shape Reconstruction Under Calibration Uncertainty using Parametric Level Set Methods

在校准不确定性下利用参数水平集方法进行多模态3D形状重建

Moshe Eliasof, Andrei Sharf, Eran Treister

机构 * Computer Science Department, Ben-Gurion University of the Negev(本古里安大学计算机科学系)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种参数化水平集方法,用于在存在校准不确定性时从多模态数据中重建3D形状,该方法能够有效处理不同数据模态,如稀疏点集、体素切片、2D照片等,并在复杂对象的紧凑表示和校准噪声鲁棒性方面取得了显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12581 2026-06-04 cs.LG 78%

LMM-IR: Large-Scale Netlist-Aware Multimodal Framework for Static IR-Drop Prediction

LMM-IR:面向静态IR压降预测的大规模网表感知多模态框架

Kai Ma, Zhen Wang, Hongquan He, Qi Xu, Tinghuan Chen, Hao Geng

机构 * Tsinghua University(清华大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种基于大规模网表变换器和3D点云表示的多模态框架,用于快速准确地预测芯片静态IR压降,在ICCAD 2023竞赛中取得最佳F1分数和最低MAE。

Comments Accepted by DAC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.3267 2026-06-04 math.NA cs.NA 78%

Reconstruction of Multimodal Distributions for Hybrid Moment-based Chemical Kinetics, Supporting Information

多模态分布的重构用于混合矩基化学动力学,补充信息

Alexander Andreychenko, Linar Mikeev, Verena Wolf

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文比较了两种矩基分析方法(矩法和条件矩法)在重构多模态分布时的性能,发现条件矩法更适用于描述多模态分布并提高重构精度。

Comments 10 pages, 5 figures, supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.0077 2026-06-04 eess.SY cs.SY 78%

Multi-modal filtering for non-linear estimation

多模态过滤用于非线性估计

Sanket Kamthe, Jan Peters, Marc P Deisenroth

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出一种非线性滤波算法,利用高斯混合模型表示多模态密度,通过闭式估计参数提升时间序列和实际应用中的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04648 2026-06-04 cs.AI 57%

BiNSGPS: Geometry Problem Solving via Bidirectional Neuro-Symbolic Interaction

BiNSGPS: 通过双向神经符号交互解决几何问题

Qi Wang, Peijie Wang, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 其他多模态 :MLLM(abstract);分类 cs.AI

AI总结 提出BiNSGPS框架,通过多模态大语言模型顾问与符号求解器之间的双向神经符号交互,动态纠正不一致的形式表示或提出辅助假设,以解决几何问题中的早期错误和符号冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏