arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 101 篇

2608.04430 2026-08-11 math.NA cs.NA stat.ML 版本更新 78%

An adaptive split-combine Gaussian mixture filter for nonlinear and multimodal state estimation

面向非线性与多模态状态估计的自适应拆分-合并高斯混合滤波器

San Kim, Won Chang, Daniel B. Forger, Dae Wook Kim

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文针对非线性多模态状态估计问题,提出自适应拆分-合并高斯混合滤波器(AMF),通过拆分合并高斯粒子实现高效准确的PDF估计,在多基准测试中性能优于基线滤波器,还提出了其并行实现方案。

Comments 60 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04136 2026-07-03 eess.SP 版本更新 78%

FLAME: A Federated Learning Approach for Multi-Modal RF Fingerprinting

FLAME:一种用于多模态射频指纹识别的联邦学习方法

Kasra Borazjani, Kiarash Kianfar, Seyyedali Hosseinalipour, Rajeev Sahay

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出FLAME框架,通过多模态表示(超越I/Q样本)加速联邦学习在射频指纹识别中的训练,理论证明收敛更快且精度更高,实验验证其优越性。

Comments 21 pages, 16 figures. Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29629 2026-07-01 cs.DC 版本更新 78%

Energy-Efficient Multimodal Inference Serving with Tri-serve

能效多模态推理服务:Tri-serve

Ziyang Jia, Sara Rashidi Golrouye, Laxmi Bhuyan, Benjamin Kubwimana, Devashree Tripathy, Zexin Li, Cong Liu, Daniel Wong

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态推理服务中GPU硬件频率管理导致的三种能效问题,提出软件DVFS控制器Tri-serve,联合优化依赖停顿、算术强度影响和热节流,实现22%能效提升且无延迟或吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-06-29 q-bio.QM 版本更新 78%

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw, Brendan Honick, Bill Shirey, Lisa Choy, Nikolay Akhmetov, Shaokun An, David Betancur, Dominic Bordelon, Karl Burke, Ivan Cao-Berg, John Conroy, Chris Csonka, Penny Cuda, Sean Donahue, Stephen Fisher, Derek Furst, Ed Hanna, Josef Hardi, Tabassum Kakar, Mark S. Keller, Devin Lange, Xiang Li, Yan Ma, Alison McWilliams, Austen Money, Richard Morgan, Eric Moerth, Juan Muerto, Mark A. Musen, Emily Nic, Martin J. O'Connor, Gesina Phillips, Alexander J. Ropelewski, Ryan Sablosky, Sravani Saripalli, Max Sibilla, Derek Simmel, Alan Simmons, Xu Tang, Joel Welling, Zhou Yuan, Martin Hemberg, HuBMAP Consortium, Matthew Ruffalo, Jonathan Silverstein, Philip Blood, Nils Gehlenborg

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 43 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 77%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 76%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28149 2026-07-17 cs.CV cs.AI 版本更新 73%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06094 2026-08-11 cs.LG 版本更新 71%

Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems

你所需要的只是对正常情况建模:多模态网络物理系统中异常检测的联合潜在聚类

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology (HIT)(霍隆技术学院) Afeka Academic College of Engineering(阿法卡工程学院)

专题命中 其他多模态 :multimodal(title)

AI总结 研究多模态网络物理系统异常检测,提出联合潜在聚类方法,通过MIIM假设集、公平协议及潜在评分建模正常行为,在三个真实数据集上表现优异,优于其他深度检测器。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20206 2026-08-05 cs.CV 版本更新 70%

Toward Visual Grounding: A Survey

视觉定位:一项综述

Linhui Xiao, Xiaoshan Yang, Xiangyuan Lan, Yaowei Wang, Changsheng Xu

专题命中 其他多模态 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本综述梳理视觉定位的发展与背景,总结近年进展与新挑战,定义规范研究设置,介绍相关数据集与应用,提出未来方向,是该领域最全面的综述,适合不同阶段研究者。

Comments Accepted by TPAMI 2025. We keep tracing related works at https://github.com/linhuixiao/Awesome-Visual-Grounding, article publication page: https://ieeexplore.ieee.org/abstract/document/11235566

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 3, pp. 2749-2771, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新 70%

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23960 2026-08-17 physics.optics 版本更新 67%

Single-Shot Realization of 10000-Mode Octave-Spanning Artificial Gauge Fields

单次实现10000模式倍频程跨度人工规范场

Lida Xu, Apurva Padhye, Supratik Sarkar, Alireza Parhizkar, Christopher J. Flower, Gregory Moille, Kartik Srinivasan, Mohammad Hafezi, Mahmoud Jalali Mehrabad

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 提出超宽带多模态色散校正人工规范场理论框架,利用集成光子学实现首个光子整数量子霍尔模型的频率梳,覆盖超过10000个模式,通过克尔非线性实现单次控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16639 2026-08-03 cs.LG 版本更新 67%

SPICE: Synergy and Partial Information Based Curriculum Evolution

SPICE: 基于协同与部分信息的课程演化

Ankush Pratap Singh, Houwei Cao, Yong Liu

机构 * New York Institute of Technology(纽约理工学院) New York University(纽约大学)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出SPICE框架,利用部分信息分解理论动态量化样本复杂度,设计渐进式课程使模型从学习共享跨模态线索过渡到模态特定模式再到复杂协同交互,在多个多模态基准上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 67%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21788 2026-06-09 cs.DC cs.LG 版本更新 67%

Efficient Scaling of LLM Training with Flexible Context Parallelism

利用灵活上下文并行实现LLM训练的高效扩展

Yifan Niu, Han Xiao, Dongyi Liu, Wei Zhou, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他多模态 :MLLM(abstract,abstract_cn)

AI总结 针对数据异构导致负载不均和通信冗余问题,提出自适应重配置通信组和上下文并行度的FCP策略,实现近线性加速比,最高达1.46倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09935 2026-08-04 cs.CL cs.AI 版本更新 62%

Unpacking Hateful Memes: Presupposed Context and False Claims

解析仇恨表情包:预设语境与虚假主张

Weibin Cai, Jiayu Li, Reza Zafarani

机构 * Syracuse University(Syracuse大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。

Comments Accepted to SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 62%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14761 2026-07-08 cs.LG cs.AI cs.CV 版本更新 62%

Universal Algorithm-Implicit Learning

通用算法隐式学习

Stefano Woerner, Seong Joon Oh, Christian F. Baumgartner

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19125 2026-08-11 cs.LG cs.AI 版本更新 57%

Transformer Circuits Can Realize Clustering Algorithms

Transformer电路可实现聚类算法

Kenneth L. Clarkson, Lior Horesh, Takuya Ito, Charlotte Park, Parikshit Ram

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究表明Transformer电路可实现Lloyd算法等精确聚类算法,提出的k均值Transformer聚类算法泛化性强且质量优于Lloyd算法,改动后可衍生多种新型聚类算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 57%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00177 2026-08-03 cs.GR cs.CV 版本更新 57%

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13174 2026-07-31 eess.IV cs.CV cs.LG 版本更新 57%

Scalable Drift Monitoring in Medical Imaging AI

医学影像AI中的可扩展漂移监测

Jameson Merkow, Felix J. Dorfner, Xiyu Yang, Alexander Ersoy, Giridhar Dasegowda, Mannudeep Kalra, Matthew P. Lungren, Christopher P. Bridge, Ivan Tarapov

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究针对医学影像AI的模型漂移与可靠性问题,开发了基于CheXstray框架的增强型可扩展漂移监测框架MMC+,经真实世界数据验证可有效检测数据偏移并预警性能偏差,助力AI在临床场景的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22052 2026-07-10 cs.AI cs.LG 版本更新 57%

A Vision Toward Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents

迈向节能领域特定人工智能模型和智能体的愿景

Abhijit Chatterjee, Niraj K. Jha, Jonathan D. Cohen, Thomas L. Griffiths, Hongjing Lu, Diana Marculescu, Ashiqur Rasul, Wenrui Xu, Keshab K. Parhi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究提出下一代人工智能应是轻量级领域特定多模态模型,能在动态环境中推理决策并持续进化。核心方法是重新设计硬件提升能源效率。主要贡献是为未来人工智能系统发展提供新愿景,推动从大数据训练的大模型向节能领域特定智能体转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 57%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03955 2026-07-07 cs.LG cs.AI 版本更新 57%

GIPO: Gaussian Importance Sampling Policy Optimization

GIPO:高斯重要性采样策略优化

Chengxuan Lu, Zhenquan Zhang, Shukuan Wang, Qunzhi Lin, Baigui Sun, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19013 2026-07-03 cs.CV 版本更新 57%

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI:具有遮挡意识的通用手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee

机构 * Hunan University(湖南大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学) University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17415 2026-07-01 eess.IV cs.CV cs.LG 版本更新 57%

Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration

Structured SIR: 高效且富有表现力的重要性加权推断用于高维图像配准

Ivor J. A. Simpson, Neill D. F. Campbell

机构 * University of Sussex(萨塞克斯大学) University College London(伦敦大学学院) University of Bath(巴斯大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出Structured SIR方法,结合采样重要性重采样与低秩加稀疏Cholesky精度因子的协方差参数化,实现高维3D图像配准中高效且多模态的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 57%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏