arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4882 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4882 篇

2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 57%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10068 2026-07-14 cs.LG cs.CV cs.GR 新提交 57%

Error Aware Distribution Prediction for Lightweight Implicit Neural Representations

轻量级隐式神经表示的误差感知分布预测

Zhimin Li, Jake D. Balla, Joshua A. Levine

机构 * Vanderbilt University(范德堡大学) University of Arizona(亚利桑那大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对隐式神经表示的预测误差问题,提出轻量级方法,将基于回归的INR训练转为分类任务,通过离散连续目标为bins实现灵活分布建模,经分析权衡表明该方法能通过不确定性估计获高重建质量和误差感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22052 2026-07-10 cs.AI cs.LG 版本更新 57%

A Vision Toward Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents

迈向节能领域特定人工智能模型和智能体的愿景

Abhijit Chatterjee, Niraj K. Jha, Jonathan D. Cohen, Thomas L. Griffiths, Hongjing Lu, Diana Marculescu, Ashiqur Rasul, Wenrui Xu, Keshab K. Parhi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究提出下一代人工智能应是轻量级领域特定多模态模型,能在动态环境中推理决策并持续进化。核心方法是重新设计硬件提升能源效率。主要贡献是为未来人工智能系统发展提供新愿景,推动从大数据训练的大模型向节能领域特定智能体转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 57%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06531 2026-07-08 cs.AI cs.LG 新提交 57%

The Large Cancer Assistant (LCA): A Model-Agnostic Orchestration Framework for Scalable Clinical Decision Support in Oncology

大型癌症助手(LCA):用于肿瘤学中可扩展临床决策支持的模型无关编排框架

Ghassen Marrakchi, Basarab Matei

机构 * Ghassen MARRAKCHI(独立研究者) Basarab MATEI(独立研究者)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对肿瘤学多模态深度学习模型设计局限,提出模型无关的LCA编排框架。利用算法不可渗透原则等方法,经概念验证验证其编排逻辑、算法不可渗透性等,为临床决策支持提供高度适应性基础,利于电子病历互操作性。

Comments 22 pages, 6 figures, 8 tables, 9 appendices, 14 references, Elsevier JBI format

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05911 2026-07-08 cs.CV 新提交 57%

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

基于原始校正的渐进推理用于组合零样本学习

Ziyi Chen, Haoyan Shi, Sunhan Xu, Congyan Lang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract);分类 cs.CV

AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03955 2026-07-07 cs.LG cs.AI 版本更新 57%

GIPO: Gaussian Importance Sampling Policy Optimization

GIPO:高斯重要性采样策略优化

Chengxuan Lu, Zhenquan Zhang, Shukuan Wang, Qunzhi Lin, Baigui Sun, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19013 2026-07-03 cs.CV 版本更新 57%

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI:具有遮挡意识的通用手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee

机构 * Hunan University(湖南大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学) University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00272 2026-07-02 cs.RO cs.AI cs.MA 新提交 57%

ASPIRE: Agentic /Skills Discovery for Robotics

ASPIRE: 面向机器人的智能体技能发现

Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

机构 * NVIDIA(英伟达) UMich(密歇根大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。

Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15874 2026-07-02 cs.CV 57%

ENSAM: an efficient foundation model for interactive segmentation of 3D medical images

ENSAM:一种高效的交互式3D医学图像分割基础模型

Elias Stenhede, Agnar Martin Bjørnstad, Arian Ranjbar

机构 * Akershus University Hospital(阿克什胡斯大学医院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 ENSAM结合SegResNet编码器、提示编码器和掩码解码器,通过潜在交叉注意力、相对位置编码等技术,在有限数据和算力下实现高效3D医学图像分割,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17415 2026-07-01 eess.IV cs.CV cs.LG 版本更新 57%

Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration

Structured SIR: 高效且富有表现力的重要性加权推断用于高维图像配准

Ivor J. A. Simpson, Neill D. F. Campbell

机构 * University of Sussex(萨塞克斯大学) University College London(伦敦大学学院) University of Bath(巴斯大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出Structured SIR方法,结合采样重要性重采样与低秩加稀疏Cholesky精度因子的协方差参数化,实现高维3D图像配准中高效且多模态的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27575 2026-06-29 cs.CV 新提交 57%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27381 2026-06-29 cs.LG cs.AI 新提交 57%

OverFlowLight: Real-Time Gridlock Prevention and Traffic Signal Optimization for Urban Intersections

OverFlowLight:城市交叉口实时防锁死与交通信号优化

Mingyuan Li, Boyang Huang, Tianqi Jiang, Chenpu Li, Chunyu Liu, Yang Li, Ruimin Li, Qiang Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Beijing Xiaocheng Intelligent Computing(北京小城智能计算) Tsinghua University(清华大学) Lanzhou University(兰州大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 针对城市交通中队列溢出导致级联锁死的问题,提出OverFlowLight框架,利用多模态传感实时检测溢出并动态插入专用相位,结合规则与强化学习混合控制,实际部署43个路口减少60.4%溢出事件并提升18.2%网络吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 57%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20239 2026-06-29 cs.RO cs.CV 版本更新 57%

Rheos: Modelling Continuous Motion Dynamics in Hierarchical 3D Scene Graphs

Rheos: 分层3D场景图中的连续运动动态建模

Iacopo Catalano, Francesco Verdoja, Javier Civera, Jorge Peña-Queralta, Julio A. Placed

机构 * University of Turku(图尔库大学) Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心) Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学) University of Zaragoza(萨拉戈萨大学) School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Rheos框架,将连续方向运动模型嵌入分层3D场景图的动态层,通过半包裹高斯混合模型捕获多模态方向流,并采用水库采样和贝叶斯信息准则实现在线操作,优于离散基线方法。

Comments Accepted at IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26485 2026-06-26 cs.CL cs.DL cs.HC cs.IR 新提交 57%

Utilizing Cognitive Signals Generated during Human Reading to Enhance Keyphrase Extraction from Microblogs

利用人类阅读过程中产生的认知信号增强微博关键词抽取

Xinyi Yan, Yingyi Zhang, Chengzhi Zhang

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究利用脑电图(EEG)和眼动追踪信号增强微博关键词抽取(AKE),发现EEG特征带来最大性能提升,两种信号部分互补但存在冗余。

Journal ref IPM, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23771 2026-06-24 eess.SP cs.AI 新提交 57%

Integrated Sensing and Communications for Real-time Avatar Control in XR over 5G

面向5G上XR中实时化身控制的集成感知与通信

Nabeel Nisar Bhat, Javad Sameri, Rreze Halili, Rafael Berkvens, Maria Torres Vega, Jeroen Famaey

机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) IDLab, Ghent University - imec(ID实验室,根特大学 - imec) Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25322 2026-06-24 cs.CV 版本更新 57%

Quantifying mandibular positioning error and simulated temporomandibular joint-space changes in patient-specific occlusal splints

咬合定位夹板对颞下颌关节状况定量影响的评估

Agnieszka Anna Tomaka, Krzysztof Domino, Michał Tarnawski, Dariusz Pojda

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种利用咬合定位夹板分析颞下颌关节配置的计算方法,通过多模态数据建模夹板作为下颌的刚体变换,评估定位精度并模拟关节空间变化。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22101 2026-06-23 cs.LG cs.CV 新提交 57%

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

OphthaDT:用于眼科视力轨迹预测的生成式数字孪生

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20609 2026-06-23 cs.CY cs.AI 新提交 57%

Understanding Privacy by Formalizing It

通过形式化理解隐私

Réka Markovich, Truls Pedersen, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文使用多模态逻辑形式化不同隐私理论及其原则,探讨作为认知权利的隐私权在规范位置理论中的含义。

Comments Published in Proceedings of the 17th International Conference on Juris-informatics, JURISIN 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.06836 2026-06-23 cs.CV 57%

Using Deep Convolutional Networks for Gesture Recognition in American Sign Language

使用深度卷积网络进行美国手语手势识别

Vivek Bheda, Nelu Radpour

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用深度卷积网络对美国手语中的字母和数字图像进行分类,探索神经网络在手语识别中的应用。

Comments 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19258 2026-06-18 cs.CV cs.RO 新提交 57%

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems

CABLE: 面向V2X系统的云辅助带宽高效LMM编码框架

Haohua Que, Zhipeng Bao, Qianyi Wu, Handong Yao

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CABLE框架,通过边缘端利用自我运动补偿和残差运动线索传播云分割掩码,生成感兴趣区域(ROI)并仅上传ROI掩码图像,形成掩码-ROI-LMM反馈循环,在五个数据集上实现73-87%的ROI像素覆盖减少和5-8倍LMM预填充加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16294 2026-06-16 cs.CV q-bio.NC 新提交 57%

Sex-based Network-Specific Differences in Connectomes: A Krakencoder-Based Analysis

基于性别的连接组网络特异性差异:基于Krakencoder的分析

Vibhashree S H, Debanjali Bhattacharya, Vamshi Krishna Kancharla, Neelam Sinha

机构 * Centre for Brain Research, Indian Institute of Science(印度科学研究所大脑研究中心) Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham(阿姆里塔大学阿姆里塔人工智能学院人工智能系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 使用Krakencoder框架模拟脑连接组模态间缺陷传播,分析702名健康被试的结构和功能连接组,发现默认模式网络扰动最大,感觉运动网络最小,完整预测连接组保留更多性别判别信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09673 2026-06-16 cs.LG cs.AI 版本更新 57%

Active Inference with a Self-Prior in the Mirror-Mark Task

镜像标记任务中带有自我先验的主动推理

Dongmin Kim, Hoshinori Kanazawa, Yasuo Kuniyoshi

机构 * The University of Tokyo(东京大学) Laboratory for Intelligent Systems and Informatics(智能系统与信息学实验室)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出一种基于自我先验的计算模型,通过主动推理驱动标记导向行为,无需外部奖励即可模拟镜像自我识别。

Comments 8 pages, 5 figures, Accepted to IEEE ICDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08765 2026-06-12 cs.RO cs.CV 新提交 57%

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10541 2026-06-10 cs.CV 新提交 57%

GRAR: Glass-induced Reflection Artifact Removal in LiDAR Point Clouds

GRAR: LiDAR点云中玻璃引起的反射伪影去除

Wanpeng Shao, Zeyi Guo, Bo Zhang, Yifei Xue, Tie Ji, Yizhen Lao

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Design, Hunan University(湖南大学设计学院) School of Finance and Statistics, Hunan University(湖南大学金融与统计学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出两阶段框架,先利用多模态视觉基础模型和几何线索精确分割玻璃区域,再基于物理驱动的反射感知局部-全局几何相似性描述符去除反射伪影,在多个公开数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09868 2026-06-10 cs.LG cs.AI 新提交 57%

SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

SPACE: 面向多模态大语言模型的无源代理锚点概念擦除

Zhijing Zhang, Jiaqi Ding, Qianshan Wei, Nan Zhou, Jiaqi Li, Yongliang Wu, Tongxin Zhu, Xiaolin Fang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10197 2026-06-10 astro-ph.GA cs.AI 新提交 57%

Integral Field Unit Spectroscopy with One Fiber

单光纤积分场单元光谱学

Zehao Peng, Biprateep Dey, Chris J. Maddison, Joshua S. Speagle

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出一种多模态概率基础模型,利用掩码自编码器从宽带图像预测星系任意空间位置的高分辨率光谱,无需IFU训练数据,性能与监督基线相当。

Comments Accepted for Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-06-10 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏