arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 19 篇

2511.17731 2026-07-02 cs.CV cs.LG 版本更新 57%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00234 2026-07-02 eess.SP 新提交 50%

Pinching Antennas-Assisted Sensing: A Ziv-Zakai Bound (ZZB) Perspective

夹捏天线辅助感知:Ziv-Zakai界(ZZB)视角

Hao Jiang, Chongjun Ouyang, Yuanwei Liu, Arumugam Nallanathan, Robert Schober

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对夹捏天线系统(PASS)的多模态观测模型导致的感知模糊问题,从Ziv-Zakai界(ZZB)角度分析其感知能力,提出低复杂度替代目标函数以实现ZZB最小化。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00149 2026-07-02 math.PR stat.ML 新提交 50%

Uniform-in-time Propagation-of-Chaos for Stein Variational Gradient Descent

Stein变分梯度下降的一致时间混沌传播

Krishnakumar Balasubramanian, Sayan Banerjee, Anna Korba

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对连续时间Stein变分梯度下降(SVGD),研究一致时间混沌传播,通过截断策略和有限维理论,在多种度量下获得对数或迭代对数率的界,并证明共轭原理将结果推广至非线性目标。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00228 2026-07-02 astro-ph.IM astro-ph.HE cs.LG 新提交 50%

Leveraging Multimodality for Real-Time Classification of Transients and Variables found by the Zwicky Transient Facility

利用多模态对Zwicky瞬变设施发现的瞬变和变星进行实时分类

Ved G. Shah, Nabeel Rehemtulla, Adam A. Miller, Sushant Sharma Chaudhary, Michael W. Coughlin, Antoine Le Calloch, Matthew J. Graham, Joahan Castaneda Jaimes, Theophile Jegou du Laz, Ashish A. Mahabal, Frank J. Masci, Josiah Purdum, Reed Riddle, Jesper Sollerman, Anastasia Wei, Mansi M. Kasliwal

机构 * Department of Physics and Astronomy, Northwestern University(西北大学物理与天文学系) Center for Interdisciplinary Exploration and Research in Astrophysics (CIERA)(天体物理跨学科探索与研究中心) NSF-Simons AI Institute for the Sky (SkAI)(NSF-西蒙斯天空人工智能研究所) School of Physics and Astronomy, University of Minnesota(明尼苏达大学物理与天文学学院) Division of Physics, Mathematics, and Astronomy, California Institute of Technology(加州理工学院物理、数学与天文学部)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对时域巡天中实时分类的挑战,本文提出ORACLE-2模型,结合光变曲线、元数据和图像进行多模态层次分类,在ZTF数据上宏F1达0.73,较仅用光变曲线提升40%。

Comments 29 Pages, 15 Figures, 8 Tables. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2603.12056 2026-07-02 cs.AI cs.CL 版本更新 81%

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00547 2026-07-02 cs.CV cs.AI 新提交 62%

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

EgoGapBench:多智能体场景中自我中心动作选择的基准测试

Jihyeok Jung, Jeewu Lee, Sanghyeop Kim, Chanhee Han, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学) Ministry of Science and ICT(科学技术信息通信部)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。

Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00881 2026-07-02 cs.CV 新提交 57%

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

OmniView-Space: 通过多视角空间映射增强空间推理

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Tencent Youtu Lab(腾讯优图实验室) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出OmniView-Space框架,通过多视角空间映射、工具引导的自我中心推理和认知图蒸馏,解决多模态大模型在多步空间推理中的参考框架动态重锚问题,在单/多图像基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 50%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00031 2026-07-02 cs.RO 新提交 50%

Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning

通过效应预测联合发现物体与动作符号以进行机器人操作规划

Burcu Kilic, Berke Kartal, Fatih Dogangun, Erhan Oztop, Emre Ugur

机构 * Bogazici University(博阿齐奇大学) Ozyegin University(厄兹耶金大学) Osaka University(大阪大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出一种通过二元瓶颈层联合发现操作原语和物体类别的方法,利用预测多模态交互效应进行离散规划,在桌面重定位和堆叠任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 11 篇

2607.00746 2026-07-02 cs.CV cs.AI 新提交 86%

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception

GaussianFusion:用于多模态融合感知的统一3D高斯表示

Xiao Zhao, Chang Liu, Mingxu Zhu, Zheyuan Zhang, Linna Song, Qingliang Luo, Chufan Guo, Kuifeng Su

机构 * Tencent, Autonomous Driving Lab(腾讯自动驾驶实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出基于3D高斯表示的多模态融合框架GaussianFusion,通过连续3D高斯空间统一多模态特征,保留细节,支持多种3D感知任务,在nuScenes上检测NDS提升2.6,占用预测mIoU提升1.55且速度提升450%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交 86%

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00514 2026-07-02 cs.CV cs.AI 新提交 81%

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

机构 * Nagoya University(名古屋大学) Northeastern University(东北大学) KC Machine Learning Lab(KC机器学习实验室) University of Science, Vietnam National University Ho Chi Minh City(胡志明市越南国立大学理科大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Cross4D-JEPA,通过教师-学生框架将冻结的2D基础模型(如DINOv2或V-JEPA 2)的密集补丁特征蒸馏到4D点编码器,实现每点对应和潜在空间匹配,在四个基准上优于模态内和全局跨模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 79%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00974 2026-07-02 cs.IT cs.CV math.IT 新提交 79%

QuaMoE-DRF: Proactive Beam and Rate Adaptation via Multimodal Dynamic Radio Map Forecasting in ISAC Networks

QuaMoE-DRF:ISAC网络中通过多模态动态无线电地图预测实现主动波束和速率自适应

Zhihan Zeng, Kaihe Wang, Zhongpei Zhang, Chongwen Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对静态无线电地图无法捕捉移动物体短时遮挡的问题,提出QuaMoE-DRF框架,通过质量感知的多模态动态无线电地图预测未来波束SINR场,联合优化波束、MCS和速率,在动态城市基准上实现402.5 Mbps有效速率和0.0417中断概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00296 2026-07-02 cs.CV cs.AI 新提交 73%

Learning When to Listen: Gated Affect Fusion for Human Motion Prediction

学习何时倾听:用于人体运动预测的门控情感融合

Jingni Huang

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出门控情感变换器(GAT)动态调节跨模态信息流,解决无约束视频中情感特征与姿态融合的噪声问题,证明面部情感仅在短中期(如30帧)提供有限预测线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 62%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00545 2026-07-02 cs.CV 新提交 57%

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

ECoSim:面向可控交通模拟的数据高效微调

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出轻量级控制适应框架,通过身份初始化的FiLM层调制中间特征,为预训练的扩散和自回归交通模型添加多模态控制(草图、潜在行为编码和文本),使用不到1%的配对数据实现强可控性。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00434 2026-07-02 cs.CV cs.LG 新提交 57%

Information-Regularized Attention for Visual-Centric Reasoning

信息正则化注意力用于以视觉为中心的推理

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

机构 * FAIR at Meta(Meta 的 FAIR 部门) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型中的对象幻觉、视觉基础弱和灾难性遗忘问题,提出信息正则化注意力机制,通过随机注意力显式调控视觉信息注入,改善表示学习稳定性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新 57%

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25998 2026-07-02 cs.CR 新提交 50%

BlowLive: Blow-Based Multi-Factor Biometrics with Liveness Detection and Revocability

BlowLive:基于吹气的多因素生物识别与活体检测及可撤销性

Eyasu Getahun Chekole, Howard Halim, Daniël Reijsbergen, Jianying Zhou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出BlowLive框架,融合吹气声学信号与面部生物特征,采用模糊提取器生成稳定密钥进行认证,并引入多普勒频移活体检测,实现高精度、强安全与可撤销性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 7 篇

2507.15692 2026-07-02 cs.HC cs.CL cs.CV 交叉投稿 91%

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

表面化变异以校准MLLM生成图像描述的可信度感知

Meng Chen, Akhil Iyer, Amy Pavel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 通过系统性地展示多个MLLM响应间的变异,帮助盲人或低视力用户无需视觉检查即可检测不可靠信息,实验表明该方法将识别不可靠声明的能力提升4.9倍。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00272 2026-07-02 cs.RO cs.AI cs.MA 新提交 57%

ASPIRE: Agentic /Skills Discovery for Robotics

ASPIRE: 面向机器人的智能体技能发现

Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

机构 * NVIDIA(英伟达) UMich(密歇根大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。

Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15874 2026-07-02 cs.CV 57%

ENSAM: an efficient foundation model for interactive segmentation of 3D medical images

ENSAM:一种高效的交互式3D医学图像分割基础模型

Elias Stenhede, Agnar Martin Bjørnstad, Arian Ranjbar

机构 * Akershus University Hospital(阿克什胡斯大学医院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 ENSAM结合SegResNet编码器、提示编码器和掩码解码器,通过潜在交叉注意力、相对位置编码等技术,在有限数据和算力下实现高效3D医学图像分割,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00979 2026-07-02 cs.HC 新提交 50%

Visualizing Engineering Fundamentals: Design of Mixed Reality and Physical Toolkits for Effective Learning

可视化工程基础:混合现实与物理工具包的设计以促进有效学习

Mohammad Abu Nasir Rakib, Sharmin Akter, Eshwara Prasad Sridhar, Somik Biswas, Md Rassel Raihan, Mahmudur Rahman

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究通过用户实验比较了课堂讲授、混合现实应用和物理工具包三种教学方式,发现结合可视化与动手交互的多模态体验最受学生欢迎,为工程教育工具的人本设计提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00756 2026-07-02 cond-mat.mtrl-sci physics.atom-ph physics.comp-ph 新提交 50%

The BiP-PRISM algorithm for fast and scalable core-loss STEM-EELS simulations

BiP-PRISM算法:快速可扩展的芯损失STEM-EELS模拟

Philipp Pelz

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出BiP-PRISM算法,通过束分割和自然邻域插值加速芯损失电子能量损失谱模拟,显著降低计算和内存需求,实现消费级GPU上的全分辨率元素映射。

Comments 21 pages, 7 figures, 7 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24028 2026-07-02 astro-ph.EP 新提交 50%

Micron-Scale Technosignatures: How a Cubic Metre of Lunar Regolith May Begin to Constrain the Number of Past Technological Civilisations in the Galaxy

微米级技术特征:一立方米月球风化层如何开始约束银河系中过去技术文明的数量

Lewis J. Pinault, Brian C. Lacki, Ian A. Crawford, Andrew P. V. Siemion

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究提出通过分析月球风化层中微米级人造颗粒来约束银河系技术文明数量,结合星际输运和风化层混合模型,给出无检测时的上限约0.09地球质量当量。

Comments Submitted to the International Journal of Astrobiology on 10 March 2026; currently under review. v3 further reconciles used/unused references, and provides additional and correctly matched doi insertions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24152 2026-07-02 math.ST cs.LG stat.ML stat.TH 版本更新 50%

Fast Score-Based Sampling via Log-Concave Reductions

基于对数凹约简的快速分数采样

M. J. Wainwright

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出将分数扩散采样问题约简为一系列强对数凹子问题,利用任意强对数凹采样器实现高效采样,并给出采样复杂度界限。

Comments Accepted to the COLT 2026 Conference, San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏