arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-14 至 2026-04-14 共收录 45 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 45 篇

2511.18373 2026-04-14 cs.CV 89%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);vision language model(abstract);VLM(abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09364 2026-04-14 cs.CV cs.CL 85%

Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts

仲裁失败,而非感知失明:视觉-语言模型如何解决视觉-语言冲突

Farhad Nooralahzadeh, Omid Rohanian, Yi Zhang, Jonathan Fürst, Kurt Stockinger

机构 * Institute of Computer Science, Zurich University of Applied Sciences(苏黎世应用科技大学计算机科学研究所) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 研究探讨视觉-语言模型在视觉与语言冲突中的仲裁机制,发现编码与基础的脱节,通过多模态仲裁交叉分析揭示视觉属性在早期层可线性解码,最终层logit与基础结果相关性达0.847,表明需针对性干预提升视觉基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 84%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10971 2026-04-14 cs.CV cs.AI 84%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 83%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10800 2026-04-14 cs.SE cs.AI cs.CR cs.LG cs.PL 81%

Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis

在修复前验证:面向可信跨语言代码分析的代理执行 grounding

Jugal Gajjar

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的跨语言漏洞生命周期框架,通过LLM驱动的三个阶段:混合结构-语义检测、执行 grounding 的代理验证和验证-aware 的迭代修复,确保修复前有执行验证。框架利用uAST和图神经网络融合,实现高准确率的漏洞检测与跨语言修复。

Comments 20 pages (13 main + 7 appendices), 9 figures, 10 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10437 2026-04-14 cs.CV 79%

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

通过判别引导增强3D CT报告生成中的细粒度空间定位

Chenyu Wang, Weicheng Dai, Han Liu, Wenchao Li, Kayhan Batmanghelich

机构 * Boston University(波士顿大学) Siemens Healthineers(西门子医疗)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DCP-PD框架,通过提炼自由文本报告中的细粒度线索,指导报告生成并减少对快捷方式的依赖,提升了CT-RATE和Rad-ChestCT的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09211 2026-04-14 cs.CV 79%

Affostruction: 3D Affordance Grounding with Generative Reconstruction

构形:基于生成重建的3D构形定位

Chunghyun Park, Seunghyeon Lee, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) RLWRLD

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21078 2026-04-14 cs.CV 79%

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization

面向视频时序动作定位中缓解模态偏差的视觉-语言模型

Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan

机构 * UVLab, Department of Computer Science, University of Warwick(华威大学计算机科学系UVLab) Department of Automation, University of Cambridge(剑桥大学自动化系) Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ActionVLM框架,通过去偏差重加权模块和残差聚合策略缓解视频时序动作定位中的模态偏差,提升时间推理能力,在THUMOS14数据集上取得3.2%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04099 2026-04-14 cs.CV cs.AI 79%

TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection

TARAC:通过时间注意力实时累积连接缓解大型视觉-语言模型中的幻觉

Lei Jiang, Chunzhao Xie, Tongxuan Liu, Yuting Zeng, jinrong Guo, Yunheng Shen, Weizhe Huang, Jing Li, Xiaohua Xu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TARAC,一种无需训练的框架,通过动态累积和重注入历史注意力来维持视觉 grounding,实验表明其在减少幻觉和提升感知得分方面优于现有方法,且计算开销低。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07413 2026-04-14 cs.CV cs.AI cs.LG 75%

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

FORGE:面向制造场景的细粒度多模态评估

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao

机构 * University of Waterloo(滑铁卢大学) University of Sydney(悉尼大学) Singapore Management University(新加坡管理大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。

Comments Project Page:https://ai4manufacturing.github.io/forge-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10721 2026-04-14 cs.CV cs.AI 73%

Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization

将生成器转化为检索器:解锁多模态大语言模型用于自然语言引导的地理定位

Yuqi Chen, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah

机构 * Vermont Artificial Intelligence Lab, Department of Computer Science, University of Vermont(佛蒙特大学计算机科学系佛蒙特人工智能实验室) Intelligent Machines Lab, Department of Artificial Intelligence, Information Technology University(信息技术大学人工智能系智能机器实验室) Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种简单有效的框架,通过参数高效微调将多模态大语言模型应用于自然语言引导的地理定位,实现强大的跨模态对齐,取得GeoText-1652的SOTA结果,并在CVG-Text的5个子任务中表现优异。

Comments CVPRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10527 2026-04-14 cs.CV cs.AI 73%

STORM: End-to-End Referring Multi-Object Tracking in Videos

STORM:视频中的端到端提及多目标跟踪

Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

机构 * Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03059 2026-04-14 cs.HC cs.CL cs.ET cs.IR 71%

From Speech-to-Spatial: Grounding Utterances on A Live Shared View with Augmented Reality

从语音到空间:利用增强现实进行共享视图中话语的定位

Yoonsang Kim, Divyansh Pradhan, Devshree Jadeja, Arie Kaufman

机构 * Center for Visual Computing, Stony Brook University(石溪大学视觉计算中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Speech-to-Spatial框架,通过语音指令生成空间定位的AR指导,无需额外线索或人工标注,提升任务效率和可用性。

Comments 11 pages, 6 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11082 2026-04-14 cs.CV 70%

RESP: Reference-guided Sequential Prompting for Visual Glitch Detection in Video Games

RESP:基于参考的顺序提示用于视频游戏中的视觉故障检测

Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出RESP框架,通过参考引导提示实现多帧视频游戏故障检测,利用VLMs在视频层面进行比较而非孤立分类,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 70%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 70%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20136 2026-04-14 cs.CL cs.AI 70%

M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成

Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim

机构 * Korea University(高丽大学) Sungkyunkwan University(成均馆大学) NVIDIA Research(英伟达研究院) Hanwha Systems(韩华系统)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09056 2026-04-14 cs.CV 70%

ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

ConceptPose:基于概念向量的无训练零样本物体姿态估计

Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ConceptPose利用视觉语言模型生成开放词汇3D概念图,通过建立概念图间的3D-3D对应关系,实现无训练的零样本物体姿态估计,优于现有最佳基线62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10039 2026-04-14 cs.CV 70%

Counting to Four is still a Chore for VLMs

为VLMs计数仍是一项苦差事

Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11320 2026-04-14 cs.RO 67%

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取

Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) Peng Cheng Laboratory(鹏城实验室) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 62%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11786 2026-04-14 cs.AI cs.MA 57%

GenTac: Generative Modeling and Forecasting of Soccer Tactics

GenTac:生成式足球战术建模与预测

Jiayuan Rao, Tianlin Gui, Haoning Wu, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 GenTac通过生成式框架建模足球战术的随机过程,实现长周期轨迹预测,支持多因素条件模拟,展现高精度战术生成与未来战术预测能力。

Comments 40 pages, 5 figures; technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 57%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12038 2026-04-14 cs.AI 57%

Subargument Argumentation Frameworks: Separating Direct Conflict from Structural Dependency

子论点论证框架:区分直接冲突与结构依赖

Beishui Liao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出子论点论证框架(SAFs),通过将直接冲突与结构依赖分离,提升论证表示的表达能力,同时保持与Dung理论的语义兼容性。

Comments The original title, "Abstract Argumentation with Subargument Relations," has been replaced by "Subargument Argumentation Frameworks: Separating Direct Conflict from Structural Dependency"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17934 2026-04-14 cs.CL cs.AI 57%

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV:在20GB VRAM中通过十亿级知识图谱增强大语言模型

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学) Theory Lab, Huawei(华为理论实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AtlasKV,一种通过十亿级知识图谱增强大语言模型的方法,利用子线性时间与内存复杂度实现高效知识整合,无需外部检索模块或长上下文先验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 57%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11005 2026-04-14 cs.AI 57%

Diffusion-CAM: Faithful Visual Explanations for dMLLMs

扩散-CAM:面向dMLLMs的可信视觉解释

Haomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang

机构 * Department of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知系) Sun Yat-sen University(中山大学) Northwestern University(西北大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Diffusion-CAM,一种专为扩散多模态大语言模型设计的可解释性方法,通过可微探针获取中间表示,捕捉潜在特征及其类别梯度,解决空间模糊和图像内部混淆问题,提升定位准确性和视觉保真度。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10672 2026-04-14 stat.ML cs.LG 57%

One-Step Score-Based Density Ratio Estimation

一步式基于分数的密度比率估计

Wei Chen, Qibin Zhao, John Paisley, Junmei Yang, Delu Zeng

机构 * School of Mathematics, South China University of Technology(华南理工大学数学学院) Tensor Learning Team, RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心张量学习团队) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出OS-DRE,一种结合直接和基于分数方法优势的框架,通过分解时间分数为空间和时间成分,利用解析径向基函数框架,实现高效密度比率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10589 2026-04-14 cs.AI 57%

Working Paper: Towards Schema-based Learning from a Category-Theoretic Perspective

工作论文:从范畴论视角迈向基于模式的学习

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata I+D & Universidad Autonoma de Madrid(Cognodata I+D 与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种分层范畴框架,用于基于模式的学习,通过四个相互关联的层次结构,构建了模式、实现、语义和智能体等层面,实现了模式语义、认知、具身化和架构抽象的弱分层n-范畴结构。

Comments 43 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏