arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-04 至 2026-06-04 共收录 64 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2512.05277 2026-06-04 cs.CV cs.AI 86%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04880 2026-06-04 cs.CV 83%

MAOAM: Unified Object and Material Selection with Vision-Language Models

MAOAM: 基于视觉语言模型的统一对象与材质选择

Jaden Park, Valentin Deschaintre, Jason Kuen, Kangning Liu, Iliyan Georgiev, Krishna Kumar Singh, Yong Jae Lee, Michael Fischer

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 视觉问答 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出MAOAM框架,利用视觉语言模型和分割头,通过文本或点击交互实现对象和材质的精确选择,并设计数据生成流水线解决材质选择数据缺乏问题。

Comments Accepted to SIGGRAPH 2026 Conference. Project page: \href{https://jadenpark0.github.io/project_pages/maoam/}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04773 2026-06-04 cs.CV cs.CL 83%

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

NextMotionQA: 使用视觉语言模型基准测试和评判人体运动理解

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Saarland Informatics Campus(萨尔兰州信息学院)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出NextMotionQA基准,通过三项互补任务和多粒度难度分层,系统评估视觉语言模型在人体运动理解中的能力,并揭示其在细粒度评判中的局限性。

Comments 23 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05058 2026-06-04 cs.CV cs.AI 82%

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

UniCAD:面向多模态多任务CAD的统一基准与通用模型

Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen Qian

机构 * SenseTime Research and Tetras.AI(秒速科技研究院和Tetras.AI)

专题命中 视觉问答 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对CAD领域缺乏统一多模态基准的问题,提出UniCAD基准和UniCAD-MLLM通用多模态大语言模型,在点云到CAD重建、文本/图像到CAD生成和CAD问答等任务上实现端到端统一处理,并在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01961 2026-06-04 cs.AI 57%

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

AutoMedBench: 迈向基于智能体AI模型的医学自动研究

Junqi Liu, Selena Song, Yuhan Wang, Jiawei Mao, Hardy Chen, Xiaoke Huang, Tianhao Qi, Pengfei Guo, Yucheng Tang, Yufan He, Can Zhao, Andriy Myronenko, Dong Yang, Daguang Xu, Yuyin Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01815 2026-06-04 cs.CL cs.AI 57%

From Graph Retrieval to Schema Realization: Counterfactual Validation for Text-to-SPARQL over Heterogeneous Knowledge Graphs

从图检索到模式实现:面向异构知识图谱的文本到SPARQL的反事实验证

Chengxiao Dai, Yue Xiu, Dusit Niyato

机构 * University of Bristol(布里斯托大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 提出SchemaForge框架,通过问题条件化的模式切片对齐和反事实验证,在异构知识图谱上提升文本到SPARQL查询生成的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 9 篇

2604.09686 2026-06-04 cs.AI cs.CV 89%

Belief-Aware VLM Model for Human-like Reasoning

信念感知的VLM模型用于类人推理

Anshul Nayak, Shahil Shaik, Yue Wang

机构 * Mechanical Engineering Department, Clemson University(克莱姆森大学机械工程系)

专题命中 视觉推理 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种信念感知的视觉语言模型框架,通过检索式记忆和强化学习近似信念,提升长时程意图推理能力,在HD-EPIC等数据集上优于零样本基线。

Comments Accepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03927 2026-06-04 cs.CV 83%

StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning

StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型

Xiaowen Sun, Matthias Kerzel, Mengdi Li, Xufeng Zhao, Paul Striker, Stefan Wermter

机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) King Abdullah University of Science and Technology(卡塔尔科学与技术大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03937 2026-06-04 cs.AI 83%

Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

熵是不够的:通过视觉锚定令牌选择解锁视觉推理的有效强化学习

Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.AI

AI总结 针对视觉推理中基于熵的信用分配机制失效问题,提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合实现梯度信用重定向,显著提升多模态强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV 79%

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04448 2026-06-04 cs.IR 75%

Bridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning

连接短视频与直播:推理引导的多模态大语言模型用于跨域表示学习

Le Zhang, Xiaolan Zhu, Yuchen Wang, Shilong Kang, Jiaqi Xue, Xiaoyu Zhang, Xiang Chen, Yalong Guan, Xiangyu Wu, Shijun Wang, Lantao Hu, Kun Gai

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 针对短视频到直播的跨域推荐冷启动问题,提出推理引导的跨域表示学习框架RGCD-Rep,利用多模态大语言模型生成结构化推理知识并蒸馏到轻量模型,通过两阶段训练学习可迁移的物品表示,在快手部署后显著提升核心业务指标。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-06-04 cs.CV cs.AI 62%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04689 2026-06-04 quant-ph cs.LG 57%

QPredSGG: Hybrid Quantum Predicate Learning for Long-Tailed Scene Graph Generation

QPredSGG:面向长尾场景图生成的混合量子谓词学习

Prerana Ramkumar, Nouhaila Innan, Muhammad Shafique

机构 * Department of Computer Science, University of Waterloo(1. 温哥华大学计算机科学系) Machine Learning Research Group, University of Waterloo(2. 温哥华大学机器学习研究组)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

AI总结 针对场景图生成中长尾谓词分布导致的分类偏差,提出用量子谓词头(QP-Head)替换经典谓词头,通过振幅嵌入和强纠缠层压缩特征,在Visual Genome 150上实现参数高效的长尾关系分类。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04454 2026-06-04 cs.CL 50%

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

通过外部子图生成增强大语言模型的逐步推理

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出SGR框架,通过从知识图谱生成查询相关子图来引导大语言模型进行逐步推理,提升复杂多步推理的准确性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 50%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 17 篇

2512.03553 2026-06-04 cs.CV cs.AI 89%

Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching

直播中的动态内容审核:结合监督分类与MLLM增强的相似度匹配

Wei Chee Yew, Hailun Xu, Sanjay Saha, Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Kanchan Sarkar, Zhenheng Yang, Danhui Guan

机构 * TikTok Singapore Singapore(TikTok新加坡) TikTok San Jose United States(TikTok旧金山美国) TikTok Shanghai China(TikTok上海中国)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种混合审核框架,结合监督分类和基于参考的相似度匹配,利用多模态大语言模型提升准确性,在保持轻量推理的同时实现大规模直播内容审核。

Comments To be published at KDD 2026 (ADS track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 87%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04172 2026-06-04 cs.RO 85%

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation

Affordance2Action: 任务条件下的场景级功能区域定位用于实时操作

Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu

机构 * Department of Computer Science, Rutgers University-New Brunswick(罗格斯大学新布朗斯维尔回声分校计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(GZ)) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn)

AI总结 提出Affordance2Action框架,通过构建A2A-Bench基准和A2A-AffordGen标注流程,解决场景级任务条件功能区域定位中的多区域对应问题,并支持实时操作。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13796 2026-06-04 cs.CL cs.CV 79%

The Mechanistic Emergence of Symbol Grounding in Language Models

语言模型中符号接地机制的涌现

Shuyu Wu, Ziqiao Ma, Xiaoxi Luo, Yidong Huang, Josue Torres-Fonseca, Freda Shi, Joyce Chai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 通过机械因果分析,发现符号接地在语言模型的中层计算中通过注意力头聚合环境信息实现,并在多模态对话和多种架构中复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02555 2026-06-04 cs.CV cs.CL 79%

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI 77%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04244 2026-06-04 cs.AI cs.CL cs.CV cs.LG 75%

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

VAMPS: 视觉辅助数学问题求解基准

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04282 2026-06-04 cs.CV 70%

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

FindIt:面向通用多模态大语言模型的格式感知视觉检测基准

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根人工智能中心,图宾根大学) Woven by Toyota, Inc.(丰田公司) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉定位与Grounding :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出首个全面评估通用多模态大语言模型在可提示定位能力上的基准,涵盖四种核心任务,并标准化输入输出格式,揭示模型对格式约束的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03564 2026-06-04 cs.CV cs.AI 62%

CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

CR-Seg:注意力引导与CoT增强的由粗到精推理分割

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25402 2026-06-04 cs.CV cs.AI 62%

Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation

解剖锚定的自监督:蒸馏视觉基础模型用于不变超声表示

Chunzheng Zhu, Yijun Wang, Jianxin Lin, Feng Wang, Hongwei Wang, Lei Zhao, Shengli Li, Kenli Li

机构 * Hunan University(湖南大学) Shenzhen Maternity and Child Healthcare Hospital(深圳妇幼保健医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出解剖锚定的超声自监督框架ANAUS,通过可学习潜在提示引擎和领域自适应实现无标注解剖分割,并设计双策略自监督学习(语义感知解剖分离对齐和上下文核心区域预测)来增强表示学习,在六个公开数据集上超越现有方法。

Comments MICCAI 2026 Accepted Paper; Anatomy-Anchored Ultrasound Self-Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04545 2026-06-04 cs.CV 57%

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Impostor:一个用于真实AIGC篡改定位的智能体策划基准

Zhenliang Li, Yutao Hu, Qixiong Wang, Wenpeng Du, Hongxiang Jiang, Jiasong Wu, Xiaolong Jiang, Jungong Han

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04291 2026-06-04 cs.CV 57%

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

3D视觉食谱:数据、学习范式与应用

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

机构 * Brown University(布朗大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) New York University(纽约大学) The University of Sydney(悉尼大学) Stability AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出一种以数据为中心的3D视觉分类法,通过分析点云、网格、体素和3D高斯等几何表示及其获取流程,以及数据集设计、基准构建和监督机制,统一了表示、学习范式与下游任务(重建、生成、视频建模)之间的关系。

Comments Accepted to the CVPR 2026 OpenSUN3D Workshop. Official version available at CVF Open Access. https://openaccess.thecvf.com/content/CVPR2026W/OpenSUN3D/html/Du_A_Cookbook_of_3D_Vision_Data_Learning_Paradigms_and_Application_CVPRW_2026_paper.html

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29861 2026-06-04 cs.CL cs.AI 57%

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10706 2026-06-04 cs.LG cs.RO cs.SY eess.SY stat.ML 57%

Interactive Differentiable Simulation

交互式可微分模拟

Eric Heiden, David Millard, Hejia Zhang, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出交互式可微分模拟(IDS),一种能够高效准确推断刚体系统物理属性的可微分物理引擎,通过视觉输入实现系统识别,从而建立具有物理意义的世界模型,并在非线性动态系统中实现自动任务机器人设计和参数估计,显著提升了非线性控制领域的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04905 2026-06-04 cs.LO 50%

Event Calculus Meets Hybrid ASP

事件演算遇见混合ASP

Ondřej Vašíček, Joaquín Arias, Jan Fiedor, Gopal Gupta, Bohuslav Křena, Jakub Němec, Javier Romero, Tomáš Vojnar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对事件演算在ASP实现中面临的连续变化和值域爆炸问题,提出混合EC扩展,通过功能流和抽象步映射,利用混合ASP系统实现线性约束求解,保证终止性并支持稠密域建模。

Comments Accepted at The 42nd International Conference on Logic Programming, ICLP 2026. Will be published in a special issue of TPLP

详情

展开后加载摘要…

URL PDF HTML 收藏