arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 130 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 26 篇

2602.21497 2026-03-10 cs.CV 57%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV 57%

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 50%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07824 2026-03-10 cs.RO 50%

Reasoning Knowledge-Gap in Drone Planning via LLM-based Active Elicitation

通过基于大语言模型的主动获取解决无人机规划中的推理知识缺口

Zeyu Fang, Beomyeol Yu, Cheng Liu, Zeyuan Yang, Rongqian Chen, Yuxin Lin, Mahdi Imani, Tian Lan

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出基于大语言模型的主动信息获取框架,用于解决无人机规划中的推理知识缺口问题,通过结构化知识缺口和最小化人机交互提升复杂任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07263 2026-03-10 cs.SD eess.AS 50%

Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

看见上下文:通过多模态推理实现丰富的视觉上下文感知语音识别

Wenjie Tian, Mingchen Shao, Bingshen Mu, Xuelong Geng, Chengyou Wang, Yujie Liao, Zhixian Zhao, Ziyu Zhang, Jingbin Hu, Mengqi Wei, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出VASR,通过多模态推理融合丰富视觉上下文,解决音频-视觉语音识别中的单模态主导问题,实现更准确的语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 30 篇

2603.08564 2026-03-10 cs.CV 83%

BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment

BioGait-VLM:一种多模态视觉-语言-生物力学框架用于可解释的临床步态评估

Erdong Chen, Yuyang Ji, Jacob K. Greenberg, Benjamin Steel, Faraz Arkam, Abigail Lewis, Pranay Singh, Feng Liu

机构 * Department of Computer Science, Drexel University(德克萨斯大学计算机科学系) Department of Neurological Surgery, Washington University(华盛顿大学神经外科系) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(abstract);分类 cs.CV

AI总结 BioGait-VLM通过多模态框架提升临床步态评估的可解释性和准确性,结合生物力学标记与时间动态分析,实现更可靠的病理运动识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19300 2026-03-10 cs.CV 83%

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

开放词汇伪装物体分割与级联视觉语言模型

Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng

机构 * Shanghai University(上海大学) UCLA(美国大学联盟) Nankai University(南开大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉语言模型的级联框架,用于解决开放词汇伪装物体分割中的领域差距和分割精度问题,通过共享VLM实现高效且语义一致的分割与分类。

Comments Accepted to Computational Visual Media (CVMJ) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06699 2026-03-10 cs.CV 83%

Multi-label Instance-level Generalised Visual Grounding in Agriculture

多标签实例级农业通用视觉 grounding

Mohammadreza Haghighat, Alzayat Saleh, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering(科学与工程学院) James Cook University(詹姆斯库克大学) Centre for AI and Data Science Innovation(人工智能与数据科学创新中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出 Weed-VG 框架,通过多标签层次相关性评分和插值驱动回归,提升农业实例级视觉 grounding 能力,并提供精准农业中的 VG 方法基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 79%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07403 2026-03-10 cs.CV 79%

Prompt-Based Caption Generation for Single-Tooth Dental Images Using Vision-Language Models

基于提示的单牙牙科图像标题生成使用视觉-语言模型

Anastasiia Sukhanova, Aiden Taylor, Julian Myers, Zichun Wang, Kartha Veerya Jammuladinne, Satya Sri Rajiteswari Nimmagadda, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出使用视觉-语言模型生成单牙牙科图像标题,解决现有数据集缺乏和标题描述不全面的问题。

Comments Accepted to IEEE International Conference on Semantic Computing (IEEE ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06973 2026-03-10 cs.CV 79%

T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

T2SGrid: 视频时间定位的时空网格化

Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long

机构 * South China University of Technology(南方科技大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Bytedance Inc(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 T2SGrid通过将视频时间理解转化为空间理解任务,利用网格化技术提升视频时间定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV 79%

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08192 2026-03-10 cs.CV 77%

Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging

路由、检索、反思、修复:一种自改进的代理框架,用于医学影像中的视觉检测和语言推理

Md. Faiyaz Abdullah Sayeedi, Rashedur Rahman, Siam Tahsin Bhuiyan, Sefatul Wasi, Ashraful Islam, Saadia Binte Alam, AKM Mahbubur Rahman

机构 * 1 Center for Computational \& Data Sciences (CCDS), Independent University, Bangladesh (IUB)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 R^4框架通过路由、检索、反思和修复四个代理提升医学影像分析的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08374 2026-03-10 cs.CV 74%

This Looks Distinctly Like That: Grounding Interpretable Recognition in Stiefel Geometry against Neural Collapse

这看起来明显像那:在Stiefel几何中基于可解释识别对抗神经崩溃

Junhao Jia, Jiaqi Wang, Yunyou Liu, Haodong Jing, Yueyi Wu, Xian Wu, Yefeng Zheng

机构 * Medical Artificial Intelligence Lab, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室) Tencent Jarvis Lab, Shenzhen, China(腾讯 Jarvis 实验室) Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学) Xi’an Jiaotong University, Xi’an, China(西安交通大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 本文提出AMP框架,利用Stiefel几何上的Riemannian优化提升原型网络的可解释性,通过正交基和空间正则化器减少原型崩溃问题,实现更准确的分类和更高的因果可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07758 2026-03-10 cs.CV 74%

AR2-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos

AR2-4FV: 为固定视角视频中的长期接地引用而设计的锚点引用与重识别

Teng Yan, Yihan Liu, Jiongxu Chen, Teng Wang, Jiaqi Li, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 AR2-4FV通过锚点库和重入先验提升固定视角视频中长期引用的准确率和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08180 2026-03-10 cs.CV cs.LG 73%

ALOOD: Exploiting Language Representations for LiDAR-based Out-of-Distribution Object Detection

ALOOD:利用语言表示进行基于LiDAR的分布外物体检测

Michael Kösel, Marcel Schreiber, Michael Ulrich, Claudius Gläser, Klaus Dietmayer

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 ALOOD通过整合语言表示,提出了一种基于LiDAR的分布外物体检测新方法,利用视觉-语言模型实现零样本分类。

Comments Accepted for publication at the 2025 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15205 2026-03-10 cs.CV 70%

Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation

利用幻觉减少可提示分割中的手动提示依赖

Jian Hu, Jiayi Lin, Junchi Yan, Shaogang Gong

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV 70%

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19112 2026-03-10 cs.CV 70%

Universal 3D Shape Matching via Coarse-to-Fine Language Guidance

通过粗到细的语言引导实现通用3D形状匹配

Qinfeng Xiao, Guofeng Mei, Bo Yang, Liying Zhang, Jian Zhang, Kit-lun Yick

机构 * Hong Kong Polytechnic University, HK SAR(香港理工大学) Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会) University of Technology Sydney, Australia(悉尼科技大学)

专题命中 视觉定位与Grounding :vision language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniMatch通过粗到细的语言引导方法,实现跨类别非等距形状的通用3D匹配。

Comments Accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06854 2026-03-10 cs.SD cs.AI 70%

Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

音频-语言模型在倾听吗?音频专家头用于自适应音频引导

Neta Glazer, Lenny Aharon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文通过识别音频专家注意力头,提出一种方法来增强音频信息在音频-语言模型中的作用,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 57%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07952 2026-03-10 cs.CV 57%

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

VisualAD: 通过视觉变换器实现无语言零样本异常检测

Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07525 2026-03-10 cs.LG 57%

Generative prediction of laser-induced rocket ignition with dynamic latent space representations

基于动态潜在空间表示的激光诱导火箭点火生成预测

Tony Zahtila, Ettore Saetta, Murray Cutforth, Davy Brouzet, Diego Rossinelli, Gianluca Iaccarino

机构 * Center for Turbulence Research(湍流研究中心) Stanford University(斯坦福大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出基于动态潜在空间表示的生成预测方法,用于高效模拟激光点火火箭点火过程,显著降低预测成本并提升模拟效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18853 2026-03-10 cs.CV 57%

Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

面向城市场景分割的开放词汇领域泛化

Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVDG-SS,通过S2-Corr机制提升城市场景分割中开放词汇领域的泛化能力和鲁棒性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07264 2026-03-10 cs.RO cs.AI 57%

Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving

具备运动学意识的潜在世界模型用于数据高效的自动驾驶

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(道路与交通工程重点实验室,教育部,同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种具备运动学意识的潜在世界模型框架,通过整合车辆运动学信息提升自动驾驶的样本效率和驾驶性能。

Comments 6 pages, 5 figures. Under review at IEEE ITSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 57%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07022 2026-03-10 cs.CV 57%

OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation

OV-DEIM:基于网格合成增强的实时开放词汇目标检测

Leilei Wang, Longfei Liu, Xi Shen, Xuanlong Yu, Ying Tiffany He, Fei Richard Yu, Yingyi Chen

机构 * Intellindust AI Lab(Intellindust AI实验室) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室) College of Computer Science(计算机科学学院) Software Engineering, Shenzhen University, China(软件工程,深圳大学,中国) School of Information Technology, Carleton University, Canada(信息科技学院,卡尔顿大学,加拿大) Institute for Research in Biomedicine, Bellinzona, Switzerland(生物医学研究 institute,贝尔林扎,瑞士)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 OV-DEIM提出了一种基于DEIMv2框架的实时开放词汇目标检测方法,结合网格合成增强策略提升效率和罕见类别识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06630 2026-03-10 physics.soc-ph cs.AI 57%

Photons = Tokens: The Physics of AI and the Economics of Knowledge

光子等于标记:人工智能的物理与知识经济

Alec Litowitz, Nick Polson, Vadim Sokolov

机构 * QStar Capital(QStar资本) University of Chicago(芝加哥大学) George Mason University(乔治·梅森大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过物理和经济视角,探讨人工智能计算中标记的热力学成本及人类能向AI系统提出的问题数量限制,揭示经济价值集中与监管必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24850 2026-03-10 cs.CV 57%

PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement

PHASE-Net:基于物理的谐波注意力系统用于高效的远程光体积脉搏波测记测量

Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu

机构 * Great Bay University(大湾大学) Hefei University of Technology(合肥工业大学) Macao Polytechnic University(澳门 polytechnic 大学) University of Science and Technology Beijing(北京科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PHASE-Net基于物理原理设计,通过谐波注意力系统实现高效的远程光体积脉搏波测记测量,提升鲁棒性和可解释性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 57%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏