arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1267 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2608.02437 2026-08-05 cs.CV 版本更新 57%

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

InfiniSplat:用于大基线单目视图合成的隐式高斯解码

Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Shenzhen University(深圳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 InfiniSplat是一种前馈单图像3DGS框架,通过几何引导采样和查询条件隐式解码器实现表面对齐表示,在跨数据集NVS任务中达SOTA,且具零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 (Journal Track). Code: https://github.com/zju3dv/InfiniSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新 57%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-04 cs.AI 版本更新 57%

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07086 2026-08-04 cs.SE cs.AI cs.CL 版本更新 57%

RAG Strategies for Natural Language-Based SQL Query and REST API Call Generation

评估用于基于自然语言的SQL和API调用生成的检索增强生成变体

Tim Schlippe, Simon Martin, Michael Marketsmüller

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。

Comments preprint of conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20851 2026-08-04 stat.ML cs.LG 版本更新 57%

Beyond Noise: A Hypothesis Testing Approach to Robust Feature Selection

特征胜过噪声:通过基于噪声的假设检验的特征选择技术

Mousam Sinha, Tirtha Sarathi Ghosh, Koushik Biswas, Ridam Pal

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种基于噪声假设检验的特征选择方法,通过非参数自助法建立理论基础,有效提升特征选择的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00177 2026-08-03 cs.GR cs.CV 版本更新 57%

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10497 2026-07-31 cs.CL cs.AI 版本更新 57%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 57%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 57%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10605 2026-07-30 stat.ML cs.CY cs.LG econ.EM stat.ME 版本更新 57%

Optimal Causal Annotations: An Application to Casenotes in Social Services

批量自适应因果标注

Ezinne Nwankwo, Lauri Goldkind, Angela Zhou

机构 * UC Berkeley(加州大学伯克利分校) Fordham University(福特汉姆大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种批量自适应方法,通过优化数据采样策略提高因果效应估计效率,减少标注成本,实验证明在缺失数据下能显著降低均方误差。

Comments Extended journal version. A preliminary version was accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15336 2026-07-30 cs.HC cs.AI 版本更新 57%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01008 2026-07-30 cs.CV 版本更新 57%

LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency

LISA-3D: 通过多视角一致性将语言-图像分割提升至3D

Zhongbin Guo, Jiahe Liu, Wenyu Gao, Yushan Li, Xiaomin He, Chengzhi Li, Ping Jian

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LISA-3D通过多视角一致性将语言-图像分割提升至3D,提升语言到3D的准确性达15.6个点,仅需11.6M参数,支持零样本部署。

Comments Published as a conference paper at The 9th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 57%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 57%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16794 2026-07-27 cs.CV 版本更新 57%

LLM-Based Visual Explanation Evaluation Framework for Assessing the Explainability of Facial Skin Disease Classification Models

基于LLM的视觉解释评估框架:用于评估面部皮肤病分类模型的可解释性

Gyuyeon Na

机构 * AI and Business Analytics, Ewha Womans University(人工智能与商业分析,成均馆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出基于LLM的视觉解释评估框架,通过渐进式提示工程评估Grad-CAM在面部皮肤病诊断模型中的解释质量,聚焦病变定位和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12238 2026-07-27 stat.ML cs.LG math.OC 版本更新 57%

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

关于动量SGD在非平稳随机优化中的可证明次优性的研究

Sharan Sahu, Cameron J. Hogan, Martin T. Wells

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了在强凸性和光滑性条件下,随机梯度下降及其动量变体(Polyak重球和Nesterov)在跟踪时间变化最优解时的性能,揭示了动量方法在分布偏移下导致的显式漂移放大惩罚,并证明了这种惩罚并非分析伪影,而是信息论障碍,为动量方法在动态环境中的经验不稳定性提供了理论依据。

Comments Accepted to ICML 2026. 76 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15403 2026-07-23 cs.CV 版本更新 57%

Pointing-Based Object Recognition

基于指目标识的对象识别

Lukáš Hajdúch, Viktor Kocur

机构 * Comenius University, Bratislava, Slovakia(科门纽斯大学,布拉迪斯拉发,斯洛伐克)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种识别人类指目标识的综合流程,结合物体检测、姿态估计和视觉语言模型等方法,通过单张图像重建3D空间信息提升目标识别精度。

Comments Submitted to InnovAIte conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20711 2026-07-22 cs.AI cs.HC 版本更新 57%

Participatory provenance as representational auditing for AI-mediated public consultation

参与式溯源作为AI介入公共咨询中的表示审计

Sachit Mahajan

机构 * Computational Social Science, D-GESS ETH Zurich(计算社会科学,D-GESS 瑞士苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出参与式溯源框架,利用最优传输理论、因果推断和语义分析,追踪AI处理公共反馈的过程,揭示政府摘要在覆盖度和排斥率上的不足,并开发开源工具辅助政策制定者改进摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04818 2026-07-22 cs.AI 版本更新 57%

LLM-Grounded Explainable AI for Supply Chain Risk Early Warning via Temporal Graph Attention Networks

基于时间图注意力网络的LLM解释性AI用于供应链风险早期预警

Zhiming Xue, Yujue Wang, Menghao Huo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于时间图注意力网络和大语言模型的框架,用于可解释的供应链风险早期预警,通过结合证据导向的方法提升预测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24592 2026-07-22 cs.CV 版本更新 57%

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

GH-ESD:基于假设驱动的实例级视觉任务错误切片发现

Wei Zhang, Chaoqun Wang, Zixuan Guan, Ping Sheng Kao, Pengfei Zhao, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 提出GH-ESD框架,通过LLM生成假设与视觉语言模型验证,在实例级任务中自动发现空间关系错误切片,并构建GESD基准,显著提升检测和分割任务的错误切片发现精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14707 2026-07-21 cs.CL cs.AI 版本更新 57%

Harnessing LLMs for Reliable Academic Supervision: A Comparative Study

利用大语言模型进行可靠的学术监督:一项比较研究

Akash Raj

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究以学术监督为案例,比较无支架的GPT-5聊天机器人基线与多模块系统ASuS,ASuS将小模型GPT-4o-mini封装在LangGraph支架中,经评估发现ASuS在各维度表现更优,提取了七种模式,挑战“大模型更好”直觉。

Comments 16 pages, 4 tables, 1 figure. Code and data available at https://github.com/AkashRajSingh/Harnessing-LLMs-for-Reliable-Academic-Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10144 2026-07-21 cs.AI 版本更新 57%

IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation

IdeaTrail:用于科学构思的全流程智能体轨迹

Hengquan Guo

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍用于科学构思和提案生成的多轮过程轨迹数据集IdeaTrail,从高质量论文和工件出发,经生成器-顾问合成循环,产生与真实工件一致且近似研究实践的多轮数据,为科研智能体提供数据及合成过程监督数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09260 2026-07-21 cs.CV 版本更新 57%

AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration

AnythingReality:用于开放词汇VR场景探索的鲁棒在线高斯点云SLAM

Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯科尔科沃科学技术研究院) NLP Research Center(自然语言处理研究中心)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 该研究提出用于开放词汇VR场景探索的集成架构,结合ORB-SLAM3姿态估计与在线高斯重建处理现实数据,通过VR管道探索,语义模块转录语音等,在数据集和TUM-RGBD上提升图像质量,帧率可比或更优,实现88%的视觉语言模型对象识别率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 57%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 57%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 57%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10541 2026-07-16 cs.IR cs.LG 版本更新 57%

RecRec: Recursive Refinement for Sequential Recommendation

RecRec:用于序列推荐的递归细化

Pervez Shaik, Prosenjit Biswas, Abhinav Thorat, Ravi Kolla, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究从递归推理角度重新审视序列推荐,提出轻量级RecRec模型,通过共享递归模块更新潜在状态,引入证据锚定校正机制。实验表明其在少参数下性能优,消融研究凸显递归潜在推理的有效性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27582 2026-07-16 cs.CV 版本更新 57%

Beyond Points: Spherical Distributional Part Prototypes for Interpretable Classification

超越点:用于可解释分类的球形分布部分原型

Duarte Leão, Diogo Pereira Araújo, Catarina Barata, Carlos Santiago

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出vMFProto分布原型框架,用von Mises-Fisher混合建模类别,通过熵最优传输分配补丁,在CUB等数据集上实现高解释质量和竞争性准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10607 2026-07-16 cs.CV 版本更新 57%

Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation

跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕

Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11019 2026-07-15 cs.AI 版本更新 57%

QwenPaw-Data: Bridging Facts, Methodology, and Execution for Autonomous Enterprise Data Analytics

QwenPaw-数据:为自主企业数据分析搭建事实、方法与执行的桥梁

Tianjing Zeng, Yuntao Hong, Zhongjun Ding, Dandan Liu, Yinan Mei, Yunxiang Su, Yiming Wang, Xiaojian Zhang, Jingyu Zhu, Junhao Zhu, Zhuowen Liang, Jiazhen Peng, Lianggui Weng, Zhihao Ding, Kerui Yi, Qifeng Wang, Rong Zhu, Bolin Ding, Liyu Mou, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对企业数据分析在开放环境的特性,提出QwenPaw-Data系统,通过整合异构资产、转化自然语言请求为工作流,架构含三个协作子系统,实验证明该系统提升了数据访问和分析质量,为企业数据智能体提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏