arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 340 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2505.18542 2026-06-24 cs.CL 版本更新 50%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10703 2026-06-23 cs.CL cs.IR 版本更新 50%

LatentCRS: A Variational EM Framework for Bridging Semantics and Behavior in LLM-based Conversational Recommendation

LatentCRS:一种用于桥接基于LLM的对话推荐中语义与行为的变分EM框架

Guanrong Li, Kuo Tian, Jinnan Qi, Qinghan Fu, Zhen Wu, Rui Xia, Xinyu Dai

机构 * Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出LatentCRS框架,通过变分EM过程桥接LLM的语义空间与用户行为模式,解决对话推荐中语义理解与推荐精度不匹配的问题,实验表明其有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10416 2026-06-19 cs.RO 版本更新 50%

TASC: Task-Aware Shared Control for Relational Telemanipulation

TASC:面向关系遥操作的任务感知共享控制

Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(KU莱顿机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(KU莱顿电气工程系,语音与图像处理研究单位)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出TASC框架,通过视觉构建开放词汇交互图推断任务级用户意图,并基于空间约束提供共享控制辅助,提升关系遥操作效率与泛化能力。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05925 2026-06-18 cs.RO 版本更新 50%

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine:合成与精炼人-物交互运动以实现物理可行的灵巧机器人动作

Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

机构 * Korea Institute of Science and Technology(韩国科学技术院) KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DexSynRefine框架,通过HOI-MMFP运动先验合成手-物轨迹,结合任务空间残差强化学习和接触动力学适应,将人-物交互数据转化为物理可行的灵巧操作,在五个任务上成功率提升50-70个百分点。

Comments Project page: https://dexsynrefine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02854 2026-06-17 cs.PL cs.LO math.CT 版本更新 50%

Fixed-Point Scaffolding in the Clef Programming Language

Clef 编程语言中的不动点脚手架

Houston Haynes

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于不动点组合子的编译器中间表示方法,通过范畴论构造实现类型结构保持和正确性验证,并利用 MLIR 工具链支撑实际编译。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 50%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06234 2026-06-10 cs.RO cs.HC 版本更新 50%

RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI

RobotEQ:从被动智能到主动智能的具身AI过渡

Kuofei Fang, Xinyi Che, Haomin Ouyang, Shufan Zhang, Xuehao Wang, Qi Liu, Liyi Liu, Chenqi Zhang, Wenxi Cai, Wenyu Dai, Jinyang Wu, Fan Zhang, Haoyu Chen, Bin He, Zheng Lian

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(自主智能无人系统国家重点实验室,同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出RobotEQ基准,评估模型在具身场景中理解并遵守社会规范的能力,实验表明现有模型在主动智能上仍有不足,利用RAG技术可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 50%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20591 2026-06-09 cs.RO 版本更新 50%

LightTact: A Visual-Tactile Fingertip Sensor for Deformation-Independent Contact Sensing

LightTact: 一种用于变形无关接触感知的视觉-触觉指尖传感器

Changyi Lin, Boda Huo, Mingyang Yu, Emily Ruppel, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出LightTact传感器,通过环境光阻断光学配置实现变形无关的接触检测,在无宏观变形下(如液体、超软材料)实现高对比度接触分割,并解锁轻接触机器人操作。

Comments Project website: https://linchangyi1.github.io/LightTact

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-06-09 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index for Structure-Aware JSONL Retrieval in Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏