arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 32 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 32 篇

2605.11616 2026-05-13 cs.CV 92%

Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances

通过记忆实现 grounding:跨场景和场景内的记忆用于3D功能 affordances

Qirui Wang, Jingyi He, Yining Pan, Xulei Yang, Shijie Li

机构 * TUM(慕尼黑工业大学) A*STAR(新加坡科技研究局)

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AFFORDMEM框架,通过跨场景和场景内的记忆实现3D功能 affordances的grounding,无需微调和标注,提升AP50性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 90%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11727 2026-05-13 cs.AI cs.CL cs.CV 85%

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

洞穴的寓言:基于测量的视觉-语言学习

Kepeng Xu, Li Xu, Gang He, Wenxin Yu

机构 * Xidian University(西电大学) Southwest University of Science and Technology(西南科技大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11272 2026-05-13 cs.LG cs.AI cs.IR 85%

Localization Boosting for Growth Markets: Mitigating Cross-Locale Behavioral Bias in Learning-to-Rank

增长市场中的定位增强:减轻跨本地化行为偏差在学习到排序中的影响

Suryaa Veerabathiran Seran, Ashwin Naresh Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多目标框架,结合行为监督、VLM相关性信号和本地化增强,以改善学习到排序中的本地内容可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12237 2026-05-13 cs.CV 84%

UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

UHR-Micro: 诊断和缓解地球观测VLMs中的分辨率错觉

Shuo Ni, Tong Wang, Jing Zhang, He Chen, Haonan Guo, Ning Zhang, Bo Du

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(国家空间智能信息处理科技重点实验室) Beijing Institute of Technology(北京理工大学) School of Computer Science(计算机学院) Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 UHR-Micro通过11253条指令和1212张超高清图像,评估VLM在高分辨率地球观测图像中的空间极限表现,揭示高分辨率输入下空间定位和证据解析的失败,并提出MAP代理以证据为中心提升微尺度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09598 2026-05-13 cs.CV 84%

SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy

SoccerLens: 超越准确性的 grounded 球赛视频理解

Ismael Elsharkawi, Ahmed Sait, Silvio Giancola, Bernard Ghanem, Hossam Sharara, Abdelrahman Eldesokey

机构 * Department of Computer Science and Engineering, The American University in Cairo(美国亚历山大大学计算机科学与工程系) Image And Visual Understanding Lab (IVUL), KAUST(卡塔尔大学图像与视觉理解实验室)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出 SoccerLens 基准测试,评估球赛视频理解中视觉 grounding 的有效性,发现现有模型在准确率高但 grounding 表现差,揭示了时空复杂领域中 grounded 评估的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 81%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10357 2026-05-13 cs.MM cs.AI 81%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post: 实时可审计的多模态事实核查证据基础

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 RW-Post提出一个可审计的多模态事实核查基准,通过人机协同提取和审计流程,链接社交媒体帖子与推理轨迹及证据项,评估不同场景下的视觉 grounding 和证据利用能力。

Comments This submission was made in error. It was intended to replace the existing submission arXiv:2512.22933 rather than create a new submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22933 2026-05-13 cs.AI cs.CL 81%

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

RW-Post:可审计的证据导向多模态事实核查

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli

机构 * School of Computing (SoC), National University of Singapore (NUS)(新加坡国立大学计算机学院(SoC)) National University of Singapore (NUS)(新加坡国立大学) Department of Electrical and Computer Engineering (ECE), National University of Singapore (NUS)(新加坡国立大学电子与计算机工程系(ECE))

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 RW-Post提出一种可审计的多模态事实核查基准,通过人类事实核查文章提取证据,支持不同场景下的可控评估,提升视觉 grounding 和证据利用能力。

Comments Code and dataset will be released at https://github.com/xudanni0927/AgentFact

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV 81%

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10032 2026-05-13 cs.CL 80%

PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

PlantMarkerBench: 一个多物种证据导向植物标记推理基准

Sajib Acharjee Dip, Song Li, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) School of Plant and Environmental Sciences, Virginia Tech(弗吉尼亚理工学院植物与环境科学学院) Fralin Biomedical Research Institute, Virginia Tech(弗吉尼亚理工学院弗拉林生物医学研究学院) FBRI Cancer Research Center, Washington, DC(华盛顿特区FBRI癌症研究中心)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)

AI总结 本文提出PlantMarkerBench,通过整合文献检索与生物 grounding,构建了包含4种植物的基准,评估文献支持的植物标记证据解释,发现模型在功能、间接和弱支持证据上表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV 79%

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02549 2026-05-13 cs.CV cs.CL 79%

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

DemaFormer: 带能量建模的阻尼指数移动平均变换器用于时序语言定位

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DemaFormer,通过阻尼指数移动平均机制改进时序语言定位任务中的注意力机制,有效分离目标视频片段与其余片段。

Comments Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12412 2026-05-13 cs.CL cs.AI cs.LG 62%

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

空间中的故事:概念信念空间中的上下文学习轨迹

Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究通过故事理解探讨LLM在概念信念空间中的动态信念更新,发现信念更新可描述为低维结构流形上的轨迹,并能通过简单线性探针预测行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12178 2026-05-13 cs.AI cs.CL cs.LG 62%

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

企业系统需要学习的世界模型吗?上下文对推断动态的重要性

Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Malay, Sagar Davasam, Seganrasan Subramanian, Vipul Mittal, Sridhar Krishna Nemala, Christopher Pal, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Mila

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在可配置的企业环境中,代理是否仍需学习动态规则,通过实验表明运行时发现动态比离线训练更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11551 2026-05-13 cs.LG cs.CV cs.IT math.IT 62%

VNDUQE: Information-Theoretic Novelty Detection using Deep Variational Information Bottleneck

VNDUQE:基于深度变分信息瓶颈的信息理论新颖性检测

Aryan Gondkar, Hayder Radha, Yiming Deng

机构 * 1 Nondestructive Evaluation Lab, Department of Electrical Computer Engineering Michigan State University East Lansing, MI Email 2 Department of Electrical

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VNDUQE方法,利用深度变分信息瓶颈进行新颖性检测和不确定性量化,通过KL散度和预测熵实现对Out-of-distribution样本的检测,实验结果显示其在新颖性检测和不确定性估计方面优于基线MSP方法。

Comments 6 pages, 3 figures, Fall 2025 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09051 2026-05-13 cs.LG cs.AI 62%

Model-Level GNN Explanations via Rule-to-Graph Readout for Logit Reconstruction

通过规则到图读取实现模型级GNN解释用于logit重建

Shengyao Lu, Jiuding Yang, Aedan J. DeFrates, Keith G. Mills, Baochun Li, Di Niu

机构 * University of Victoria(维多利亚大学) University of Alberta(阿尔伯塔大学) LSU ATHENA Lab(路易斯安那州立大学ATHENA实验室) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于规则的图神经网络解释框架,通过规则级读取重建logit,实现全局解释与子图接地,提升预测一致性并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12282 2026-05-13 cs.CV 57%

Large-Small Model Collaboration for Farmland Semantic Change Detection

大-小模型协作用于耕地语义变化检测

Xinjia Li, Rui Wang, Qiurong Peng, Lingfei Ye, Dengrong Zhang, Haoyu Zhang

机构 * College of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出大-小协作框架,通过细粒度差分感知Mamba和CLIP文本先验实现耕地变化检测,提升精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12061 2026-05-13 cs.AI 57%

SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory

SAGE:一种自演化代理图记忆引擎,用于结构感知的联想记忆

Juntong Wang, Haoyue Zhao, guanghui Pan, Xiyuan Wang, Yanbo Wang, Qiyan Deng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学校) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SAGE通过自演化机制和图记忆引擎提升长期记忆能力,在多跳问答、开放领域检索等任务中表现出色,显著提高了证据恢复和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11963 2026-05-13 cs.CV 57%

What Does It Mean for a Medical AI System to Be Right?

医疗人工智能系统正确意味着什么?

Antony Gitau

机构 * University of South-Eastern Norway(南欧大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文探讨医疗AI系统正确性的多维概念,涉及数据标注、模型解释、临床指标和责任分配,挑战单一基准性能的定义。

Comments Part of a PhD ethics course

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11910 2026-05-13 cs.AI 57%

Rethinking Positional Encoding for Neural Vehicle Routing

重新思考神经车辆路径问题中的位置编码

Chuanbo Hua, Federico Berto, Andre Hottung, Nayeli Gast Zepeda, Yining Ma, Zihan Ma, Paula Wong-Chung, Changhyun Kwon, Cathy Wu, Kevin Tierney, Jinkyoo Park

机构 * KAIST(韩国科学技术院) Radical Numerics Bielefeld University(比勒菲尔德大学) University of Vienna(维也纳大学) MIT(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文针对车辆路径问题中位置编码的不足,提出一种层次化各向异性位置编码,结合几何基础原理,通过分析多种PE方法,证明几何引导的PE在不同问题变体和模型架构中均表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06719 2026-05-13 cs.CR cs.CL cs.LG 57%

Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)

差分隐私合成文本生成用于检索增强生成(RAG)

Junki Mori, Kazuya Kakizaki, Taiki Miyagawa, Jun Sakuma

机构 * NEC Corporation(日本电报电话公司) Institute of Science Tokyo(东京科学研究院) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出DP-SynRAG框架,通过生成差分隐私合成RAG数据库提升隐私保护下的RAG性能,避免重复噪声注入并保持固定隐私预算。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11807 2026-05-13 cs.AI 57%

Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation

为何用户前往那里:世界知识增强的生成性下一个兴趣点推荐

Qiuyu Ding, Heng-Da Xu, Wei Zhang, Dongyi Lv, Changda Xia, Feng Xiong, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AWARE模型,通过LLM代理生成时空感知的上下文叙述,结合用户行为增强世界知识,提升POI推荐效果,实验证明其优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12923 2026-05-13 cs.CV 57%

Pi-HOC: Pairwise 3D Human-Object Contact Estimation

Pi-HOC:成对3D人体-物体接触估计

Sravan Chittupalli, Ayush Jain, Dong Huang

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) National Robotics Engineering Center(国家机器人工程中心)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出Pi-HOC,一种单次传递的实例感知框架,用于密集预测所有人体-物体对的3D语义接触。该方法通过实例检测、创建专用的人-物体令牌并利用交互形式进行细化,结合基于SAM的解码器预测接触,提升了准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11810 2026-05-13 cs.DL cs.AI 57%

Evolving Roles of LLMs in Scientific Innovation: Assistant, Collaborator, Scientist, and Evaluator

大语言模型在科学创新中的演变角色:助手、合作者、科学家和评估者

Haoxuan Zhang, Ruochi Li, Yang Zhang, Ting Xiao, Jiangping Chen, Junhua Ding, Haihua Chen

机构 * Department of Information Science, University of North Texas(北卡罗来纳州立大学信息科学系) Department of Computer Science, North Carolina State University(北卡罗来纳州立大学计算机科学系) Department of Data Science, University of North Texas(得克萨斯大学数据科学系) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出四角色框架,区分研究支持与前沿发现,分析各角色方法、基准和评估实践,强调AI科学进步需兼顾模型能力与评估、监督、责任及机构整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12059 2026-05-13 cs.HC cs.RO 50%

RoboBlockly Studio: Conversational Block Programming with Embodied Robot Feedback for Computational Thinking

RoboBlockly Studio:具有身体反馈的对话式积木编程用于计算思维

Leyi Li, Chenyu Du, Jiafei Sun, Erick Purwanto, Qing Zhang

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RoboBlockly Studio,结合积木编程、对话AI教学代理和具身机器人执行,通过迭代循环提升学生计算思维能力,探讨AI与机器人在教育中的应用。

Comments Accepted to ACM DIS 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11993 2026-05-13 cs.CL 50%

Towards Visually-Guided Movie Subtitle Translation for Indic Languages

面向视觉引导的电影字幕翻译:用于印地语等语言

Tarun Chintada, Kshetrimayum Boynao Singh, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了视觉引导的电影字幕翻译,针对低资源印地语等语言,提出两种轻量视觉锚定策略,发现时间错位是长视频的主要障碍,而选择性视觉锚定能有效提升翻译质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11874 2026-05-13 cs.IR 50%

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems

RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试

Wenwen Zeng, Jinhui Zhang, Hao Chen, Zhaoyu Hu, Yongqi Liang, Jiajun Chai, Dengcan Liu, Zhenfeng Liu, Shurui Yan, Minglong Xue, Xiaohan Wang, Wei Lin, Guojun Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11796 2026-05-13 cs.LO 50%

On Knowledge Compilation For Two-Variable First-Order Logic

关于为二变量一阶逻辑进行知识编译

Qiaolan Meng, Juhua Pu, Hongting Niu, Yuyi Wang, Yuanhong Wang, Ondřej Kuželka

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究二变量一阶逻辑命题的地面化理论在DNNF基知识编译语言中的紧凑表示可能性及高效构建方法,证明一般情况下无法紧凑编译,并提出两阶段编译器利用命题地面化中的对称性,提升效率。

Comments 37 pages and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏