arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2607.17417 2026-07-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 新提交 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15847 2026-07-20 cs.CL cs.AI 新提交 57%

CAMMAR: Culture-Aware Matryoshka for Metaphorical Arabic Representations

CAMMAR:用于隐喻阿拉伯语表示的文化感知套娃

Suzan Awinat, Alfonso Ortega del Puente

机构 * Autonomous University of Madrid (UAM)(马德里自治大学) IE University(IE大学) Oviedo University(奥维耶多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对阿拉伯语语言模型语义模糊问题,提出CAMMAR框架,通过分阶段语义课程组织意义到嵌套子空间,基于词汇与隐喻表示距离产生隐喻性几何度量,在新数据集上评估,有监督时检测隐喻效果好,还发现基于形态学词根有提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15717 2026-07-20 cs.CV cs.GR 新提交 57%

Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance

通过动作单元和动作检测引导实现文本到运动的逐笔画时间控制

Euijun Jung, Youngki Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究文本到运动模型中笔画落点时间不可靠问题,引入动作单元,通过轻量级门控适配器构建主干并利用无训练分类器梯度消除误差,在StrokeBench上测量,提高了正确放置单个笔画比率,核心帧成为可控轴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 57%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15331 2026-07-20 cs.CV 新提交 57%

Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark

广义少样本基准上的无训练开放词汇3D点云分割

Silas kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究广义少样本3D点云分割问题,提出无训练方法,用冻结的3D视觉语言模型与概念分割器,通过跨视图一致性协调,在ScanNet200和ScanNet++基准上提升新类mIoU,且无需少样本支持,效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14547 2026-07-17 cs.CV 新提交 57%

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

AdaTurn:用于主动视觉感知智能体的预算感知测试时缩放

Susan Liang, Chao Huang, Filippos Bellos, Jing Bi, Jason J Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Univeristy of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究主动视觉感知智能体在不同预算下的任务执行问题,提出AdaTurn框架,通过强制答案DAPO等组件,根据预算调整智能体行为,提高低预算准确率,且能有效转移到多基准测试中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14314 2026-07-17 cs.LG 新提交 57%

NeuroGRIP: Retrieval-Augmented Graph Refinement for Knowledge-Grounded EEG Seizure Diagnosis

NeuroGRIP:用于基于知识的脑电图癫痫诊断的检索增强图细化

Lincan Li, Zheng Chen, Yushun Dong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究针对脑电图癫痫诊断难题,提出NeuroGRIP框架,结合外部医学知识校准脑电图图。通过构建知识库、利用大语言模型提取知识图,经对齐感知查询和相似性搜索检索关系证据,提升诊断准确性与可解释性,为临床诊断提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 57%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13621 2026-07-16 cs.AI 新提交 57%

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

UESF-Bench:统一的具身寻找与跟随的基准测试与探究

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Qilu University of Technology(齐鲁工业大学) Xiaomi Inc(小米公司) Beijing University Of Technology(北京工业大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13432 2026-07-16 cs.LG 新提交 57%

Local Redundancy: An Information-Theoretic Measure of Plasticity from Synthetic Memorization

局部冗余:一种基于合成记忆的可塑性信息论度量

Jiaxuan Cheng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究神经网络可塑性度量,引入基于通用压缩理论的局部冗余,将其定义为局部模型族最坏情况冗余,证明期望平方梯度范数可作下界,实验表明该度量比现有方法更能预测下游性能并助于预训练检查点选择。

Comments 13 pages, 7 figures. ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13361 2026-07-16 cs.CV 新提交 57%

Detector Confidence Signals Presence Rather Than Occlusion in Cluttered Manipulation

检测器在杂乱操作中检测的是物体存在而非遮挡

Yuanzhi He

机构 * School of Computer Science & Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究开放词汇检测器在物体被遮挡时的表现,通过与几何分割预言机配对审核其对遮挡的反映,发现其置信度与可见性无关,会误判,基于置信度的指标和门控有问题,还将效应与校准错误等联系起来并给出建议。

Comments 12 pages, 3 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交 57%

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 57%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 57%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11039 2026-07-14 cs.HC cs.AI 新提交 57%

Same Stories, Different Journeys: From Social Comparison to Sensemaking in AI-Mediated Peer Career Exploration

相同的故事,不同的旅程:从社交媒体比较到人工智能介导的同伴职业探索中的意义建构

Pengping Tan, Baoquan Zhao, Zhenhui Peng

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对年轻求职者在社交媒体职业探索时被动浏览的问题,开发JobMate交互式系统,将真实帖子转化为对话式AI代理,通过对比研究发现其能引导社会比较转向建设性自我重构并促进意义建构,还探讨了相关AI系统设计启示。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10802 2026-07-14 cs.CY cs.LG 新提交 57%

Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis

Q学习实验室:通过学习者生成的轨迹分析教授强化学习

Ekkachai Jueng

机构 * Computer Science Program Faculty of Sciences and Liberal Arts Rajamangala University of Technology Isan(计算机科学系 法学院及文科院 瑞亚玛芒拉大学技术学院伊桑)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 该研究提出Q学习实验室工具,通过学习者生成的轨迹分析教授表格Q学习。工具具可视化及记录功能,核心是学习-导出-分析循环。通过三项评估验证工具,还与现有工具比较、阐述教学法基础并提供教案,工具和代码公开。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10187 2026-07-14 cs.LG cs.SE 新提交 57%

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

知识条件下的可执行Unity游戏场景单遍大语言模型合成:26个目标可玩概念的编译器错误普查

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究大语言模型为Unity游戏场景编写代码,去除迭代修复循环进行单遍生成评估,通过对多个模型、模式等生成的代码分析编译器错误,发现瓶颈是缺少引擎特定知识,按需求对目标模式排序展示单遍生成断点。

Comments Substantially reframed and extended version of arXiv:2603.07101, with new experiments, figures, and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10069 2026-07-14 cs.AI 新提交 57%

From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

从模糊话语到受控重用类:规范化、商不变性和条件可判定性

Cosimo Spera, Ray Garcia

机构 * Minerva CQ (Bourbaki Intelligent Systems, Inc.)(密涅瓦CQ(布尔巴基智能系统公司))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究在受控领域改变语义缓存中答案重用对象,基于已解决对话需求的数学特征商。通过三个关系形成细化链,使管道输出不变,明确重用商,阐述支持层强度,包括多种特性及可计算性、可接受性等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 57%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09709 2026-07-14 cs.AI cs.SE 新提交 57%

The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

验证器即课程:用于跨家族游戏生成的执行门控自蒸馏

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09191 2026-07-13 cs.RO cs.LG 新提交 57%

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作

Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09135 2026-07-13 cs.CV 新提交 57%

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy

超级通才:通过通才-专才协同实现全面准确的医学图像理解

Shaoteng Zhang, Weiwei Cao, Wanxing Chang, Yutong Xie, Kai Cao, Zaiyi Liu, Yu Shi, Tingbo Liang, Qi Zhang, Ling Zhang, Yong Xia, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) Department of Radiology, Ningbo No. 2 Hospital(宁波市第二医院放射科) Department of Radiology, Guangdong Provincial People’s Hospital(广东省人民医院放射科) Department of Radiology, Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所放射科) Department of Radiology, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院放射科) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究旨在通过通才-专才协同实现全面准确的医学图像理解。提出SuG框架,整合多分割专家空间先验进行视觉-语言对齐,利用病变掩码校准注意力。在多CT基准测试中评估,其在疾病诊断任务中性能领先,超越专才模型,有强大病变定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06993 2026-07-13 cs.AI 新提交 57%

Large Behavior Model: A Promptable Digital Twin of the Retail Customer

大型行为模型:零售客户的可提示数字孪生体

Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC), Amity AI Holdings Co., Ltd.(友好研究与应用中心(ARAC),友好人工智能控股有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究旨在解决客户行为建模问题,提出大型行为模型(LBM),通过统一公式从零售交易学习客户决策,经多种训练方式优化。该模型在多任务中表现出色,消融研究揭示各因素作用,为客户数字孪生体和行为模拟提供可扩展基础。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03198 2026-07-13 cs.LG math-ph math.MP 新提交 57%

Reduced-Order Models: The Mother of World Models

降阶模型:世界模型之母

Rajat Ghosh

机构 * Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 探讨世界模型的功能结构早于现代自监督学习,在模型降阶和控制文献中就已独立发展。追溯其在三个领域的发展,对比传统降阶模型与学习型世界模型的优缺点,指出在关键系统中部署世界模型的障碍及统一两者的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 57%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08288 2026-07-10 cs.CR cs.AI 新提交 57%

From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure

从遗留文档到OSCAL:基于MCP的代理管道,用于关键基础设施中的威胁情报驱动的持续合规性

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对关键基础设施运营技术环境无法主动扫描但需主动系统反馈的问题,提出基于MCP的多代理管道,将自然语言描述转换为知识图谱和OSCAL工件,架构解耦推理与检索,降低风险,在场景中取得一定召回率并生成报告,虽有错误但可人工审查。

Comments Accepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08268 2026-07-10 cs.AI cs.CL 新提交 57%

Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment

不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏

Vinay Kumar Chaganti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。

Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 57%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07676 2026-07-09 cs.AI 新提交 57%

SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents

SkillCenter:用于自主人工智能代理的大规模源基础技能库

Tianming Sha, Yue Zhao, Lichao Sun, Yushun Dong

机构 * Stony Brook University(纽约州立大学石溪分校) University of Southern California(南加州大学) Lehigh University(里海大学) Florida State University(佛罗里达州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对自主AI代理缺乏扎实操作知识的问题,构建SkillCenter技能库,通过多源获取等端到端框架,集成大量源基础和社区技能,实现技能可追溯,以保障代理输出的正确性、安全性和可维护性。

Comments 44 pages, 5 figures. Code: https://github.com/LabRAI/SkillCenter ; Data: https://huggingface.co/datasets/Tommysha/skillcenter-bundles

详情

展开后加载摘要…

URL PDF HTML 收藏