arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2607.07216 2026-07-09 cs.CV 新提交 57%

Why Fake ? Unveiling the Semantic Vocabulary of Deepfake Detectors

为何造假?揭示深度伪造检测器的语义词汇

Vazgken Vanian, Alexandros Doumanoglou, Dimitris Zarpalas

机构 * Information Technologies Institute (ITI) Centre For Research and Technology HELLAS (CERTH)(信息技术研究所(ITI)希腊研究与技术中心(CERTH))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究深度伪造检测,用编码-解码方向对技术分析黑箱检测器决策过程,揭示训练中隐含的真假特征,实现全局模型理解、空间感知概念定位和反事实分析,助于深入理解检测策略。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07192 2026-07-09 cs.CV 新提交 57%

Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection

用于未知域目标检测的原型锚定广义流形回归

Zihao Zhang, Aming Wu, Yang Li, Yahong Han

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 研究单域广义目标检测,提出MR-DCoT方法,通过视觉-文本双思维链生成离群示例,利用类特定原型锚定学习校正算子,将未知域泛化建模为流形回归问题,实验验证了该方法在多场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 57%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 57%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05253 2026-07-08 cs.CV 新提交 57%

Repurposing CLIP to Localize at Pixel Level

复用CLIP实现像素级定位

Jiaxiang Fang, Shiqiang Ma, Jing Wang, Siyu Chen, Fei Guo, Shengfeng He

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Advanced Technology Center Beijing AI Laboratory(北京人工智能先进技术中心) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对CLIP全局特征偏差导致难以适配像素级预测的问题,提出CLIPix框架,结合抗噪校正与定位嵌入策略,保留CLIP泛化性,在PASCAL、COCO上取得最优像素级定位性能。

Comments Accepted by IEEE TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 57%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04907 2026-07-07 cs.AI 新提交 57%

Medi-Gemma: A Hybrid Clinical Decision Support System Integrating Deterministic EMR Analytics and Retrieval-Augmented Generation

Medi-Gemma:一种集成确定性电子病历分析与检索增强生成的混合临床决策支持系统

Mohammed Saim Ahmed Quadri, Yunzhe Xue, Justin W. Ady, Usman Roshan

机构 * New Jersey Institute of Technology(新泽西理工学院) Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍用于伤口病理分类和工作流程自动化的临床决策支持系统Medi-Gemma,其采用解耦框架,经多阶段管道处理数据请求,关键贡献是地面真值注入模块,验证表明该架构有诸多优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交 57%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 57%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 57%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04156 2026-07-07 cs.AI cs.SC 新提交 57%

Language models guide symbolic equation discovery by controlling search

语言模型通过控制搜索来指导符号方程发现

Zikai Xie, Wenmei Li, Man Luo, Jun Jiang, Linjiang Chen

机构 * State Key Laboratory of Precision and Intelligent Chemistry, Hefei National Research Center for Physical Sciences at the Microscale, School of Chemistry and Materials Science, University of Science and Technology of China(精确与智能化学国家重点实验室,合肥微尺度物理科学国家研究中心,化学与材料科学学院,中国科学技术大学) Center for Scientific Intelligence Innovation, Hefei, China(智能创新研究中心,合肥,中国) School of Chemistry, School of Computer Science, University of Birmingham(化学系,计算机科学学院,伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究科学方程发现,对比语言模型不同角色设定,提出语言模型作搜索控制器的方式(LLM-PySR),经实验其在多任务中平衡了准确率、复杂度等,还发现新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03990 2026-07-07 cs.CV 新提交 57%

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

InSpace:从单张360°图像生成具有结构感知的3D室内场景

Gwanhyeong Koo, Hyunsu Kim, Youngji Kim, Taejae Lee, Siwoo Lim, Sunjae Yoon, Suyong Yeon, Chang D. Yoo

机构 * KAIST(韩国科学技术院) NAVER LABS(NAVER实验室) Chung-Ang University(中央大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对单图像到3D生成扩展到室内场景有挑战的问题,提出InSpace框架,利用360°图像,经估计部分场景几何、生成粗结构、产生详细布局和资产几何三阶段,还建数据集,实验表明其性能强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03853 2026-07-07 cs.CV 新提交 57%

CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation

CogRad:一种用于放射学报告生成的受认知启发的多智能体框架

Saif Ur Rehman Khan, Hasaan Maqsood, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Intelligentx GmbH(智能X有限公司) Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(大阪城市大学信息科学研究生院核心信息学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出受认知启发的多智能体框架CogRad,围绕放射科医生阅读过程的四个阶段构建报告生成,通过多智能体协作提升报告质量,在多个数据集上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03516 2026-07-07 cs.SE cs.AI cs.CY 新提交 57%

AGL-1: The Enterprise AI Governance Layer as a Control Plane for Trusted Enterprise Intelligence

AGL-1:作为可信企业智能控制平面的企业人工智能治理层

Roopam W. Sure

机构 * Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究企业人工智能从实验走向运营面临的治理挑战,介绍AGL-1企业人工智能治理层这一参考模型,基于相关原则将治理问题从检索控制扩展到全执行路径治理,定义七个治理领域。

Comments 16 pages, 1 figure; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03245 2026-07-07 cs.LG 新提交 57%

PhenoNEST: A Neuro-Symbolic Framework for Ontology-Aware Multimodal Plant Phenotyping and Trait Discovery

PhenoNEST:用于本体感知多模态植物表型分析和性状发现的神经符号框架

Jayant Ghadge, Soumyashree Kar, Surya S. Durbha

机构 * Centre of Studies in Resources Engineering (CSRE)(资源工程研究中心) Indian Institute of Technology Bombay(孟买印度理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

AI总结 提出构建多模态粒状知识图谱框架,以弥合语义鸿沟,通过蒸馏野外记录提取实体和关系,结合模型与本体对齐,经视觉语言模型生成软图,引入节点连接多模态子图,成功映射野外观察,助力小麦育种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02912 2026-07-07 cs.CV cs.HC cs.MM 新提交 57%

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition

看见情感:用于脑电图情感识别的面部表情符号代理建模

Jingjing Hu, Guo Dan, Haofan Cheng, Ying Zeng, Zhan Si, Jinxing Zhou, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) PLA Information Engineering University(中国人民解放军信息工程大学) University of Science and Technology of China(中国科学技术大学) MBZUAI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02719 2026-07-07 cs.CV 新提交 57%

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

GRCD:用于多发现胸部X光对的地面区域变化检测

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 57%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交 57%

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03513 2026-07-07 physics.chem-ph cs.LG 新提交 57%

AquaGen: Scaling generative models to molecular dynamics precision on thousands of atoms

AquaGen:将生成模型扩展到数千个原子的分子动力学精度

Emmanuel Bengio, Sanjeev Raja, Yui Tik Pang, Kerstin Klaeser, Cristian Gabellini, Nikhil Shenoy, Francesco Di Giovanni, Prudencio Tossou

机构 * Valence Labs(Valence实验室) UC Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 介绍AquaGen,首个全原子、显式溶剂、周期边界条件感知生成模型,以低成本从玻尔兹曼分布生成分子构型,用于后处理和预测相关属性,在绝对水合自由能预测上展示效用。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02024 2026-07-03 cs.CV 新提交 57%

Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval

细粒度放射学报告检索的时空与临床条件化

P. Sloan, E. Simpson, M. Mirmehdi

机构 * Department of Computer Science University of Bristol(计算机科学系 布里斯托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出STAR3框架,通过区域级解剖信息与临床指征及纵向变化对齐,实现基于检索的放射学报告生成,在MIMIC-CXR上优于现有方法。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01256 2026-07-03 cs.CY cs.AI 新提交 57%

AI Assistance for Human Review of Default Judgments

AI辅助人类审查缺席判决

Theodora Worledge, Othman Bensouda Koraichi, Daniel Bernal, Aviv Caspi, Tatsunori Hashimoto, Carlos Guestrin, David Freeman Engstrom

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Law School(斯坦福法学院) University of Chicago Law School(芝加哥大学法学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对美国法院每年审查数百万份缺席判决耗时且易错的问题,本文提出Default Assistant,利用大语言模型评估案件法律要求并提供引用建议。实验表明,AI辅助使审查准确率提高6.0%,速度提高25.9%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00828 2026-07-02 cs.DB cs.AI 新提交 57%

Exploring the Semantic Gap in Agentic Data Systems: A Formative Study of Operationalization Failures in Analytical Workflows

探索智能体数据系统中的语义鸿沟:分析工作流中操作化失败的形成性研究

Jalal Mahmud, Eser Kandogan

机构 * Megagon Labs(Megagon实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究通过跨领域分析236个分析意图,识别出153种反复出现的操作化失败,归纳为五类语义鸿沟,揭示用户分析概念与系统可用信息之间的差距,并提出未来智能体数据系统需要更丰富的语义表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00500 2026-07-02 physics.med-ph cs.CV 新提交 57%

Closed-loop coupling of personalised and foundation models for real-time treatment guidance with MRI

个性化模型与基础模型的闭环耦合用于MRI实时治疗引导

James Grover, Emily A. Hewson, Andrew Phair, Michael Ferraro, Hilary L. Byrne, Paul Keall, Michael G. Jameson, David E. J. Waddington

机构 * Image X Institute, Sydney School of Health Sciences, Faculty of Medicine and Health, The University of Sydney, Sydney, Australia(悉尼大学医学与健康学院悉尼健康科学学院Image X研究所,悉尼,澳大利亚) GenesisCare, Sydney, Australia(GenesisCare,悉尼,澳大利亚) School of Clinical Medicine, Medicine & Health, University of New South Wales, Sydney, Australia(新南威尔士大学医学与健康学院临床医学系,悉尼,澳大利亚) Centre for Medical Radiation Physics, School of Mathematics and Physics, University of Wollongong, Wollongong, Australia(伍伦贡大学数学与物理学院医学辐射物理中心,伍伦贡,澳大利亚)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出一种闭环耦合框架,结合个性化时间预测模型与基础模型的连续分割解剖解释,实时补偿MRI引导治疗中的成像延迟,在400毫秒预测范围内改善解剖预测并减少剂量误差。

Comments 18 pages, 8 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 57%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 57%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 57%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26907 2026-06-29 cs.CV 新提交 57%

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Qwen-Image-Agent:弥合真实世界图像生成中的上下文差距

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

机构 * Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(Qwen-Image-Agent:弥合现实世界图像生成中的上下文缺口)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出Qwen-Image-Agent框架,通过上下文感知规划和上下文接地,整合规划、推理、搜索、记忆和反馈,弥合用户上下文与生成上下文之间的差距,在IA-Bench等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 57%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏