arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2607.14548 2026-07-17 cs.CV 新提交 50%

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

HyMobileAgent:用于高效GUI代理的数据-环境协同扩展

Hy Vision Team, Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, Chengquan Zhang

机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13674 2026-07-16 cs.CV cs.RO 新提交 50%

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching

WAVE-Stereo:用于立体匹配的扭曲对齐体素编码

Zehan Liu, Yage He, Xianwu Gong

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究提出WAVE-Stereo立体匹配方法,基于相关体与特征扭曲互补线索,通过地理扭曲对应编码器并行编码多信息,用周期性全局上下文传播减轻无纹理区匹配退化,在多基准测试中实现精度与效率良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12371 2026-07-15 econ.TH 新提交 50%

First They Came for the Others: A Theory of Divide-and-Conquer

首先他们针对其他人:分而治之理论

Yeon-Koo Che, Jinyuqi Huang, Wooyoung Lim

专题命中 效率与部署 :prompting(abstract)

AI总结 研究分而治之策略成功原因,源于对攻击者意图的认知摩擦,通过分析攻击成本、受害者命运相关性等因素,揭示其分化机制,并探讨行为反应等如何影响对攻击意图的推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12557 2026-07-15 cs.CV 新提交 50%

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

用于长视频理解中事件感知视觉分配的高斯混合模型

Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu

机构 * Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(中国科学院自动化所多模态信息超智能安全北京市重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hello Group(未知(保留英文)) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 效率与部署 :language model(abstract)

AI总结 针对长视频理解中视觉分配问题,提出GMM-EVA方法,利用高斯混合模型建模事件级结构,采用差异化分配策略,在多个长视频基准实验中显著优于均匀采样,以约一半视觉令牌预算达可比性能,凸显高效性。

Comments accepted at PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交 50%

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12220 2026-07-15 cs.RO 新提交 50%

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12181 2026-07-15 cs.RO cs.HC 新提交 50%

Analysis of Mutual and Referential Human and Robot Gazes in a Collaborative Word Association Game

协作式词语联想游戏中人与机器人相互注视和参照注视的分析

Jens V. Rüppel, Tim Schreiter, Andrey Rudenko, Achim J. Lilienthal

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所 (MIRMI)) Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心 (AASS)) Robotics Insitute Germany (RIG)(德国机器人研究所 (RIG))

专题命中 效率与部署 :LLM(abstract)

AI总结 研究在协作式词语联想游戏中机器人注视对人类视觉注意力的影响及人类是否向机器人寻求确认注视,通过与NAO机器人实验,用多种方式分析互动,发现任务语言方面掩盖注视影响,为相关设计提供见解。

Comments This paper has been accepted as a Late-Breaking Report to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), which will be held in Kitakyushu, Netherlands on August 24-28, 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11086 2026-07-14 cs.CR 新提交 50%

Rethinking MCP Security: A Large-Scale Study of Runtime MCP Servers and Security Scanner Reliability

重新思考MCP安全性:对运行时MCP服务器和安全扫描器可靠性的大规模研究

Pei Chen, Baichao An, Mengying Wu, Binwang Wan, Geng Hong, Jinsong Chen, Xudong Pan, Jiarun Dai, Min Yang

专题命中 效率与部署 :LLM(abstract)

AI总结 研究重新审视MCP安全性衡量方式,通过多智能体框架构建MCPZoo进行大规模测量。发现现有扫描器报告的风险信号不可靠,人工验证抽样警报真阳性率低且扫描器输出不一致。实现对MCP服务器安全性的大规模、可重复测量并揭示扫描局限,还发布公共查询接口。

Comments 18 pages, 11 figures, and 10 tables. This article substantially extends the preliminary 3-page MCPZoo dataset release arXiv:2512.15144. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09701 2026-07-14 cs.RO 新提交 50%

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos

EgoSteer:一个用于从第一人称视角视频实现可控灵巧操作的全栈系统

Yifan Zhong, Zhang Chen, Tianrui Guan, Fanlian Zeng, Yuyao Ye, Tianjia He, Ka Nam Lui, Jiayi Li, Tingrui Zhang, Ruilin Yan, Xinhao Ji, Guangyu Zhao, Wenjie Lou, Jiayuan Zhang, Yuanpei Chen, Yaodong Yang

机构 * Institute for AI, PKU(北京大学人工智能研究院) PKU-PsiBot Joint Lab(北大-灵犀机器人联合实验室) UPenn(宾夕法尼亚大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 针对灵巧手系统因缺乏数据而无可控性的问题,提出全栈系统EgoSteer,集成EgoSmith数据管道等,通过人类数据预训练赋予语言引导操作先验,经机器人后训练强化,能执行多样任务,还开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09149 2026-07-13 cs.DB 新提交 50%

Taxonomy Maintenance In The Wild Over Evolving Scholarly Data: Reliability, Efficiency, and Cost-Effectiveness

在不断演变的学术数据中进行分类法维护:可靠性、效率和成本效益

Daomin Ji, Hui Luo, Zhifeng Bao, Junhao Gan, Zi Huang

专题命中 效率与部署 :LLM(abstract)

AI总结 研究科学出版物增长致学术分类法过时问题,提出GIST框架。该框架基于专家证据归纳结构,集成部分分类法,学习映射,用核心集选择增量更新,结合生成器与检索模块。实验表明GIST性能优且成本低。

Comments The paper has been accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03615 2026-07-13 cs.IR 新提交 50%

The Powerless Noise: How Experimental Settings Shape the Reported Power of Noise

无作用的噪声:实验设置如何塑造报告的噪声能力

Michał Mazuryk, Fleur Dolmans, Louis Gehringer, Ina Klaric, Jia-Huei Ju, Mohammad Aliannejadi

专题命中 效率与部署 :prompting(abstract)

AI总结 研究重现Cuconasu等人关于噪声对检索增强生成系统问答性能影响的发现,在扩展实验设置下评估其稳健性,发现该效应受推理配置影响大,强调审视推理设计的重要性。

Comments SIGIR 26 Repro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08771 2026-07-10 cs.CV 新提交 50%

ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

ZipDepth:在任何设备上随时随地实现轻量级零样本单目深度估计

Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia

机构 * University of Bologna(博洛尼亚大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究单目深度估计难题,提出ZipDepth轻量级网络,结合可重新参数化编码器-解码器与知识蒸馏,在多域训练集训练,参数仅610万,能在多设备实时运行,在五个基准测试中平衡零样本精度与部署效率,向高精度基础模型迈进。

Comments ECCV 2026. Code: https://github.com/fabiotosi92/ZipDepth - Project page: https://zipdepth.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08645 2026-07-10 cs.SD 新提交 50%

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

只需少量即可实现 TANGO:一种用于双耳语音增强的量化分布式模型

Zahra Benslimane, Pierre Chouteau, Martyna Poreba, Fabrice Auzanneau, Michal Szczepanski, Fabian Chersi, Romain Serizel

专题命中 效率与部署 :post-training(abstract)

AI总结 研究基于神经网络的多通道语音增强系统在资源受限设备上的低精度推理,以 TANGO 为对象,评估其神经组件量化方法,利用空间滤波阶段对量化误差的补偿能力简化模型,结合多种技术减小模型大小和计算复杂度并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07606 2026-07-09 cond-mat.mtrl-sci 新提交 50%

MLIP Studio: An Open Platform for Interactive Benchmarking and Atomistic Simulations Using Machine Learning Interatomic Potentials

MLIP Studio:一个使用机器学习原子间势进行交互式基准测试和原子模拟的开放平台

Manas Sharma, Sudeep Punnathanam, Ananth Govind Rajan

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对通用机器学习原子间势实际应用的阻碍,MLIP Studio平台将60多种MLIPs整合到统一界面,实现端到端工作流程,可降低后续DFT优化工作量、进行计算性能基准测试及指导MLIP选择,降低了基础模型在相关领域应用的障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07350 2026-07-09 cs.RO 新提交 50%

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment

迈向可靠的空地车辆协作:用于实地部署的集成规划与自主框架

Md Safwan Mondal, Luca Russo, James D. Humann, James M. Dotterweich, Pranav Bhounsule

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 效率与部署 :language model(abstract)

AI总结 研究针对无人机长时间任务飞行续航受限问题,提出集成规划与自主框架。通过深度强化学习规划器解决协同路由问题,引入标准化API弥合规划与执行差距,还有轻量级重新规划器,经实验验证系统在动态任务中有强大协同导航和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07597 2026-07-09 quant-ph cs.SE cs.SY eess.SY 新提交 50%

Quantum Software Engineering in Practice: FPGA and AI Integration for Quantum Certification

实践中的量子软件工程:用于量子认证的FPGA与人工智能集成

Marcos Guillermo Lammers, José Manuel Suárez, Adrián Pousa, Luis Mariano Bibbó, Alejandro Fernández

专题命中 效率与部署 :LLM(abstract)

AI总结 研究针对量子计算机认证挑战,提出遵循QSE原则的混合认证框架QAccCert,集成FPGA和人工智能技术,通过CHSH不等式在理想量子模拟中实现纠缠认证,经大语言模型引导优化,有效探索参数空间,为实际量子认证提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16106 2026-07-09 cs.PF cs.AR cs.DC 新提交 50%

Edge-Inference Governors Need Memory-Clock State

超越CPU-GPU频率:内存时钟和尾部效应对边缘推理延迟估计的影响

Jaehoon Kang

专题命中 效率与部署 :LLM(abstract)

AI总结 通过测量NVIDIA Jetson Orin Nano,发现内存时钟是缺失的维度、聚合丢失率隐藏突发性、频率切换存在延迟,这些现象超出传统频率感知延迟模型的范围。

Comments 23 pages, 15 figures, 23 tables. Code and data: https://github.com/dankang21/jetson-latency-lab ; traces: https://zenodo.org/records/21236659

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06528 2026-07-08 cs.SI 新提交 50%

Trust-Aware Citation Cartel Ranking in Scholarly Knowledge Graphs

学术知识图谱中的信任感知引用卡特尔排名

Pratyush Gupta, Vikranth Udandarao, Syam Sai Santosh Bandi

专题命中 效率与部署 :LLM(abstract)

AI总结 研究如何在学术知识图谱中对可疑论文级社区排名,提出结合引用图结构与语义引用意图的信任感知管道,计算综合卡特尔指数,经实验验证其有效性,给出可重现的排名框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 50%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 效率与部署 :post-training(abstract)

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06019 2026-07-08 cs.CV 新提交 50%

KOAL: Knowledge-Driven Prostate Cancer Grading with Ordinal-Aware Learning

KOAL:基于序数感知学习的知识驱动前列腺癌分级

Zheng Guo, Jiaqi Cui, Haocheng Xiong, Jize Han, Bo Liu, Qianwen Zhang, Rui Chen, Yan Wang

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) China Mobile (Suzhou) Software Technology Company Limited(中国移动(苏州)软件技术有限公司) Shanghai Changhai Hospital, Naval Medical University(上海长海医院,海军医学大学) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

专题命中 效率与部署 :LLM(abstract)

AI总结 研究利用mpMRI无创预测前列腺癌GGG的问题,提出KOAL框架,含临床上下文调制、知识引导原型对齐和分层序数感知约束三个模块,实验证明该框架优于现有方法,提升了前列腺癌GGG预测准确性。

Comments 10 pages, 2 figures, 2 tables. Accepted at MICCAI 2026. This is the submitted version prior to peer review. The final authenticated version will be available on SpringerLink

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05712 2026-07-08 cs.IR 新提交 50%

Retrieving a Set, Not Independent Passages: Set-Level Compatibility Learning for Efficient Set Exploration

检索一个集合,而非独立段落:用于高效集合探索的集合级兼容性学习

Mooho Song, Jay-Yoon Lee

专题命中 效率与部署 :LLM(abstract)

AI总结 针对多跳问答等任务中证据段落选择问题,提出集合级检索框架,通过查询-集合兼容性评分训练,用ParaSet和SetCE两个评分器实例化,提升了检索性能及下游问答任务性能,且集合级检索器有互补特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05659 2026-07-08 cs.SE 新提交 50%

Agents with Feelings? Personality and Emotion in Multi-Agent Software Teams

有情感的智能体?多智能体软件工程团队中的个性与情感

Yunyan Ding, Thomas Zimmermann, Iftekhar Ahmed

专题命中 效率与部署 :LLM(abstract)

AI总结 研究多智能体软件工程团队中个性和情绪特征对团队绩效的影响,采用结合多种因素的心理学框架,通过对78种团队配置评估发现配置显著影响性能、协作及成本,表明智能体配置是重要设计维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 50%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-07-07 eess.IV eess.SP 新提交 50%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03643 2026-07-07 eess.IV cs.CV 新提交 50%

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis

模型置信度引导的多图像融合眼底图像糖尿病视网膜病变诊断方法

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

机构 * Massachusetts Institute of Technology(麻省理工学院) Wilmer Eye Institute, Department of Ophthalmology, Johns Hopkins University(约翰霍普金斯大学威尔默眼科研究所) Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Bakar Computational Health Sciences Institute, University of California San Francisco(加州大学旧金山分校巴卡计算健康科学研究所) Department of Ophthalmology, University of California San Francisco(加州大学旧金山分校眼科系) Division of Clinical Informatics and Digital Transformation, University of California San Francisco(加州大学旧金山分校临床信息学与数字化转型 division)

专题命中 效率与部署 :prompting(abstract)

AI总结 针对资源有限地区糖网病早期筛查需求,提出置信度引导的多图像融合框架,整合多眼底视图提升诊断置信度与准确率,性能优于传统图像质量级联流水线,适配低延迟移动筛查场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04461 2026-07-07 cs.CV 新提交 50%

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Flash-BoN:扩散模型推理时缩放的即时草稿

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

机构 * University of Maryland, College Park(美国马里兰大学帕克分校) Hugging Face(拥抱脸)

专题命中 效率与部署 :post-training(abstract)

AI总结 研究文本到图像生成推理时缩放,对比简单BoN与引导搜索方法,发现简单BoN在实际评估中表现良好。提出Flash-BoN,结合多种加速方法生成草稿候选,经多阶段验证选最有潜力的优化,在多基准和模型规模下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04057 2026-07-07 cs.CV cs.RO 新提交 50%

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

PreSIST:开放世界场景中视觉-语言信息的对象持久性预测

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) National Science Foundation(美国国家科学基金会) ARO(美国陆军研究办公室) Amazon(亚马逊公司) JP Morgan(摩根大通公司)

专题命中 效率与部署 :language model(abstract)

AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03754 2026-07-07 cs.CV 新提交 50%

Exploring SAM Supervision for Fine-Grained UAV Target Segmentation under Data Scarcity

探索数据稀缺下用于细粒度无人机目标分割的SAM监督

Le-Anh Tran

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究数据稀缺下无人机目标分割难题,探索用SAM3作伪标签生成器训练紧凑分割网络,提出两阶段框架,经实验验证其能在分割精度和计算效率间平衡,凸显大模型作标注源的潜力。

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03728 2026-07-07 cs.CE 新提交 50%

The Objective Decides: When a Learned Dynamics Model Uses a Conserved Quantity

目标决定一切:学习到的动力学模型何时使用守恒量

Chih-Ting Liao, Xin Cao

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究表明从学习动力学模型激活中恢复守恒量的线性探测推断不可靠。通过多系统及模型验证,发现能量等不变量线性可解码但对预测无因果作用,目标决定其是否有因果负载,还给出衡量方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03390 2026-07-07 cs.CV cs.GR 新提交 50%

TemporalGS: Training-Free Plug-and-Play Acceleration for 3D Gaussian Splatting Rendering via Temporal Priors

TemporalGS:通过时间先验实现无训练即插即用的3D高斯点渲染加速

Yuhongze Zhou, Zihao Yang, Xinxin Zuo, Juwei Lu

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 研究针对3D高斯点渲染在高帧率和低延迟方面的挑战,提出TemporalGS,利用时间先验减少连续帧高斯预处理等操作冗余,有动态剔除和选择性渲染策略,可加速渲染且无需训练。

详情

展开后加载摘要…

URL PDF HTML 收藏