arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2607.03223 2026-07-07 cs.SE 新提交 50%

Round-Trip Mutation Testing: Translating Code to Natural Language Intent and back

往返变异测试:将代码转换为自然语言意图并返回

Asma Hamidi, Cedric Richter, Ahmed Khanfir, Mike Papadakis

专题命中 效率与部署 :LLM(abstract)

AI总结 提出往返变异测试,利用大语言模型在程序代码和意图间的生成能力,通过预测意图生成变异体,还可人工制造错误翻译产生变异体,评估显示其能产生多样变异体,检测传统方法未揭示的错误。

Comments 2026 IEEE International Conference on Software Testing, Verification and Validation Workshops (ICSTW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03048 2026-07-07 cs.SE 新提交 50%

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解

Xiaonan Xu, Wenjing Wu

专题命中 效率与部署 :language model(abstract)

AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。

Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02942 2026-07-07 cs.DC cs.MA 新提交 50%

A Workflow-Aware Serving Layer for Agentic Applications

用于智能应用的工作流感知服务层

Jiayi Qian, Zishen Wan, Hanchen Yang, Chun Tao, Souvik Kundu, Tushar Krishna

专题命中 效率与部署 :LLM(abstract)

AI总结 研究智能AI应用工作流,其介于现有两层之间。提出Dyserve工作流感知服务层填补空白,通过整数线性规划在异构后端池编译节点模型和验证器选择,还可在不同压力水平预求解并动态调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02882 2026-07-07 cs.SE 新提交 50%

Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference

通过符号推理实现诊断驱动的智能工作流自动修复

Xuyan Ma, Yawen Wang, Junjie Wang, Xiaofei Xie, Boyu Wu, Mingyang Li, Dandan Wang, Qing Wang

专题命中 效率与部署 :LLM(abstract)

AI总结 针对智能工作流可靠性挑战,提出FlowFixer框架,通过将执行转化为符号跟踪、符号推理得行为规范,经规范验证进行故障归因与根因分析,生成修复补丁,还采用预执行评估降成本,实验证明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02471 2026-07-03 cs.CV 新提交 50%

Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment

面向解译的云去除:基于观测锚定残差流与地理上下文对齐

Ziyao Wang, Maonan Wang, Yucheng He, Xianping Ma, Ziyi Wang, Hongyang Zhang, Yirong Cheng, Man-on Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shanghai Ai Lab(上海人工智能实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出GACR框架,通过观测锚定残差流(OAR-Flow)将云去除重构为物理残差反演,结合地理上下文先验对齐(GCPA)保持语义结构,在六个数据集和十二个下游任务中验证了重建质量和下游精度提升。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交 50%

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01518 2026-07-03 cs.CR cs.RO 新提交 50%

Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems

基于LVLM的机器人系统中的过度思考触发慢速攻击

Qiang Han, Jie Wu, Bo Chen

专题命中 效率与部署 :language model(abstract)

AI总结 研究利用LVLM的过度思考行为,通过嵌入场景文本触发推理延迟,提出三阶段框架发现可迁移触发词,实验显示最高6.96倍延迟放大。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01468 2026-07-03 cs.DB 新提交 50%

CADENZA in Action: Breaking the Monolith with Intent-Dependent Plan Spaces for Semantic Queries

CADENZA 在行动:通过意图依赖的计划空间打破语义查询的单一架构

Jaehyun Ha, Yongjoo Park, Wook-Shin Han

专题命中 效率与部署 :LLM(abstract_cn)

AI总结 提出CADENZA语义算子优化器,将意图分解为步骤并选择物理实现,根据用户偏好调优参数,平衡质量、延迟和成本。

Journal ref VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00780 2026-07-03 cs.CV 新提交 50%

SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

SpiralFovea: 输入自适应的中央凹令牌化作为资源自适应推理的第三杠杆

Kyan Mahajan, Mohammad Saqlain

专题命中 效率与部署 :foundation model(abstract)

AI总结 SpiralFovea提出输入自适应令牌化方法,根据局部视觉熵动态选择令牌的身份、位置、尺度和数量,在细粒度分类任务中以60%更少令牌提升准确率1.7-2.1个百分点,并降低84%自注意力计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00829 2026-07-02 cs.CV 新提交 50%

Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns

缝合嵌入:3D服装与2D纸样的统一潜在空间

Andrea Sanchietti, Riccardo Marin, Bharat Lal Bhatnagar, Yuanlu Xu, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Meta

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出首个无需模拟的框架Stitched Embeddings,通过BoxMesh中间表示在统一双向潜在空间中实现3D服装重建与2D纸样推断,达到高精度高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00379 2026-07-02 cs.IR cs.CV 新提交 50%

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31954 2026-07-01 stat.ME 新提交 50%

A Conformal Selection Framework for Individual Treatment Beneficiaries with Auxiliary External Data

一个带有辅助外部数据的个体治疗受益者共形选择框架

Jiajun Liu, Ke Zhu, Xiaofei Wang

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出一个模型无关的共形推断框架,将基于CATE的治疗受益选择转化为多重检验问题,通过共形p值和Benjamini-Hochberg程序控制FDR,并利用外部数据提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31958 2026-07-01 cs.RO 新提交 50%

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

基于语义强化学习的通用机器人策略自适应

Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine

机构 * U.C. Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出语义动作强化学习(SARL),通过在线交互优化语言提示空间,利用通用策略的预训练技能解决复杂长时任务,显著优于现有方法。

Comments Website: https://semantic-action-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31517 2026-07-01 cs.IR cs.CV 新提交 50%

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31497 2026-07-01 cs.RO 新提交 50%

Communication-Aware Robot Execution for Cloud Inference under Spatially Heterogeneous Connectivity

面向空间异构连接性的云推理通信感知机器人执行

Fengkai Liu, Yuichi Ohsita, Masayuki Murata, Hideyuki Shimonishi

机构 * Graduate School of Information Science and Technology, The University of Osaka(大阪大学信息科学与技术研究生院) D3 Center, The University of Osaka(大阪大学D3中心)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对云推理中空间异构连接性导致执行脆弱的问题,提出请求-响应窗口框架,将下一请求点作为运动决策,选择通信质量足够的位置提交请求并保留响应检索机会,实验表明该方法在任务成功率、请求次数和失败率上均优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31160 2026-07-01 cs.CV 新提交 50%

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

面向自动驾驶中高效视觉-语言-动作模型的推理感知推测解码

Anh Dung Dinh, Simon Khan, Flora Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出推理感知推测解码框架,通过例程推理器处理常规推理、审慎推理器处理异常情况,结合FlatRoPE和AARL技术,将推理步骤运行时间降低约4倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交 50%

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交 50%

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27906 2026-06-29 cs.AR 新提交 50%

Phase Matters: Characterizing Heterogeneous Vision-Language Inference on a Mobile SoC

阶段至关重要:移动SoC上异构视觉-语言推理的特征分析

Aryama V Murthy, Yashas N Kotre, Prathmesh Sharma, Pragya Mishra, Sanjith Ganapathi, Priyesh Shukla

专题命中 效率与部署 :language model(abstract)

AI总结 本文通过硬件在环实验,系统表征了移动SoC上VLM推理的阶段性特征,发现NPU执行高度依赖阶段,在预填充阶段加速1.64倍,解码阶段仅1.18倍,视觉编码器加速20-45倍,并展示了四步图重写方法使Phi-3.5-V等编码器获得22倍加速。

Comments 6 pages, 5 figures. Published in MobiSys Workshop '26

Journal ref In Proceedings of the 24th Annual International Conference on Mobile Systems, Applications and Services Workshops (MobiSys Workshop '26), June 21-25, 2026, Cambridge, United Kingdom. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27871 2026-06-29 cs.RO 新提交 50%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 效率与部署 :language model(abstract)

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 50%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19063 2026-06-29 cs.CR 新提交 50%

PYPILINE: Malicious PyPI Package Detection via Suspicious API Knowledge and Agent Workflow

PYPILINE:通过可疑API知识和Agent工作流检测恶意PyPI包

Siyuan Pang, Yepeng Yao, Zhengwei Jiang, Zijing Fan, Haozhe Li, Baoxu Liu

专题命中 效率与部署 :LLM(abstract)

AI总结 提出PYPILINE方法,结合可疑API知识库与Agent工作流,通过静态分析构建知识库并自动检测恶意PyPI包,在精度、召回率和F1分数上显著优于现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25212 2026-06-26 cs.RO 新提交 50%

RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation

RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识

Xincheng He, Rongrong Zhang, Wei Jiang, Wenqiang Xu

机构 * Way-Robotics(Way-机器人)

专题命中 效率与部署 :language model(abstract)

AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交 50%

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22076 2026-06-26 cs.CV 新提交 50%

Learning Cross-View Semantic Priors for Single-Reference Unseen Object Pose Estimation

学习跨视角语义先验用于单参考未见物体姿态估计

Jiahong Chen, Jinghao Wang, Ziwen Wang, Zi Wang, Banglei Guan, Qifeng Yu

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(国防科技大学航空航天科学与工程学院) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出跨视角语义交互(CVSI)和两种训练约束,利用视觉基础模型特征实现单参考未见物体的6D姿态估计,在多个基准上达到最优性能。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25742 2026-06-25 cond-mat.mtrl-sci 新提交 50%

Barocaloric phase transformation from data efficient fine-tuning of machine learned interatomic potentials

基于机器学习原子间势能的数据高效微调实现气压相变

Ludwig Hedin, Johan Klarbring

专题命中 效率与部署 :foundation model(abstract)

AI总结 本研究通过微调MACE-MPA-0基础模型,仅用5-10个DFT构型即可准确模拟硫酸铵的气压相变,显著降低训练数据需求。

Comments 12 pages, 9 figures, submitted to Physical Review Materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18008 2026-06-25 cs.CV 新提交 50%

PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution

PhaseWin:一种用于忠实视觉归因的高效搜索算法

Zihan Gu, Junchi Zhang, Li Liu, Xiaochun Cao, Hua Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出PhaseWin算法,通过分阶段窗口搜索将视觉归因的计算复杂度从O(n²)降至O(n),在保持接近贪心算法忠实度的同时大幅减少模型评估次数。

Comments 26 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24464 2026-06-24 cs.CV 新提交 50%

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

通过几何感知蒸馏提升文本驱动视频分割

Tianyu Zhu, Yingping Liang, Hesong Li, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24447 2026-06-24 cs.CV 新提交 50%

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析

Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He

机构 * Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS)) Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)

专题命中 效率与部署 :language model(abstract)

AI总结 提出P-MTP框架,通过渐进式多令牌预测和轻量级MTP模块,结合渐进课程损失和置信门控动态草稿,实现文档解析高达5倍加速且精度损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23090 2026-06-24 cs.RO 新提交 50%

Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields for Flow-Based Object Manipulation

Flow as Flow:将机器人速度场建模为概率速度场用于基于流的物体操作

Koki Seno, Daichi Yashima, Yusuke Takagi, Kento Tokura, Komei Sugiura

机构 * Keio University(庆应义塾大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出Flow as Flow框架,将机器人速度场建模为概率流,基于流匹配公式实现高效高质量的机器人流生成,在标准基准和真实世界实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏