arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2956 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 326 篇

2608.16717 2026-08-18 cs.CV 新提交 57%

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 57%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14226 2026-08-17 cs.CV 新提交 57%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14207 2026-08-17 cs.RO cs.CV 新提交 57%

MMUSV-Sim: A Perception-Oriented Simulation and Data-Generation Platform for Multi-USV Cooperative Perception

MMUSV-Sim:面向多无人水面艇协同感知的感知导向型仿真与数据生成平台

Ziao Li, Jianxiong Ye, Biao Tang, Leping Zhang, Kun Zuo, Siyu Huang, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院) School of Intelligent Imagery Engineering, Beijing Film Academy(北京电影学院智能影像工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于Unreal Engine 5和Project AirSim的MMUSV-Sim仿真与数据生成平台,用于多USV协同感知,实验表明其生成的数据集可使激光雷达协同BEV船舶检测的AP@0.5达72.74,显著优于单USV方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 57%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13112 2026-08-14 cs.CV 新提交 57%

Towards Physics-Faithful Generation of Scientific Diagrams

面向物理保真的科学图表生成

Minghui Zhang, Jinxin Shi, Yifan Chang, Liangliang Zhao, Yuandong Pu, Qian Yu, Ming Hu, Hanxiao Zhang, Yun Gu, Yirong Chen, Yu Qiao, Bo Zhang, Xiangchao Yan, Bin Fu, Yihao Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对现有文本到图像生成模型生成的科学图表存在物理错误的问题,提出Princigram生成器,通过结构化物理思维链实现物理保真的科学图表生成,在相关基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12133 2026-08-13 cs.AI 新提交 57%

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

GUIDE:企业场景下从文档到制品生成的受控统一智能

Shivali Dalmia, Sumukha Thoppanahalli, Mohammadreza Sediqin, Abhishek Mukherji

机构 * Centific Research(森蒂菲克研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09344 2026-08-11 cs.CV 新提交 57%

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间

Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini, Morteza Saberi, Mojtaba Golzan, Shafin Rahman, Hossein Rahmani

机构 * Macquarie University(麦考瑞大学) York University(约克大学) Northern Illinois University(北伊利诺伊大学) University of Technology Sydney(悉尼科技大学) North South University(北南大学) Lancaster University(兰卡斯特大学) Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09186 2026-08-11 cs.CV 新提交 57%

RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing

结合FaME-G2E的RAGMesh:长文本驱动的3D人脸生成与编辑

Hao Li, Ju Dai, Feng Zhou, Mengting Shi, Haofei Wang, Zhen Song, Wei Zhou, Lei Li, Junjun Pan

机构 * Beihang University(北京航空航天大学) Pengcheng Laboratory(鹏城实验室) Shanxi University of Finance and Economics(山西财经大学) North China University of Technology(北方工业大学) Cardiff University(卡迪夫大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究构建了含文本-网格等标注的FaME-G2E数据集,提出RAGMesh框架,含MSRF模块与AdaRAGS约束,在3D人脸生成编辑任务上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 57%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08820 2026-08-11 cs.CV 新提交 57%

LogiShot: Logically Coherent Cross-Shot Video Generation

LogiShot:逻辑连贯的跨镜头视频生成

Shuai Guo, Yuhang Yang, Zeyu Zhang, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对跨镜头视频生成的内容脱节问题,提出LogiShot模型,通过联合编码与视觉记忆路径实现逻辑连贯,构建11万样本数据集及基准,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 57%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06878 2026-08-10 cs.CV 新提交 57%

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04525 2026-08-06 cs.CV 新提交 57%

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

面向场景文本图像超分辨率的耦合连续-离散生成方法

Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对现有场景文本图像超分辨率(STISR)方法误差传播、成本高的问题,提出统一框架DualTSR,通过耦合连续-离散生成实现高效准确的STISR,在多数据集上表现优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 57%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04314 2026-08-06 cs.CR cs.CV 新提交 57%

Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle

用于良性目的的对抗性攻击:视觉内容全生命周期主动保护综述

Jiaming Zhang, Boyang Chen, Zherui Li, Fuyao Zhang, Xinyu Yan, Hong Xi Tae, Wenwen He, Xuan Wang, Siqi Guo, Junhao Dong, Kun Wang, Hanxun Huang, Yige Li, Xingjun Ma, Yang Cao, Lingjuan Lyu, Wei Yang Bryan Lim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本综述研究了视觉内容全生命周期中用于主动保护的“良性对抗性攻击”范式,涵盖五类方法并评估其特性,同时指出当前保护措施的不足与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 57%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03103 2026-08-05 cs.RO cs.AI 新提交 57%

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

针对需要时变力的操作任务的模仿学习的分层方法

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 57%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 57%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02218 2026-08-04 cs.AI 新提交 57%

PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs

PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成

Haojie Hu, Chenhao Dang, Yaojia Liu, Hengrui Kang, Conghui He, Weijia Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。

Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01896 2026-08-04 cs.CV 新提交 57%

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

GeoCore-9B:面向地球观测的地理感知生成基础模型

Jeonghyeok Do, Munchurl Kim

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。

Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交 57%

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 57%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27830 2026-07-31 cs.CV 新提交 57%

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

一次思考足矣:面向高分辨率视觉问答的中间层证据路由

Zhongkuan Mao, Xianjie Liu, Tianyu Meng, Yidong Wang, Wenzhuo Zhao, Ronghao Xian, Yao Jiang, Fei Shen, Junfeng Fang, Yong Dai, Yi Zhang, Keren Fu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26754 2026-07-30 cs.CV 新提交 57%

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

StatePlay:用于机制一致性生成的状态感知游戏世界模型

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。

Comments Project Page: https://jimntu.github.io/stateplay_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 57%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏