arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2861 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2606.14127 2026-06-15 cs.IR cs.CL 新提交 57%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 57%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11770 2026-06-11 cs.AI 新提交 57%

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT: 基于强化学习的空间推理状态感知思维可视化

Chao Lei, Yanbei Jiang, Markus Hiller, Zhijian Zhou, Xunye Tian, Krista A. Ehinger, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10517 2026-06-10 cs.CV 新提交 57%

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

LAFP:通过流匹配在潜在策略学习中保留潜在动作结构

Jiexi Lyu, Xizhou Bu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

机构 * Fudan University(复旦大学) Morphi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出LAFP方法,利用流匹配学习潜在策略,并引入推理时插值机制缓解随机性导致的错位,在模仿学习任务中成功率提升10-15%,推理开销增加不到1倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09532 2026-06-09 cs.CY cs.CL 新提交 57%

Interpretable Crisis Behavior Analysis Using Mobility and Social Media Data

基于移动性和社交媒体数据的可解释危机行为分析

Muhammad Hamza Arshad Majeed, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD)(纽约大学(NYUAD))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出统一可解释流水线,融合移动性和社交媒体数据,通过形式概念分析和关联规则挖掘,识别危机中跨域行为模式,并在洛杉矶山火和COVID-19案例中验证,生成可操作的政策简报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-06-09 cs.CV 新提交 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09248 2026-06-09 cs.CV 新提交 57%

Temporal-Aware Reasoning Optimization for Video Temporal Grounding

时间感知推理优化用于视频时间定位

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出TaRO框架,通过构造性推理探索和时间敏感性奖励,增强多模态大模型在视频时间定位中的时间感知推理能力,实现最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09181 2026-06-09 cs.CV cs.LG 新提交 57%

Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

用于视频问答中细粒度证据分离的反事实推理

Zhou Du, Hamid Krim, Xiao Wu, Zhaoquan Yuan, Liangwei Li, Keisuke Fujii

机构 * School of OptoElectonic Science and Engineering, University of Electronic Science and Technology of China(电子科技大学光电科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出反事实推理框架CREDiT,通过结构因果模型将视频问答中的跨模态表示分解为因果和非因果成分,在独立性约束下进行特征级因果干预,提升答案准确性和推理可靠性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08566 2026-06-09 cs.CV 新提交 57%

Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction

通过细粒度情感-原因对提取实现精确的情感归因视频字幕生成

Weidong Chen, Cheng Ye, Zhendong Mao, Liping Wang, Xinyan Liu, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出细粒度情感-原因对提取框架,通过概念感知视觉语义分解和视觉引导情感可解释学习,提升情感视频字幕的准确性和丰富性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 57%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07016 2026-06-08 stat.AP cs.CV 新提交 57%

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections

信号交叉口弱势道路使用者安全的集成路边感知与通信框架

Parvez Anowar

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中央佛罗里达大学土木、环境与建设工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出集成多模态感知、边缘计算、V2X/P2X通信和自适应信号控制的框架,基于公开数据集R-LiViT分析53,319个标注,发现VRU占49%、昼夜密度差异大、近距离事件变化10倍、83%行人边界框小,支持多模态感知和自适应部署。

Comments 17 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07161 2026-06-08 cs.CV 新提交 57%

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

TraRA: 面向城市监控视频文本识别的轨迹级识别聚合方法

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

机构 * RIKEN(日本理化学研究所) Hanoi University of Science and Technology(河内科学技术大学) Nagoya University(名古屋大学) Lawrence Technological University(劳伦斯技术大学) Ritsumeikan University(立命馆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出TraRA方法,通过轨迹级文本识别聚合,利用时间与多模态一致性,解决监控视频中运动模糊、遮挡等导致的帧级识别不一致问题,在多个基准上提升跟踪与识别性能。

Comments 22nd IEEE International Conference on Advanced Visual and Signal-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06891 2026-06-08 cs.CV 新提交 57%

Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hanxun Yu, Xuan Qu, Lei Ke, Boqiang Zhang, Yuxin Wang, Jianke Zhu, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文汇) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出在线3D视觉语言模型Stream3D-VLM,通过自回归流控制、轻量视觉-空间特征融合模块和几何自适应体素压缩,实现从流式视频中实时理解3D空间,并构建超百万在线3D问答数据集,在多项任务上超越现有模型。

Comments Project Page: https://stream3d-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 56%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :分类 cs.CV、cs.AI、cs.MM;multimodal(comments)

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交 50%

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12993 2026-08-14 cs.IT math.IT 新提交 50%

A Theory of Probabilistic Power Provisioning for Data Centers with Distributed Energy Storage

面向配备分布式储能的数据中心的概率功率供应理论

Can Emre Koksal, Richard A. Barry, Artun Sel

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文针对配备分布式储能的数据中心的电力供应问题,提出概率框架,划分两种运行模式并引入等效功率概念,经三类生产数据中心工作负载验证,为下一代AI数据中心提供规模设计原则。

Comments 26 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08729 2026-08-11 cs.HC 新提交 50%

From Scaffolding to Internalization: Enhancing CPR Training with In-Situ Visualization and Kinesthetic Feedback

从支架到内化:利用原位可视化与运动反馈强化心肺复苏(CPR)训练

Jiahe Dong, Shuhao Zhang, Yutao Ming, Jinkai Zhang, Yurui Zhang, Quan Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对现有CPR训练系统依赖外部反馈导致技能保持差的问题,设计了阶段自适应多模态混合现实训练系统Kinesthetic-CPR,经60人参与的受控研究验证,为CPR训练系统提供了设计启示。

Comments In The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 02-05, 2026, Detroit, MI, USA. ACM, New York, NY, USA, 15 pages. https://doi.org/10.1145/3830398.3830498

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06783 2026-08-10 eess.SP 新提交 50%

Design and Validation of a Portable EEG-tES Platform Supporting High-Rate EEG Recording and Temporal Interference Stimulation

支持高速脑电图记录和时间干扰刺激的便携式脑电图-经颅电刺激平台的设计与验证

Le Xing, Maoxing Liang, Disi A, Yifei Jia, Gaoxiang Xie, Linfeng Xu, Xiang'ao Chen, Jiebin Shi, Gang Pan, Bicheng Han

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究设计并验证了一款以MCU为核心的便携式EEG-tES平台,集成8通道EEG采集与2通道tES功能,具备高信号保真度与低刺激误差,为便携式闭环神经调控系统提供了实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01773 2026-08-04 q-bio.NC 新提交 50%

NeuroWorld: A Latent Brain World Model for Stimulus-Conditioned Human Brain Dynamics

NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型

Zijian Dong, Jianxiong Zhou, Kwun Kei Ng, Jan Paolo Macapinlac Balagtas, Zhizhou Li, Zijiao Chen, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29482 2026-08-03 cs.RO 新提交 50%

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

时间策略:用于机器人演示学习的历史初始化动作生成

Dylan Miller, Martin Jagersand

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29413 2026-08-03 cs.HC 新提交 50%

SAVVY: Student Attention Visualization for Video-based Learning Analysis

SAVVY:面向视频学习分析的学生注意力可视化

Shixian Zhou, Minghuan Shen, Xiaolin Wen, Zijun Qiu, Yongliang Jiang, Xiangyang Wu, Fei Wu, Yong Wang, Zhiguang Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对现有视频学习注意力分析算法易受噪声干扰、教师修订成本高的问题,提出基于多模态脑信号的注意力建模框架,开发整合视听注意力的SAVVY可视化系统,经验证可有效辅助教学视频优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23457 2026-07-28 physics.soc-ph 新提交 50%

From Pen to Palette: Mathematical Analysis of van Gogh's Psychological Trajectory

从笔到调色板:梵高心理轨迹的数学分析

Anna Singley, Eli Goldwyn, Mark Pitzer, Jessica Logue

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究通过对梵高信件片段情感分析和画作分形维数分析,运用临界慢化理论,发现视觉复杂性与死亡情绪相关,重大危机前有CSD模式,如1888年割耳事件,揭示数学方法可检测历史人物心理转变特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21309 2026-07-24 cs.RO 新提交 50%

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

用于基于平面激光雷达的人体姿态估计的分解时空卷积

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15628 2026-07-20 eess.IV 新提交 50%

MSTF-Net: A UAV-Oriented Multi-Spectral Video Segmentation Method via Modality-Robust, Scale-Adaptive, and Consistent Fusion

MSTF-Net:一种通过模态稳健、尺度自适应和一致融合的面向无人机的多光谱视频分割方法

Chenwei Wang, Zhida Wang, Zelin Li, Elif Ozden-Yenigun, Houde Liu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对无人机多光谱视频分割面临的模态融合困境和时间变化问题,提出MSTF-Net框架,通过模态稳健、尺度自适应融合有效建模跨模态融合与时间一致性,在公共数据集实验中取得出色分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 50%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15880 2026-07-20 cs.RO cs.LG 新提交 50%

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

用于泛化到未见机器人操作的动力学感知元模仿

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang University of Technology(沈阳工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对机器人模仿学习的数据稀缺与环境泛化问题,提出动力学感知元模仿(DAMI)框架,通过整合元学习、引入视觉运动轨迹模块等方法,有效捕捉任务动力学,在模拟和真实场景实验中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09746 2026-07-14 q-bio.QM eess.IV 新提交 50%

Longitudinal MRI template of the baboon brain from birth to adolescence

从出生到青春期的狒狒大脑纵向MRI模板

Katherine L. Bryant, Arnaud Le Troter, David Meunier, Yannick Becker, Scott A. Love, Siham Bouziane, Kep Kee Loh, Julien Sein, Luc Renaud, Olivier Coulon, Adrien Meguerditchian

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究针对狒狒大脑从出生到青春期的发育,提出BABACOOL方法创建多模态发育图谱,生成BaBa21纵向发育模板,还提供全自动生成中间年龄模板的方法,为狒狒数据归一化及相关研究提供便利。

Comments 21 pages, 6 Figures, 6 Supplementary Figures, In Press

Journal ref Imaging Neuroscience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09234 2026-07-13 cs.RO 新提交 50%

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

基于未标记子任务演示的重排任务隐式行为协调

Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab and Center for Robotics, University of Bonn(人形机器人实验室及机器人技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究长期机器人重排任务,提出基于未标记子任务演示的隐式行为协调方法,通过价值引导动作选择学习类技能行为,实验表明该方法在复杂任务中表现优,能处理更大行为库,为显式技能管道提供替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06215 2026-07-08 quant-ph cond-mat.mes-hall 新提交 50%

Coherence Estimation Beyond the Liouvillian Gap in a Finite Nonequilibrium System

有限非平衡系统中超越刘维尔间隙的相干性估计

Sonali Brahma, Trishna Kalita, Himangshu Prabal Goswami

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究有限量子系统与热库相互作用时热库诱导相干性的估计,通过分析刘维尔本征谱证明最优传感窗口源于模式竞争,刘维尔间隙倒数与最优传感时间无一般缩放关系,耦合系统到量子腔可转变为稳态资源。

Comments Suggestions on references are welcome along with other suggestions or comments

详情

展开后加载摘要…

URL PDF HTML 收藏