arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 1943
2609.05416 2026-09-07 cs.CV 新提交

WorldSculpt: Generating Compositional Worlds from Grounded Videos

WorldSculpt:基于接地视频生成组合式世界

Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(阿里达摩院Alaya实验室) The University of Tokyo(东京大学)

AI总结 本研究提出WorldSculpt,通过适配单物体3D生成先验到多视图观测,实现从接地视频生成含数百物体的复杂组合式3D世界,所提Pixal3D方法在基准测试中优于现有技术,还可转换3DGS世界为组合网格场景。

Comments Homepage: https://alaya-lab.github.io/WorldSculpt/; Github: https://github.com/AlayaLab/WorldSculpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05415 2026-09-07 cs.CV cs.GR cs.LG 新提交

UniMate: One Unified Model to Animate Diverse Skeletons

UniMate:一个统一模型驱动多种骨架动画

Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song, Adam Finkelstein, Szymon Rusinkiewicz

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学)

AI总结 UniMate是统一基础模型,通过拓扑感知扩散Transformer,在UniML3D数据集训练后,实现从3D资产和文本提示生成任意骨架动画,性能优于基线,支持多种动画编辑任务。

Comments SIGGRAPH Asia 2026. Project page: https://linzhanmou.com/unimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05405 2026-09-07 cs.CL 新提交

WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

WearableQA:面向真实世界可穿戴设备数据健康推理的基准

Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei, Dohwan Ko, Hyunwoo J. Kim, Benoit Corda

机构 * Meta KAIST(韩国科学技术院) Korea University(高丽大学)

AI总结 研究推出WearableQA基准,包含4084道基于200名用户真实可穿戴数据的选择题,评估14种LLM的推理能力,发现多数模型准确率低于60%,该基准可有效区分模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05403 2026-09-07 cs.LG cs.AI 新提交

RegionFed: Federated Learning for Personalized Query Understanding in Heterogeneous Retail Environments

RegionFed:面向异构零售环境中个性化查询理解的联邦学习

Quoc H. Nguyen, Ali Lafzi, Abhijeet Phatak, Siddharth Pratap Singh, Rohit Upadhyay, Yogananda Domlur Seetharama, Chittaranjan Tripathy

机构 * Walmart Global Tech(沃尔玛全球技术部门)

AI总结 针对异构零售环境中查询理解的数据异质性问题,提出在梯度层面操作的RegionFed联邦学习框架,在Transformer等模型上大幅提升性能,接近集中式上界且具备差分隐私保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05401 2026-09-07 cs.RO cs.CL 新提交

Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

相同轨迹,矛盾奖励(ROBORMBENCH):视觉语言奖励模型的 paraphrase 脆弱性

Wonje Jeung, Sangyeon Yoon, Hyesoo Hong, Yoonjun Cho, Dongjae Jeon, Bumjun Kim, Jean Oh, Youngjae Yu, Albert No

机构 * Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学)

AI总结 该研究针对视觉语言奖励模型存在的 paraphrase 脆弱性问题,推出 ROBORMBENCH 基准开展实验,发现 paraphrase 会引发奖励不稳定,专用轨迹监督奖励模型稳定性更高,强调 paraphrase 鲁棒性对机器人奖励建模的核心作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05397 2026-09-07 cs.CV cs.RO 新提交

CrossDepth: Geometry-Constrained Attention for Generalizable Multi-View Surround Depth Estimation

CrossDepth:用于通用多视角环绕深度估计的几何约束注意力机制

Samer Abualhanud, Max Mehltretter

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学)

AI总结 本文针对多视角环绕深度估计的跨图像不一致问题,提出几何约束注意力机制的CrossDepth模型,经DDAD、nuScenes数据集评估,其深度精度与一致性优于现有最优自监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05396 2026-09-07 cs.AI 新提交

A Deep Generative Model for Synthesizing Labeled Wireless Signals

一种用于合成带标签无线信号的深度生成模型

Yuxiao Li, Keke Hu, Santiago Mazuelas, Yuan Shen

机构 * Basque Center for Applied Mathematics (BCAM)(巴斯克应用数学中心) IKERBASQUE Foundation for Science(伊克尔巴斯克科学基金会) College of Semiconductors (College of Integrated Circuits)(半导体学院(集成电路学院)) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 针对带标签无线信号获取成本高、传统合成方法真实度不足的问题,提出IIns-GAN模型,在UWB数据集上验证其生成信号可提升无线感知任务的模型训练效果。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05395 2026-09-07 cs.AI cs.CL 新提交

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

针对韩国开放公共API的多步骤工具调用:基准测试与数据合成方案

Dain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh, Kyuseong Lim

机构 * LG CNS

AI总结 针对韩国开放公共API的多步骤工具调用场景,构建KOPA-Bench基准测试,提出EDGE数据合成方案,微调9B模型后其性能接近同系列27B模型且在KOPA-Bench和BFCL上均有提升。

Comments 30 pages, 7 figures, 26 tables. Accepted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05388 2026-09-07 cs.CV 新提交

Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks

Think-Verify-Revise:结合视觉语言模型与动态逻辑张量网络的神经符号视觉推理

Homayoun Afshari, Pietro Basci, Alessandro Russo, Lia Morra

机构 * Politecnico di Torino(都灵理工大学)

AI总结 本文提出Think-Verify-Revise神经符号框架,结合VLM与D-LTN形成闭环迭代反馈,在ViSudo-PC基准的四个视觉领域上仅用3个示例归纳数独规则,AUC分数优于或匹配现有方法,实现自动规则发现。

Comments Accepted at the MARS2 Workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05385 2026-09-07 cs.AI 新提交

Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence

必要还是充分?基于行为证据评估大语言模型(LLM)的解释

Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri

机构 * BNY(纽约银行)

AI总结 该研究测试LLM解释的必要性与充分性,在两个用例中对8款模型进行评估,发现引用因素与得分相关性有限,其无法可靠识别影响最强的因素,提供了LLM解释的黑箱可靠性检查框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05382 2026-09-07 cs.CV cs.AI 新提交

Reflection-aware Generative Novel View Synthesis

感知反射的生成式新视角合成

GeonU Kim, Shin Dong-Yeon, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院)

AI总结 该研究针对多视角扩散模型无法利用镜面反射内容的问题,提出无训练的Ref-GeNVS方法,通过两阶段生成技术实现反射一致的新视角合成,性能优于现有同类方法。

Comments ECCV2026, Project page: https://kim-geonu.github.io/Ref-GeNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05381 2026-09-07 cs.AI 新提交

Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

分子似曾相识:前沿大语言模型的数字级已发表值检索

Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Roland C. Aydin, Christian Feiler

机构 * Hamburg University of Technology(汉堡工业大学) Helmholtz-Zentrum Hereon(亥姆霍兹重离子研究中心盖斯特哈赫特分中心) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔大学)

AI总结 本研究审计22个前沿LLMs在12个分子回归基准的逐字检索情况,发现该现象普遍且具基准特异性,推理级别会影响检索率,抑制检索可缩小模型预测误差差异,表明LLMs通用预测能力不唯记忆数值量决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05376 2026-09-07 cs.RO cs.AI cs.CV 新提交

What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies

什么情况下关键?诊断和改进视觉运动模仿策略中的条件视觉接地

Vivek Chavan, Pengtao Xie, Yahuan Shi, Oliver Heimann, Kevin Haninger, Jörg Krüger

机构 * Fraunhofer Institute for Production Systems and Design Technology IPK(弗劳恩霍夫生产系统与设计技术研究所IPK) Technische Universität Berlin(柏林工业大学)

AI总结 该研究针对视觉运动模仿策略在引入相似物体时的目标选择失效问题,以ACT为基础提出三类互补干预措施,在仿真和物理UR3e机器人上提升了鲁棒性,还验证了其在预训练视觉-语言-动作策略上的通用性。

Comments Accepted as an extended abstract at the DexHAND Workshop, ECCV 2026. Non-archival, non-proceedings. 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05374 2026-09-07 cs.AI 新提交

CUA-Universe: A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents

CUA-Universe:适用于混合GUI+CLI智能体的可扩展动态环境

Haoting Shi, Wenhao Wang, Weicheng Fang, Yaozhong Liang, Tian Jin, Pengxiang Zhao, Guangyi Liu, Siheng Chen, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究提出可扩展混合GUI+CLI环境CUA-Universe,通过App-Forge等组件生成数据,训练的9B模型在多基准测试中提升了计算机使用智能体的性能与效率。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05369 2026-09-07 cs.RO cs.CV 新提交

Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation

面向长视距视觉-语言-动作操作的神经符号过程推理

Vivek Chavan, Yahuan Shi, Oliver Heimann, Kevin Haninger, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫生产系统与设计技术研究所) Technische Universität Berlin(柏林工业大学)

AI总结 该研究针对长视距VLA操作的脆弱性,提出结合VLA控制、任务图与多模态过程记忆的神经符号框架,利用伪注视指导微调,在两操作领域验证了结构化推理与视觉指导的互补作用。

Comments Accepted as an oral presentation at the X-Reason Workshop, ECCV 2026. Non-archival extended abstract. 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05363 2026-09-07 cs.LG 新提交

Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation

全局蒸馏,局部适配:用于可升级推荐的推理蒸馏与乘积类型测试时训练

Siliang Liu, Mohammad Ghasemi, Sapan Patel, Amin Banitalebi-Dehkordi

机构 * Amazon Everyday Essentials Technologies(亚马逊日常必需品技术公司)

AI总结 本文提出两级框架,将LLM推理蒸馏为高效学生模型,结合乘积类型测试时训练优化,在可升级推荐任务上实现精度提升,且推理速度远快于直接LLM推理、成本大幅降低。

Comments Accepted at the Third Workshop on Agentic and Generative AI for E-Commerce (GenAIECommerce 2026), co-located with ACM RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05361 2026-09-07 cs.RO 新提交

Development of a Humanoid Robot Prototype for Multimodal Human-Robot Interaction

用于多模态人机交互的人形机器人原型开发

Thang Tran Viet, Thanh Nguyen Canh, Huy Uong Gia, Phuc Dinh Van, Son Tran Duc, Ngoc Minh Do, Xiem HoangVan

机构 * University of Engineering and Technology, Vietnam National University, Hanoi(越南国家大学河内工程技术大学) School of Information Science, Japan Advanced Institute of Science and Technology(日本先进科学技术学院信息科学学院)

AI总结 本文开发了一款集成手势识别、目标检测、语音命令处理等AI模块的人形机器人原型,经实验验证其定位精度高、任务准确率超90%,可作为人机交互研究的易用平台。

Comments 6 pages, 6 figures. Published in the 2025 RIVF International Conference on Computing and Communication Technologies (RIVF 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05351 2026-09-07 cs.CV 新提交

MEOX: Compact Multimodal Mixture-of-Experts for Earth Observation

MEOX:面向地球观测的紧凑多模态混合专家模型

Mohanad Albughdadi

机构 * European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)

AI总结 本文提出紧凑多模态混合专家模型MEOX,采用特定传感器适配器等技术,在122.8万MMEarth64样本上预训练,在多项地球观测基准任务中性能优于CSMoE,实现了传感器灵活的表征学习与任务迁移。

Comments Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05339 2026-09-07 cs.AI cs.CL cs.IR 新提交

Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

你的智能体的记忆能在模型升级后保留吗?一项关于记忆可移植性的对照研究

Ankit Goyal, Jaideep Ray

机构 * LinkedIn(领英)

AI总结 该研究对照分析了LC-RAW、RAG、NOTES、KG-fixed四种记忆存储方式在模型升级后的可移植性,发现KG-fixed迁移可靠,NOTES和RAG存在显著性能损失,需重视迁移测试与源历史保留。

Comments 18 pages, 3 figures, 7 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05334 2026-09-07 cs.CV cs.AI cs.LG 新提交

Lightweight Vision Transformer Compression for On-Device Plant Disease Detection in Resource-Constrained Agricultural Field Conditions

面向资源受限农业田间场景的设备端植物病害检测的轻量级视觉Transformer压缩

Mahadev Sunil Kumar, Bhavika Gondi, Desaisetty Venkata Satya Sai Swapnith, Gangireddy Rahul Jogi, Sudheesh Manalil, Arnab Raha, Amitava Mukherjee, Parthasarathy Seethapathy, G. Gopakumar

机构 * Amrita Vishwa Vidyapeetham(阿姆里塔维什瓦维迪亚皮塔姆大学) Intel Corporation(英特尔公司) Birla Institute of Technology(比拉理工学院)

AI总结 针对资源受限农业场景的设备端辣椒病害检测,提出结合H-BAC剪枝、量化与注意力知识蒸馏的ViT压缩框架,实现54.5倍体积缩减且保持准确率,明确相关技术的适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05333 2026-09-07 cs.AI cs.CL 新提交

Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models

用于测量Transformer语言模型中语境个体化的工具包技术手册

José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez, Marcelo Vinicius de Paula, Tárcio André dos Santos Barros

机构 * University of Campinas (Unicamp)(坎皮纳斯大学) Center for Electric Mobility Research (CEMOBE)(电动 mobility 研究中心(CEMOBE)) Power Electronics Laboratories (LEPO)(电力电子实验室(LEPO)) Institute of Computing (IC)(计算研究所(IC)) Center for Logic, Epistemology and History of Science (CLE)(逻辑、认识论与科学史研究中心(CLE))

AI总结 本手册介绍了用于测量Transformer语言模型语境个体化的开源工具包,详述其流程与设计选择,为相关研究提供方法学与实现参考。

Comments 29 pages, 2 figures (one with 2 subfigures), 1 table. Toolkit, source code, and corpora archived separately on Zenodo (see Section 9)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05331 2026-09-07 cs.RO cs.SE 新提交

Adaptation Needs in Robotic Systems: Assessing Behavior Trees and Their Enhancement

机器人系统中的适应需求:评估行为树及其增强方案

Mehran Rostamnia, Gianluca Filippone, Ricardo Caldas, Patrizio Pelliccione

机构 * Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

AI总结 本文通过文献研究结合实证验证,将机器人适应需求分为六类,分析经典及增强型行为树的能力局限,为机器人系统选择行为树方案提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05328 2026-09-07 cs.LG 新提交

Embedded Graph Flows for Categorical Graph Generation

用于分类图生成的嵌入式图流

Ethan Ma, Zihan Wang, Chris Siu Yeung Chow, Xinguo Feng, Qingqing Li, Rui Jiang, Naipeng Dong, Guangdong Bai

机构 * School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电气工程与计算机科学学院) Institute for Molecular Bioscience, The University of Queensland(昆士兰大学分子生物科学研究所) Chinese Academy of Sciences(中国科学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 提出嵌入式图流(EGF)生成模型,学习节点与边类别连续嵌入,在 QM9、ZINC250k 分子基准测试中性能优于基线方法,生成分类图表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05327 2026-09-07 cs.AI cs.AR 新提交

LLM-Driven Algorithm Design for Quantum Circuit Synthesis based on Binary Decision Diagrams

基于二元决策图的大语言模型驱动量子电路合成算法设计

Yoonju Sim, Federico Berto, Chuanbo Hua, Jinkyoo Park, Changhyun Kwon

机构 * KAIST(韩国科学技术院) Radical Numerics Omelet Inc(Omelet公司)

AI总结 该研究提出基于LLM的进化框架\texttt{QuantumEvo},发现启发式HGA-QE优化BDD变量排序,使合成量子电路的QCC性能提升,在基准测试中表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05325 2026-09-07 cs.RO 新提交

FIRE-LIVWO: Robust LiDAR-Inertial-Visual-Wheel Odometry via Failure-Immune mmWave Radar Enhancement

FIRE-LIVWO:基于抗失效毫米波雷达增强的鲁棒激光雷达-惯性-视觉-轮式里程计

Kun Hu, Menggang Li, Kaidi Wu, Zhiwen Jin, Yingjie Zhao, Chaoquan Tang, Eryi Hu, Gongbo Zhou

机构 * School of Mechatronic Engineering, China University of Mining and Technology(中国矿业大学机电工程学院) Jiangsu Collaborative Innovation Center of Intelligent Mining Equipment, China University of Mining and Technology(中国矿业大学江苏省智能采矿装备协同创新中心) National Key Laboratory of Intelligent Mining Equipment Technology, China University of Mining and Technology(中国矿业大学智能采矿装备技术全国重点实验室)

AI总结 该研究针对地下煤矿SLAM的退化问题,提出基于IESKF的FIRE-LIVWO多模态里程计,通过自适应融合策略提升鲁棒性,实测平均定位误差5.677m,已开源代码。

Comments Accepted by IROS 2026.The project website is "https://kj-falloutlast.github.io/FIRE-LIVWO"

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05323 2026-09-07 cs.CV 新提交

Scalable Detection of Fossil Palynomorphs in Multifocal Digital Microscopy Images

多焦点数字显微镜图像中化石孢粉型的可扩展检测

Abbas Shaikh, Praise Mayor, Patrick Ainlay-Vazquez, Aditya Viswanathan, Teon Golden, Eric Zhang, Ingrid C. Romero, Alexander E. White, Scott Wing, Arko Barman

机构 * Rice University(莱斯大学) Smithsonian National Museum of Natural History(史密森尼国家自然历史博物馆) Smithsonian Office of Digital and Innovation(史密森尼数字与创新办公室)

AI总结 本研究提出首个全玻片图像孢粉型自动检测的可扩展端到端流程,通过图像分解压缩、RF-DETR等模型基准测试、检测结果合成算法及I/O优化,将单张玻片检测时间从数天缩至1小时内,支撑大规模孢粉学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05314 2026-09-07 cs.AI cs.CL cs.SY eess.SY 新提交

Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness

用于建筑能源系统HVAC运行的大语言模型:方法、应用与部署就绪情况的批判性综述

Alexander Neubauer, Tianzhen Hong, Han Li, Mengbo Yu, Amin Darbandi, Yannick Fürst, Martin Kriegel

机构 * Technische Universität Berlin(柏林工业大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

AI总结 该综述分析2023年至2026年3月的66篇LLM用于HVAC运行的研究,发现LLM目前主要作为语义和工作流层,仅少数研究达试点级,无持续部署,建议开展LLM与MPC/RL结合的研究。

Comments 38 pages, 9 figures, 16 tables. Submitted to Energy and Buildings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05309 2026-09-07 cs.LG cs.AI 新提交

How Does mHC Use Its Residual Streams? Selective Routing and Near-Identity Mixing

mHC如何利用其残差流?选择性路由与近恒等混合

Pengxiang Zhao, Xing Li, Xianzhi Yu, Wei Guo, Zhenhua Dong

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 该研究探究DeepSeek-V4-Flash的四流mHC中残差流的利用模式,发现读写路由集中、残差混合主要在早期层,后期混合作用小,模型仅利用了部分灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05303 2026-09-07 cs.CV 新提交

Learning Spatial-Spectral Refinement and Calibrating Complementary Observations for Hyperspectral Image Super-Resolution

高光谱图像超分辨率的空间-光谱细化学习与互补观测校准

Liqian Yang, Xingchi Chen, Xinfeng Gui, Xiangyong Cao, Qianxin Yi

机构 * School of Management, Zhengzhou University(郑州大学管理学院)

AI总结 本文针对高光谱与多光谱图像融合中INR方法的局限,提出TSR-ITNR两阶段自监督框架,实现无真值监督的高光谱图像超分辨率,获优异重建性能并通过下游分割验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05300 2026-09-07 cs.RO 新提交

Human-Human & Human-Robot Interaction Transformer (H2INT) for Robot Navigation in Dense and Uncertain Crowds

用于密集不确定人群中机器人导航的人-人及人-机器人交互Transformer(H2INT)

Ao Shen, Kaixi Chen, Shiwei Liu, Fang Deng, Chen Chen

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

AI总结 本文提出H2INT强化学习框架,通过分层关系编码与课程学习提升密集不确定人群中机器人导航的安全性与鲁棒性,可迁移至不同人群布局,经仿真与真实机器人部署验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏