arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 476 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 476 篇

2607.16401 2026-07-21 cs.CV 新提交 57%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15733 2026-07-20 cs.RO 新提交 57%

A Task-Space Receding Horizon Controller for Fast Collision Avoidance

一种用于快速避碰的任务空间滚动时域控制器

Mattia Penzotti, Marco Controzzi

机构 * Biorobotics Institute and the Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna(生物机器人研究所和机器人与人工智能卓越系,圣安娜高等学校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究机器人操纵器实时避碰问题,提出任务空间滚动时域控制器,通过短接触一致展开生成终端参考并计算首个输入,经迭代动力学求解器塑造参考,仿真与实验验证该方法在动态杂波中平衡多方面性能且提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15727 2026-07-20 cs.CV 新提交 57%

Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation

Event3R:通过时空特征聚合从事件相机进行异步到全局的3D重建

Jian Huang, Haotian Shen, Xinhao Lou, Chengrui Dong, Wenpu Li, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 研究针对事件相机异步、稀疏和高动态特性及缺乏标注数据集的问题,提出Event3R框架,通过时空体素表示、时间注意力模块、掩码箱建模策略及对比对齐和一致性正则化损失,实现鲁棒的3D重建,性能显著优于现有方法。

Comments accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交 57%

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15156 2026-07-17 cs.RO 新提交 57%

Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults

用社交机器人评估身体虚弱和跌倒风险指标:对老年人的现场评估

Aniol Civit, Antonio Andriella, Alba Martínez, Joan Ars, Aida Ribera, Cristian Barrué, Guillem Alenyà

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(工业机器人与信息学研究所,西班牙科学与技术研究委员会 - 加泰罗尼亚理工大学) Parc Sanitari Pere Virgili(圣佩雷维吉利疗养院) RE-FiT Barcelona Research Group(巴塞罗那RE-FiT研究小组) Vall d’Hebron Institute of Research(瓦尔德希伯伦研究院) Aging Research Center, Department of Neurobiology, Care Sciences and Society (NVS), Karolinska Institutet and Stockholm University(衰老研究中心,神经生物学、护理科学与社会系(NVS),卡罗林斯卡学院和斯德哥尔摩大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对老年人虚弱评估资源密集且易忽略生物力学指标的问题,提出用行为树架构的机器人框架,通过视觉跟踪评估临床测试。经现场评估,该框架能提供可靠客观的评估,还可收集相关移动性指标。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 57%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14725 2026-07-17 cs.RO 新提交 57%

BridgeFlow: Fast and Robust SE(2)-Equivariant Motion Planning with Flow Matching

BridgeFlow:基于流匹配的快速且鲁棒的 SE(2) 等变运动规划

Xinzhe Zhou, Xuyang Wang, Xiaoming Duan, Jianping He

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对机器人运动规划中刚体变换等变性难题,提出BridgeFlow框架,通过轻量级模块实现等变性,结合布朗桥信息先验与最优传输加速推理,并嵌入环境感知,相比基线有速度和轨迹率优势,可稳健泛化。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 57%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14046 2026-07-16 cs.AI 新提交 57%

Earthquaker-AI: A Retrieval-Augmented Generation Framework with Rubric-Based Assessment for Primary School Earthquake Education

地震人工智能:一种基于评分标准评估的小学地震教育检索增强生成框架

Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou, Marina Delianidi, Konstantinos Diamantaras

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对小学生地震教育问题,提出地震人工智能混合教育框架,集成检索增强生成对话式AI助手,结合乐高机器人、评分标准和AI,通过不同年级的渐进学习提升学生地震应对能力,实验显示有高可信度和准确性。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13405 2026-07-16 cs.RO 新提交 57%

WNOJ-LIO: A White-Noise-on-Jerk Motion-Prior EKF for High-Dynamic LiDAR-IMU Fusion

WNOJ-LIO:一种用于高动态激光雷达-惯性测量单元融合的基于加加速度白噪声运动先验的扩展卡尔曼滤波器

Junning Lyu, Qizhi Guo, Xia Ning, Tao Song, Shaoming He

机构 * School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学宇航学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究高动态驾驶下激光雷达-IMU融合问题,提出基于加加速度白噪声运动先验的扩展卡尔曼滤波器框架WNOJ-LIO,通过解耦先验预测状态、视IMU为高频测量源,经仿真和实际实验验证,提升了相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 57%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 57%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12370 2026-07-15 cs.RO 新提交 57%

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance

StratMamba:用于基于路径高效的激光雷达避障的策略性和反应性流划分

Hung-Chieh Wu, Xiaopan Zhang, Kasra Sinaei, Ryan Abnavi, Kasun Weerakoon, Christopher Bradley, Seyed Fakoorian, Jiachen Li, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AlphaZ, Inc.(阿尔法兹公司) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究针对复杂环境中机器人导航问题,提出StratMamba双流时间建模架构,结合快慢衰减内存架构处理激光雷达数据。经多场景评估及与其他基线对比,其在时间推理效率、导航速度和路径最优性方面表现出色,在现实中性能更稳健。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 6 figures. Video: https://www.youtube.com/watch?v=Z0FfO_AVaSw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12297 2026-07-15 cs.CV 新提交 57%

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

MobileSAM2:用于空间智能的轻量级图像分割模型

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) SparcAI Inc.(SparcAI公司)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 研究旨在使SAM2更适用于移动设备,提出超图知识蒸馏方法HyperKD,由时间和粒度超图知识蒸馏构成,能有效建模转移知识。还推出MobileSAM2家族,经实验验证其在多基准测试及具身AI任务上有良好泛化性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 57%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 57%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10999 2026-07-14 cs.RO 新提交 57%

Wearing A Coat: Dual-Arm Robot-Assisted Dressing with Differentiable Clothing Simulation

穿着外套:基于可微服装模拟的双臂机器人辅助穿衣

Yiming Liu, Lijun Han, Hesheng Wang

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对机器人辅助穿衣中衣物与人体四肢复杂接触交互的问题,提出集成实时可微服装模拟的控制算法,经模拟和实验验证,该算法能解决接触约束下服装状态问题,实现多阶段控制策略,证明了其可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10842 2026-07-14 cs.RO cs.SY eess.SY 新提交 57%

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions

D-SafeMPC:基于离散时间控制障碍函数的扩散驱动安全模型预测控制

Erdi Sayar, Ersin Daş, Joel W. Burdick, Alois Knoll, Erdal Kayacan

机构 * Paderborn University(帕德博恩大学) Illinois Institute of Technology(伊利诺伊理工学院) California Institute of Technology(加州理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 研究针对扩散模型用于机器人规划时无法保证安全和动态约束的问题,提出D-SafeMPC方法,通过控制障碍函数等引导扩散过程,结合迭代投影方案,经实验验证该方法能提升安全性、任务成功率和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10437 2026-07-14 cs.RO 新提交 57%

Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household Environments

未知多房间家庭环境中多目标搜索的交错部分可观测马尔可夫决策过程规划

Ruochu Yang, Ziyi Xia, Huibo Zhang, Yatong Han, Yiming Zhao, Yingke Li, Fumin Zhang, Yorai Wardi, Mengxue Hou

机构 * Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学) Ising AI(伊辛人工智能公司) MIT(麻省理工学院) Notre Dame University(圣母大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究未知多房间家庭环境下多目标搜索问题,提出Inter-POMDP算法,通过高级POUCT规划器与低级运动规划器相互作用,平衡规划质量与效率,相比基线方法减少碰撞、导航步数及检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 57%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09692 2026-07-14 cs.LG cs.CL 新提交 57%

Reference-Based Distillation Detection in LLMs

大语言模型中基于参考的蒸馏检测

Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) University of Southern California(南加利福尼亚大学) OpenAI

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 研究旨在检测大语言模型是否经蒸馏而来,提出基于参考的成员推理蒸馏检测方法,通过比较模型与不同候选教师输出的优先对齐程度识别教师及蒸馏证据,能处理未知管道,扩展到开放世界设置,应用于当代模型获潜在蒸馏关系新证据。

Comments 27 pages (14 main), 21 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交 57%

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09650 2026-07-13 cs.CV 新提交 57%

Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks

用柯尔莫哥洛夫 - 阿诺德网络重新审视欧拉角回归

Yangting Sun, Zijun Cui, Yufei Zhang

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 研究欧拉角回归难题,提出结合范围感知欧拉建模与柯尔莫哥洛夫 - 阿诺德网络的新框架,经理论分析和实验验证,该框架在控制旋转回归等多方面能提升精度、收敛性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09519 2026-07-13 cs.RO 新提交 57%

DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting

DemoBridge:用于单视图人类演示重定向的循环内仿真工具包

Zehao Wang, Fabien Despinoy, Sergey Zakharov, Tinne Tuytelaars, Rahaf Aljundi

机构 * KU Leuven(库勒万大学) Toyota Motor Europe(丰田欧洲公司) Toyota Research Institute(丰田研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 DemoBridge工具包可将单视图人类手部演示转化为机器人手臂轨迹,核心是碰撞感知规划器,能综合考虑多种因素优化轨迹,经物理模拟器验证,还可用于策略学习,在实际任务和基准测试中评估了其性能。

Comments RSS 2026 RoboData Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09136 2026-07-13 cs.RO 新提交 57%

Residual Physics-Informed Neural Networks for High-Fidelity BLDC Motor Modeling

用于高保真无刷直流电机建模的残差物理信息神经网络

Haitham El-Hussieny

机构 * Department of Mechatronics and Robotics Engineering(机电工程与机器人工程系) Egypt-Japan University of Science and Technology (E-JUST)(埃及-日本科学技术大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对无刷直流电机精确动力学建模问题,提出基于ResNet主干的PINN,以仿真时间等为输入预测电机状态变量,满足相关常微分方程,用课程调度策略防过早收敛,训练快且推理延迟低,适用于实时应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08808 2026-07-13 cs.CV 新提交 57%

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

StereoSplat+:具有扩散辅助渐进推理的前馈立体高斯点云渲染

Zihua Liu, Masatoshi Okutomi

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 研究从单目立体观察恢复高质量3DGS场景的问题,提出StereoSplat+框架,包含StereoSplat估计器及扩散增强单步渐进推理方案,实验表明该方法提升了新视图渲染质量和几何精度,优于现有前馈3DGS基线。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08674 2026-07-10 cs.CV 新提交 57%

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection

变换能揭示真相吗?用于广义人工智能生成图像检测的生成残差学习

Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik

机构 * University of Michigan Flint(密歇根大学弗林特分校) Korea Aerospace University(韩国航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对生成式AI带来的威胁及AIGI检测难题,提出GenRes框架,通过神经张量网络建模关系特征增强泛化;引入GenRes++,用注意力机制聚合多变换样本特征;利用PE-Core提取特征,实验证明GenRes++性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18664 2026-07-09 cs.SD cs.AI 新提交 57%

NeuralMUSIC: A Hybrid Neural-Subspace Framework for Robot Sound Source Localization

NeuralMUSIC: 一种用于机器人声源定位的混合神经-子空间框架

Yizhuo Yang, Junqiao Fan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 提出NeuralMUSIC混合框架,结合神经网络估计空间协方差矩阵与经典MUSIC子空间方法,通过频率注意力融合和自监督学习提升机器人声源定位的鲁棒性和跨域泛化能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06291 2026-07-08 cs.CV cs.HC 新提交 57%

AlayaWorld: Long-Horizon and Playable Video World Generation

AlayaWorld:长期可玩视频世界生成

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 研究旨在解决游戏世界构建难题,核心方法是提出AlayaWorld全栈开源框架,可实现开放式实时交互,统一开发流程,主要贡献是为生成世界模型研究和应用奠定实践基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏