arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-18 至 2026-08-18 共收录 166 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2608.15509 2026-08-18 cs.RO cs.FL cs.LG 新提交 62%

Temporal Logic Guided Universal Task Representations for Reinforcement Learning

用于强化学习的时序逻辑引导通用任务表示

Hao Zhang, Zhangli Zhou, Zhen Kan

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) Chinese Academy of Sciences(中国科学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出受时序逻辑启发的通用任务表示框架LOTUS,将其集成至强化学习算法,通过LTL编码器建模语义、双模拟度量保障稳定性,在多场景下的学习效率、泛化能力等指标优于现有方法。

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems (Early Access). Project page: https://lotus-website.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16264 2026-08-18 cs.RO 新提交 57%

Cyclops: LiDAR as a Camera That Dreams in Color

Cyclops:以彩色进行“梦境”的相机式激光雷达

Wei Gao, Jian Shu, Mingle Zhao, Maani Ghaffari, David Kong, Chengzhong Xu, Hui Kong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出Cyclops框架,将稀疏NRS-LiDAR强度转为RGB视频,通过LBM等技术缓解帧间闪烁,合成RGB可使感知模型在多任务上优于LiDAR基线与传统相机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15707 2026-08-18 cs.RO 新提交 57%

GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning

GAINS:在强化学习中利用不一致的人类干预信号

Xinyi Zhang, Yinuo Zhao, Pei Ren, Lechun Jiang, Huiqian Jin, Lei Sun, Dapeng Wu, Zhengping Che, Chi Harold Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本研究提出GAINS框架,采用带分位数Q网络的分布强化学习建模人类干预引发的回报变异性,结合悲观探索策略,在模拟与现实场景中使任务成功率较RLIF高22%,故障恢复成功率最高提升43%,凸显该建模对现实部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 人机交互与遥操作 2 篇

2608.16728 2026-08-18 cs.RO 新提交 57%

Design Optimization for Large High-Force Soft Robot Manipulators Under Gravitational Loads

受重力载荷作用的大型高力软机器人机械臂的设计优化

Isara Cholaseuk, Penelope Llibre, Alexa Kyriacou, Audrey Wang, Akua K. Dickson, Ran Jing, Juan C. Pacheco Garcia, Andrew P. Sabelhaus

机构 * Boston University(波士顿大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 针对大型高力软机器人机械臂设计难题,提出带抗屈曲约束的几何优化方法,通过闭式解预测满足约束且力最大的构型,可预先判断大尺寸软机械臂是否适用于物理交互。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15784 2026-08-18 cs.RO 新提交 57%

Reliable Piezoresistive Strain Sensing Through Physical Limits and Uncertainty Monitoring

基于物理极限与不确定性监测的可靠压阻式应变传感

Carmen Ballester, Víctor Muñoz, Dorin Copaci, Dolores Blanco

机构 * Universidad Carlos III de Madrid(马德里卡洛斯三世大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 针对柔性压阻式应变传感器的误差问题,本文提出结合物理信息概率逆模型与三状态监测器的可靠性框架,经测试提升拟合精度与覆盖率,可有效捕捉超范围及异常状况,无需标记故障样本。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人数据与评测 32 篇

2608.15938 2026-08-18 cs.RO 新提交 83%

Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies

机器人学中的开环执行再探讨:迈向反应式、高性能策略

Michael Zeng, Abhinav Agarwal, Ajay Bati, Brian Lee, Siddharth Ancha, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Mundane Systems Inc.(芒德系统公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究探讨机器人开环执行机制,发现长开环执行主要助短上下文策略模仿非马尔可夫示范,专家非马尔可夫性影响远超复合误差,长上下文下闭环策略更优,推动反应式策略范式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15427 2026-08-18 cs.SE cs.RO 版本更新 83%

Formalisms for Robotic Mission Specification and Execution: A Comparative Analysis

机器人任务规范与执行的正式方法:比较分析

Gianluca Filippone, Sara Pettinari, Patrizio Pelliccione

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文比较了四种机器人任务规范形式化方法,分析其在任务描述中的适用性、表达能力和工具支持,为设计鲁棒且适应性强的机器人任务提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-08-18 eess.SP 版本更新 82%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14713 2026-08-18 cs.RO cs.CV 新提交 81%

SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception

SpotlessGS:面向机器人感知的动态光照下可重光照三维高斯溅射技术

Liang Hong, Jiaxin Wei, Simon Schaefer, Stefan Leutenegger, Jaehyung Jung

机构 * Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对机器人在差光照环境下感知性能下降问题,提出SpotlessGS方法,通过优化光照参数、引入SH光照模型及MLP-BRDF,实现可重光照三维重建,提升了渲染与感知性能。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 79%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15917 2026-08-18 cs.RO cs.AI cs.CV 新提交 75%

Pre-training Visual Dexterity in Simulation

在仿真环境中预训练视觉灵巧性

Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Scale AI(Scale AI公司)

专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。

Comments Project page: https://spd.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09860 2026-08-18 cs.RO cs.AI 版本更新 74%

RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

RoboLab:一种高保真模拟基准,用于分析任务通用策略

Jenai Xuning Yang, Rishit Dagli, Alex Zook, Hugo Hadfield, Ankit Goyal, Stan Birchfield, Fabio Ramos, Jonathan Tremblay

机构 * NVIDIA University of Toronto(多伦多大学) The University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotics(abstract,journal_ref);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RoboLab通过高保真模拟环境评估任务通用策略的真实泛化能力,提供120个任务的视觉、程序和关系能力测试,揭示当前最佳模型的性能差距。

Journal ref Robotics: Science and Systems XXII, Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 73%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 机器人数据与评测 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新 72%

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16715 2026-08-18 cs.RO 新提交 70%

MatchingPolicy: Correspondence-Aware Policy Enables Cross-Object In-Context Learning

MatchingPolicy:具备对应感知能力的策略实现跨物体的上下文学习

Qijin She, Hanyang Yu, Zeming Li, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出MatchingPolicy框架,通过解耦演示-场景匹配与策略学习,结合视觉基础模型和两阶段匹配算法,在RLBench及真实操作任务上实现了跨物体的少样本泛化性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 70%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15605 2026-08-18 cs.CV 新提交 70%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at https://github.com/CKL9001/AlloEgo-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00801 2026-08-18 cs.AI cs.IR 版本更新 70%

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

合成网络:用于诊断语言代理知识弱点的对抗性定制迷你互联网

Shrey Shah, Levent Ozgur

机构 * Microsoft(微软)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 本研究提出合成网络基准测试,通过对抗性内容测试揭示语言代理在处理冲突信息时的弱点,为高风险领域中的可靠代理开发提供评估框架。

Comments This version includes a revised manuscript presentation and formatting, expanded methodological and experimental details, enhanced reproducibility documentation, and improved benchmark framing and evaluation descriptions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO cs.SY eess.SY 新提交 67%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12407 2026-08-18 cs.RO cs.CV cs.LG 版本更新 67%

MiDAS: A Multimodal Data Acquisition System and Dataset for Robot-Assisted Minimally Invasive Surgery

MiDAS:一种用于机器人辅助微创手术的多模态数据采集系统和数据集

Keshara Weerasinghe, Seyed Hamid Reza Roodabeh, Andrew Hawkins, Zhaomeng Zhang, Zachary Schrader, Homa Alemzadeh

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MiDAS是一种开源多模态数据采集系统,能够实现机器人辅助微创手术的非侵入式数据采集,并发布首个高保真仿真模型的缝合任务数据集。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15175 2026-08-18 cs.RO cs.AI 新提交 62%

LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset

LAPF:基于大语言模型智能体的路径查找器,使用UAVScenes数据集

Yousef Emami, Mohammadhossein Homaei, Hao Zhou, Miguel Gutiérrez Gaitán, Atefeh Hajijamali Arani, Rui Zhang

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LLM智能体的LAPF框架,整合多模块构建闭环认知架构,在城镇级无人机导航中实现了更优路径效率,且无钳位事件,性能优于CoT提示方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07084 2026-08-18 cs.RO cs.AI 版本更新 62%

Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models

流运动策略:基于流匹配模型的机械臂运动规划

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学Zachry土木与环境工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出流运动策略,一种基于流匹配模型的机械臂运动规划方法,通过生成路径分布实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 62%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01584 2026-08-18 cs.LG cs.AI cs.CY 版本更新 62%

VirnyFlow: Optimizing ML Pipelines for Accuracy, Fairness, and Stability at Scale

VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化

Denys Herasymuk, Anastasiia Mozghova, Nazar Protsiv, Vladyslav Sydorak, Julia Stoyanovich

机构 * Ukrainian Catholic University(乌克兰天主教大学) New York University(纽约大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 57%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16741 2026-08-18 cs.RO 新提交 57%

Semantic- and Density-Aware Planning for Accessibility-Preserving Multi-Object Placement

面向可访问性保持的多物体放置的语义与密度感知规划

Benno Wingender, Nils Dengler, Nicolas Busch, Sicong Pan, Maren Bennewitz

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16014 2026-08-18 cs.CV 新提交 57%

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)

Jinnyeong Kim, Juhyung Choi, Woohyeok Kim, Sunghyun Cho, Seung-Hwan Baek

机构 * POSTECH(浦项科技大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。

Comments 14 pages, ECCV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 57%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 57%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏