arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 2927 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 928 篇

2607.05013 2026-07-07 cs.CL cs.LG 新提交 57%

Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

知识所知,语言所表:解开大语言模型中数学可解性的潜在方向

Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos

机构 * Institute for Language and Speech Processing, Athena Research Center(语言与语音处理研究所,雅典娜研究中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究大语言模型数学推理中数学问题可解性判定难题,通过分别探究可解性知识与语言表达的表征,揭示二者在模型隐藏状态中可分离,还表明提示不可解线索等可减少编造,操纵表征能改善模型弃权。

Comments 14 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04612 2026-07-07 cs.GR cs.CV 新提交 57%

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

StructuredEdit:通过可微参数传播实现约束感知的平面设计编辑

Veeramanohar Avudaiappan, Ritwik Murali

机构 * Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India(电子与电子工程系,阿米特拉工程学院,科伊巴托尔,阿米特拉世界学院,印度) Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India(计算机科学与工程系,阿米特拉计算学院,科伊巴托尔,阿米特拉世界学院,印度)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对平面设计编辑在严格约束下操作难的问题,提出StructuredEdit将设计编辑转为参数操作,核心方法是可微参数传播,贡献是提升了约束满意度等指标,还减少了用户编辑时间和校正迭代次数。

Comments 3 page poster short paper.2 Figures, 2 Tables. Planned to submit to SIGGRAPH Asia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04554 2026-07-07 cs.RO 新提交 57%

HUGS: Guiding Unified Dexterous Grasp Synthesis Across Modes and Scales via Learned Human Priors

HUGS:通过学习人类先验知识指导跨模式和尺度的统一灵巧抓取合成

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Kangchen Lv, Li Huang, Yi Ren, Xiang Li

机构 * Tsinghua University(清华大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 研究跨尺度物体的灵巧抓取问题,提出HUGS框架,通过学习物体条件下的人类先验知识指导优化,平衡成功率和多样性,提升了接触模式覆盖与合成成功率,合成大量机器人抓取数据。

Comments The first two authors contributed equally. Project website: https://hugs-dex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04260 2026-07-07 cs.RO 新提交 57%

FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control

用于物理交互的FLOAT无人机:侧向气流减少、力扳手建模和自适应控制

Junxiao Lin, Kehan Zhou, Shuhang Ji, Yimin Peng, Shen Wang, Jialiang Hou, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院网络系统与控制研究所) Differential Robotics Technology Company(差分机器人技术公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对下一代无人机空中物理交互,提出FLOAT无人机。通过同轴双旋翼布局、控制面等设计实现多维度力扳手生成等。贡献包括量化侧向气流减少,建立高保真模型并嵌入分配器,实验证明提升控制精度等。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03828 2026-07-07 cs.RO 新提交 57%

ObjRetarget: An Object-Aware Motion Retargeting Framework with Anthropomorphic Arm Constraints and Polyhedral Hand Modeling

ObjRetarget:一个具有拟人化手臂约束和多面体手部建模的物体感知运动重定向框架

Yuanchuan Lai, Qing Gao, Ziyan Liang, Junjie Hu, Zhaojie Ju

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Computing, University of Portsmouth(朴茨茅斯大学计算学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出ObjRetarget框架,用于从人类视频学习机器人灵巧操作,集成拟人化手臂轨迹约束与结构化手-物体几何建模,提升操作成功率与接触稳定性,泛化性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 57%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02796 2026-07-07 cs.CV 新提交 57%

Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements

生物力学感知的灵巧手部运动多视图无标记运动捕捉

Pouyan Firouzabadi, J. D. Peiffer, Kunal Shah, Anton Sobinov, Lee E. Miller, R. James Cotton, Wendy M. Murray

机构 * Biomedical Engineering Department, Northwestern University(西北大学生物医学工程系) Shirley Ryan AbilityLab(谢里尔·瑞安能力实验室) Department of Organismal Biology and Anatomy, University of Chicago(芝加哥大学器官生物学与解剖学系) Department of Physical Medicine and Rehabilitation, Northwestern University(西北大学物理医学与康复系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究评估一种生物力学重建方法在无标记运动捕捉中追踪灵巧手部运动的性能,用自定义8相机设置采集数据,与两阶段方法对比,该方法更有效利用二维数字关键点信息,能支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26092 2026-07-07 cs.CV 新提交 57%

TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy

TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹以实现逼真的视频虚拟试穿

Hao Sun, Hao Yan, Mengting Chen, Quanjian Song, Yu Li, Juan Cao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Sheng Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Xiamen University(厦门大学) Alibaba Group(阿里巴巴集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出TryOnCrafter,首个基于DiT的统一框架,通过可渲染4D试穿代理解耦人体与环境,实现相机可控的视频虚拟试穿,支持任意视角合成和下游应用。

Comments Project Page: https://sunhao242.github.io/TryOnCrafter_web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02432 2026-07-03 cs.AI cs.CL cs.CY 新提交 57%

Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

使用大语言模型对Linux/bash考试进行自动评分:一种四层认知分类方法

Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J. Rodriguez-Martinez, Lorena Otero-Cerdeira

机构 * Universidade de Vigo, Department of Computer Science, ESEI-Higher School of Computer Engineering(维戈大学计算机科学系ESEI高等计算机工程学院) IFCAE-Institute for Research in Physics, Computing and Aerospace Science(IFCAE物理、计算与航空航天科学研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究评估四种前沿大语言模型(GPT、Claude Opus、Gemini、GLM)在Linux/bash命令评分中的表现,采用四层认知分类法,发现Gemini 3.0 Pro配合评分标准提示达到最高人机一致性(ICC=0.888),且问题复杂度是评分难度的可靠预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02187 2026-07-03 cs.LG cs.CR 新提交 57%

Privacy-Preserving and Verifiable Approximate Distributed Coded Computing

隐私保护且可验证的近似分布式编码计算

Xavier Martínez-Luaña, Alba Gude-Santos, Manuel Fernández-Veiga, Rebeca P. Díaz-Redondo

机构 * Galician Research and Development Center in Advanced Telecommunications (GRADIANT)(加利西亚先进电信研究与发展中心(GRADIANT)) atlanTTic, Information & Computing Lab (ICLAB), Telecommunication Engineering School, Universidade de Vigo(atlanTTic,信息与计算实验室(ICLAB),电信工程学校,维戈大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 提出一种模型无关的分布式学习框架,结合隐私增强编码计算与鲁棒聚合及验证技术,同时抵御联邦和去中心化学习中的隐私泄露与恶意攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01768 2026-07-03 cs.CV 新提交 57%

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

JointHOI:联合生成接触图增强手物交互生成

Mingyeong Song, Jungbin Cho, Jisoo Kim, Ananya Bal, Kartik Sharma, Youngjae Yu, Laszlo A. Jeni, Junhyug Noh

机构 * Ewha Womans University(梨花女子大学) Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出单阶段扩散框架JointHOI,联合生成3D手物运动与距离接触图,通过接触引导采样提升时间稳定性和物理合理性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01628 2026-07-03 cs.CV 新提交 57%

Online Segment 3D Gaussians via Launching Virtual Drones

通过发射虚拟无人机在线分割3D高斯体

Liwei Liao, Rongjie Wang, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出SAGO框架,通过虚拟无人机将3D分割转化为在线最佳视角规划任务,无需预设置即可在亚秒内从3D高斯体中提取干净3D资产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01304 2026-07-03 cs.RO cs.DC cs.NI 新提交 57%

The Three Dimensions of ROS 2 Middleware

ROS 2中间件的三个维度

Sanghoon Lee, Taehun Kim, Angelo Corsaro, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院(DGIST)) Eclipse Zenoh

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文系统调研ROS 2中间件,提出空间、时间和状态三个结构维度框架,分析其架构限制与权衡,为鲁棒可扩展的机器人中间件研究提供路线图。

Comments 31 pages, 3 figures. Survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00334 2026-07-02 cs.AI 新提交 57%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 机器人操作 :robotic(abstract);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00326 2026-07-02 cs.RO 新提交 57%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:面向分散式安全多臂运动规划的神经哈密顿-雅可比可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 提出基于神经哈密顿-雅可比可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效且泛化能力强的实时多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00001 2026-07-02 cs.AI cs.CY 新提交 57%

Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction

建构性对齐:人机交互中的偏好动态治理

Max Kanwal, Caryn Tran

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出建构性对齐范式,将对齐问题重构为控制人类偏好轨迹演化的控制问题,而非静态偏好满足,通过控制论框架确保价值轨迹的连贯性与反思性。

Comments 23 pages, 1 figure; Proceedings of the AAAI-26 Workshop on Machine Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31703 2026-07-01 cs.CV 新提交 57%

Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints

Phantom: 一种结合潜在与空间约束的统一换脸深度伪造防护框架

Jungkon Kim, Cheolseung Jung, Jong-Min Choi, Juseong Lee

机构 * Samsung Electronics, AI Platform Center(三星电子,AI平台中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出Phantom框架,通过自适应合成身份偏移目标引导潜在优化,并对语义相关面部区域施加掩蔽扰动,在换脸防护中提升成功率27.8%-16.6%,同时增强视觉质量。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 57%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31236 2026-07-01 cs.RO 新提交 57%

TactX: Learning Shared Tactile Representations Across Diverse Sensors

TactX: 跨不同传感器的共享触觉表示学习

Junsung Park, Sachin Bhadang, Carmelo Sferrazza, Sha Yi, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校) Seoul National University(首尔大学) Amazon FAR(亚马逊FAR)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出TactX框架,通过配对接触数据训练模态特定编码器,将电阻、磁和视觉三种触觉传感器的观测映射到共享潜空间,实现零样本策略迁移,平均成功率从27.5%提升至45.9%。

Comments Submitted to CoRL 2026. 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28270 2026-06-29 cs.AI cs.MA 新提交 57%

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体原生免疫系统:架构、分类与工程

Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li

机构 * Novo Ordo for AI

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27773 2026-06-29 cs.CV 新提交 57%

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

ModaFlow: 模态感知流匹配实现高保真虚拟试穿

Xiangyu Sai, Meysam Madadi, Sergio Escalera, Yong Xu

机构 * South China University of Technology(华南理工大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Guangdong Provincial Key Laboratory of Multimodal Big Data Intelligent Analysis(广东省多模态大数据智能分析重点实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出ModaFlow框架,通过模态感知引导、正则化损失和掩码操作策略,在虚拟试穿中实现衣物细节与人体几何的精确对齐,FID降低约30%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27344 2026-06-26 cs.RO 新提交 57%

VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity

VibeAct: 振动到动作——用于接触丰富反应性机器人灵巧性的方法

Yuemin Mao, Uksang Yoo, Jean Oh, Jonathan Francis, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出VibeAct框架,通过共享接触和滑移的物理表示,桥接真实振动触觉感知与基于模拟的强化学习,在灵巧手操作任务中优于基线方法,并成功迁移到真实平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27287 2026-06-26 cs.AI 新提交 57%

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

大型语言模型在自动化简历筛选中的提示注入:单注入与多注入设置

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究LLM在简历筛选中的提示注入攻击,发现当简历质量同质且注入者少时有效,但随注入者增多效果消失;质量异质时虽平均效果减弱,但偶尔让低质量候选人超越高质量,引发公平问题。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26442 2026-06-26 cs.LO cs.AI 新提交 57%

AXLE: A Cloud Infrastructure for Lean 4 Theorem Proving Utilities

AXLE:面向 Lean 4 定理证明工具的云基础设施

Jimmy Xin, Alex Schneidman, Chris Cummins, Karun Ram, Srihari Ganesh, Jannis Limperg

机构 * Axiom Math Recursive Superintelligence, Inc.

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出 AXLE 云服务,提供可扩展的 Lean 4 证明操作、提取与验证工具,支持多版本、多租户隔离,已处理超5亿请求并助力 Putnam 竞赛满分。

Comments Accepted at the 3rd AI for Math Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26115 2026-06-26 cs.CY cs.AI 新提交 57%

A Multi-Layer AI Framework for Information Landscape Analysis

一种用于信息景观分析的多层AI框架

Maryam Fooladi, Federico Bottino

机构 * Kakashi Ventures Accelerator (KVA)(Kakashi Ventures加速器)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出多层AI框架,从来源可靠性、事实结构、框架、偏见、情感激活、操纵模式和传播动态等多维度分析信息失序,支持认知映射。

Comments Accepted at the Information Disorder (InDor) Workshop, LREC 2026. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25619 2026-06-25 cs.CV 新提交 57%

ScaleHP: Estimating Hand Pose in Metric Space

ScaleHP: 在度量空间中估计手部姿态

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Visincept International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) South China University of Technology(华南理工大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。

Comments 27 pages, 8 figures, 6 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25348 2026-06-25 cs.RO 新提交 57%

Self Capacitive Tactile Sensor System designed for Companion Robots

面向伴侣机器人的自电容触觉传感器系统

Mohsin Ali, Hidenobu Sumioka, Shuhei Ikemoto

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology(九州工业大学 生命体工学研究科) Advanced Telecommunications Research Institute International(国际电气通信基础技术研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种基于自电容原理的简单、可扩展触觉传感器系统,采用单层导电织物和FPGA决策树分类器,实现100点阵列的实时、低延迟触觉检测,满足伴侣机器人全身触觉需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 57%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24496 2026-06-24 cs.CR cs.AI 新提交 57%

Red-Teaming the Agentic Red-Team

红队测试代理型红队

Dario Pasquini, Michal Bazyli, Taras Fedynyshyn, Artem Sorokin

机构 * Cracken Information Protection Department, Lviv Polytechnic National University(利沃夫理工学院信息保护系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文首次深入分析主流进攻性安全代理系统的安全漏洞,揭示其设计缺陷可导致API密钥泄露、持久化控制及宿主机失陷,并提出架构级缓解设计原则。

Comments v0.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 57%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏