arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 3875
2608.16889 2026-08-18 cs.RO cs.AI cs.CV 新提交

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作

Bingxin Xu, Yuzhang Shang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16885 2026-08-18 cs.RO 新提交

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16870 2026-08-18 cs.LG 新提交

Data-Efficient and Interpretable Classification of Circulating Tumor Cell Phenotypes in Microfluidic Devices via Deep Learning

基于深度学习的微流控设备中循环肿瘤细胞表型的高效数据与可解释性分类

Serena Su, Yifan Wang, Senwei Liang

机构 * Texas Tech University(德克萨斯理工大学)

AI总结 该研究针对微流控设备中CTC表型分类的数据稀缺与可解释性问题,提出含SubSeq增强策略的可解释DNN框架,提升了分类准确率并揭示局部轨迹的生物物理信息价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16853 2026-08-18 cs.RO 新提交

FlexWorm: Primitive-augmented Hybrid Contact-motion Planning for Suction-based Multi-segment Deformable Robots

FlexWorm:用于基于吸盘的多段可变形机器人的基元增强混合接触-运动规划

Zili Tang, Tiecheng Guo, Qinyue Zhang, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

AI总结 FlexWorm框架为基于吸盘的多段可变形机器人提出规划方法,含IKHS与PaHS,仿真和硬件实验表明其在复杂环境下规划性能更优且鲁棒性良好。

Comments 9 pages, 12 figures, accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026. Supplementary video: https://youtu.be/OQR5Sx5Bwnc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16844 2026-08-18 cs.LG cs.AI cs.CL 新提交

Proteus: Incremental Memory Activation for Long-Context Sequence Modeling

Proteus:面向长上下文序列建模的增量式内存激活机制

Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville

机构 * Mila(米拉计算科学研究所) Google(谷歌公司)

AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16834 2026-08-18 cs.CL cs.AI 新提交

Model Hypnosis: Strong control of AI via additive subliminal effects

模型催眠:通过叠加阈下效应对AI进行强控制

Enric Boix-Adsera, Benedict Tessler

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16833 2026-08-18 cs.LG 新提交

Time-Aware Validation of Machine Learning Fuel Consumption Models: Evidence from 1\,Hz Operational Data, CCGS \textit{Sir Wilfrid Laurier}

机器学习燃油消耗模型的时间感知验证:来自1Hz运行数据、CCGS Sir Wilfrid Laurier号的证据

Samarasimha Reddy Chittamuru, Ayhan Akinturk, Allison Kennedy, Joshua Barnes, Matthew Hamilton

机构 * National Research Council Canada(加拿大国家研究委员会) Memorial University of Newfoundland(纽芬兰纪念大学)

AI总结 针对船舶燃油消耗模型验证的时间泄漏问题,采用时间序列交叉验证等方法,结合CCGS Sir Wilfrid Laurier号的1Hz运行数据,评估回归模型与物理基线的性能,为燃油消耗模型的可靠验证提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16829 2026-08-18 cs.LG cs.AI 新提交

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

CaliBench:视频世界模型的随机动力学是否经过物理校准?

Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke

机构 * Odyssey(奥德赛公司)

AI总结 CaliBench用于测试视频世界模型的物理校准,将性能分解为可评分性与校准度,发现多数场景-模型组合显著未校准,发布了mnTV指标用于模型对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16824 2026-08-18 cs.LG cs.CR cs.IR 新提交

GEO-Flag: Detecting and Measuring GEO-Optimized Web Content

GEO-Flag:检测与测量经GEO优化的网页内容

Junjie Chu, Ye Leng, Mingjie Li, Yun Shen, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) HPE(慧与科技) University of Waterloo(滑铁卢大学)

AI总结 本研究针对生成式引擎优化(GEO)网页检测不足的问题,构建GEOFlagBench基准,提出干预配对训练(IPT)方法,开发GEO门控智能体系统,还部署流程测量出GEO总体流行率为8.90%。

Comments 21 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16822 2026-08-18 cs.RO 新提交

Adaptive Repulsive Pheromone Clustering for Foraging Robot Swarms

面向觅食机器人群体的自适应排斥信息素聚类算法

Carlos Pena-Caballero, Constantine Tarawneh, Qi Lu

机构 * The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)

AI总结 针对CPFA重复探索导致效率低的问题,提出ARPC算法,通过排斥信息素航点聚类引导机器人,在仿真中显著优于CPFA和GPFA。

Comments 14 pages, 5 figures, The 18th International Symposium on Distributed Autonomous Robotic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16810 2026-08-18 cs.CV cs.LG q-bio.QM 新提交

Unsupervised Learning of Cell Instances with Generative Routing Pyramids

基于生成路由金字塔的细胞实例无监督学习

Ziwen Liu, Martin Weigert

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据分析与人工智能中心(ScaDS.AI)) Technische Universität Dresden(德累斯顿工业大学)

AI总结 该研究提出基于生成路由金字塔的无监督方法,实现未标注显微镜图像的细胞实例分割与表型分类,在实例分割及细胞表型生成建模上表现具竞争力。

Comments 15 pages, 4 figures; ECCV 2026 Workshop BIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-18 cs.RO cs.AI 新提交

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16805 2026-08-18 cs.CV cs.AI 新提交

Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models

诊断大视觉语言模型中的密集同类属性绑定错误

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin

机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) China Telecom Digital Intelligence Technology Co., Ltd.(中国电信数字智能科技有限公司) Shenyang Aerospace University(沈阳航空航天大学) University of Nottingham Ningbo China(宁波诺丁汉大学)

AI总结 本研究提出InstaBind-Lite基准,量化大视觉语言模型的密集同类属性绑定错误(DSCAM),发现其错误率被总准确率掩盖,多数转移来自相邻实例,该基准可评估模型对属性所属实例的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16804 2026-08-18 cs.AI 新提交

Cross-Sign Language Transfer Learning Using Domain Adaptation with Multi-scale Temporal Alignment

基于多尺度时间对齐的领域自适应的跨手语迁移学习

Keren Artiaga, Yang Li, Ercan Engin Kuruoglu, Wai Kin, Chan

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The University(该大学)

AI总结 本研究针对手语识别资源匮乏问题,采用带多尺度时间对齐的领域自适应方法TA3N,结合TRN模块,实验表明其在ASL识别上优于神经网络迁移学习,且RGB模式性能优于光流模式。

Journal ref Multimedia Tools and Applications 83 (2024) 37025-37051

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16801 2026-08-18 cs.AI cs.SE 新提交

When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

智能体协作:多智能体AI编码中的协作度量

Giuseppe Destefanis, Tomaso Aste

机构 * University College London(伦敦大学学院)

AI总结 本研究引入时间网络工具度量多智能体AI编码团队的协作,分析团队规模、结构等对协作的影响,发现智能体存在主动获取隐藏评分材料的倾向,相关结果在封闭环境中得到复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16798 2026-08-18 cs.CL cs.AI cs.LG 新提交

ClawGym II: Exploring Black-Box RL on Agent Harness

ClawGym II:探索智能体控制框架下的黑盒强化学习

Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange Zhang, Daixuan Cheng, Yan Xing, Qi Yun, Xuxing Chen, Danyang Li, Feng Chang, Chuan Hao, Ran Tao, Jian Yang, Bryan Dai, Wayne Xin Zhao, Mingjie Tang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) IQuest Research(智臻研究)

AI总结 本研究提出统一黑盒强化学习框架,通过沙箱基础设施、前缀树轨迹重建等技术,实现通用智能体的稳定可扩展优化,在ClawGym-Bench等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-18 cs.RO cs.AI cs.CL 新提交

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16793 2026-08-18 cs.CV 新提交

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

PixRestore:基于像素扩散Transformer的统一图像修复模型

Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出无VAE的像素空间DiT模型PixRestore,通过流匹配与DINO特征可靠性预测实现UIR,仅50M参数且单步推理,在效率与修复性能上优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16791 2026-08-18 cs.CV cs.AI cs.CR cs.MM 新提交

Steering the Flow: Inverting Face Recognition Models via Gradient-Guided Flow Matching

引导流:通过梯度引导流匹配实现人脸识别模型的逆攻击

Ye Lu, Shen Wang, Zhaoyang Zhang, Yihan Yan, Li Liu, Runze Liu, Fanghui Sun

机构 * School of Cyberspace Science, Harbin Institute of Technology(哈尔滨工业大学网络空间安全学院)

AI总结 本文提出两阶段白盒模型逆攻击方法SFMI,通过梯度引导流匹配将逆攻击转化为轨迹引导任务,在人脸数据集上实现了优于现有方法的攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16786 2026-08-18 cs.CV 新提交

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

重新审视潜在扩散模型中无分类器引导方法

Artem Sergievskii, Artyom Turevich, Sergey Kastryulin

机构 * HSE University(高等经济大学) Yandex(Yandex公司)

AI总结 本文重新评估了八种源于无分类器引导(CFG)的无训练技术,发现无一种方法始终优于CFG,APG仅获名义最佳分数,注意力扰动方法在不同模型上表现有差异,CFG仍是低成本竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16785 2026-08-18 cs.CV 新提交

Calibration-Free Vehicle Speed Estimation: A Monocular Keypoint-Template Approach

无校准的车辆速度估计:单目关键点-模板方法

Gaofeng Su, Keya Li, Raja Sengupta, Kara M. Kockelman

机构 * The University of California, Berkeley(加利福尼亚大学伯克利分校) The University of Texas, Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出一种无校准的单目车辆速度估计框架,采用36关键点车辆模板与YOLO关键点检测,在VS13等数据集上实现低MAE,可用于便携式设备的低成本速度执法。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16776 2026-08-18 cs.AI 新提交

GRIP: Grounded Reasoning via Information-Restricted Premises

GRIP:基于信息受限前提的接地推理

Lirui Teng

机构 * University of Waterloo(滑铁卢大学)

AI总结 针对RAG中查询主导导致证据失效的问题,提出GRIP方法,通过容量不对称设计优化信息编码,在五个推理基准上实现性能提升,大幅降低互信息与幻觉。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16773 2026-08-18 cs.LG 新提交

Beyond $L_2$: Generalizing Abductive Latent Explanations to Diverse Prototype-Based Architectures

超越$L_2$:将溯因潜在解释推广到多样化的基于原型的架构

Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela Cancila

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CEA(法国原子能和替代能源委员会)

AI总结 本文将溯因潜在解释(ALE)框架推广到支持非欧几里得原型架构,推导了适配不同几何变体的边界算法,通过图像分类器验证了理论构造,实现了对多样化原型架构可解释性的严格跨架构比较。

Comments Accepted at ECML-PKDD 2026, Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16765 2026-08-18 cs.CV cs.AI 新提交

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

TRACE-Bench:多参考图像生成的分解与诊断

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏