arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2052
2609.22086 2026-09-21 cs.AI cs.CV 新提交

Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

Designer-RSI:从用户流量中演化程序性记忆用于智能体图形设计

Hongyang Du, Lan Yan, Christian Flores, Asim Kadav

机构 * Adobe Brown University(布朗大学)

AI总结 提出Designer-RSI框架,通过外部程序性记忆从用户流量中持续演化设计技能,在无权重更新和人工标签下,将GenEval2成功率从72.7%提升至99.3%,并显著提高多个基准的胜率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22085 2026-09-21 cs.RO 新提交

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

SeeQ:训练用于长时程机器人操作的通才价值函数

Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 SeeQ通过预测当前子任务的Q值来缩短信用分配跨度,利用离线数据中的子任务标注训练,并在测试时自回归预测子任务,从而提升长时程机器人操作策略的性能。

Comments Website: : https://saksham002.github.io/seeq/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22083 2026-09-21 cs.CV 新提交

MintAct: A Unified Visual Agent for Digital Environments

MintAct:面向数字环境的统一视觉智能体

Mingfei Gao, Rui Tian, Haiming Gang, Bohan Zhai, Le Zhang, Yuanzheng Gong, Di Feng, Ege Özsoy, Kaixin Ma, Vishwesh Kirthivasan, Oğuzhan Fatih Kar, Roman Bachmann, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

AI总结 MintAct是一个统一视觉语言模型系列,通过可扩展环境和异步强化学习框架,在2B至8B规模下统一UI定位、多步导航和视觉工具使用,性能达到领域专用模型水平,并在OSWorld-Verified上取得48.9的最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22081 2026-09-21 cs.CL 新提交

Cross-sector generalization of accident-process role classification in occupational accident narratives

职业事故叙述中事故过程角色分类的跨部门泛化

Aho Yapi, Pierre Latouche, Arnaud Guillin, Yan Bailly

机构 * Université Clermont Auvergne(克莱蒙奥弗涅大学) Laboratoire de Mathématiques Blaise Pascal (UMR 6620 CNRS)(布莱兹·帕斯卡数学实验室(UMR 6620 CNRS)) LYF SAS(LYF SAS公司) Institut Universitaire de France (IUF)(法国大学研究院)

AI总结 本研究评估法语职业事故叙述中事故过程角色分类的跨部门泛化,通过任务特定适应策略在建筑部门训练后,在冶金等未见语料上达到85.6%-85.8%的平衡准确率,支持可迁移辅助编码系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22075 2026-09-21 cs.RO 新提交

LIMBO: Learning and Internalizing Model-Free Barrier Objectives for Agile and Safe Whole-Body Control

LIMBO:学习并内化无模型障碍函数目标以实现敏捷且安全的全身控制

Jake Gonzales, Arturo Flores Alvarez, Yu-Ming Chen, Aaron D. Ames, Lillian J. Ratliff, Manikantan Nambi

机构 * Amazon(亚马逊) University of Washington(华盛顿大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) California Institute of Technology(加利福尼亚理工学院)

AI总结 LIMBO框架通过风险引导采样学习Q-CBF安全证书并蒸馏至任务策略,在29自由度人形机器人上实现无需在线过滤的敏捷安全全身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22073 2026-09-21 cs.RO 新提交

Duty Factor Predicts Robust Constrained Quadrupedal Locomotion Across Gait Types

占空比预测跨步态类型的鲁棒约束四足运动

James Zhu, David Ologan, George Ortiz, Thomas Chun Fai Lee, Selvin Garcia Gonzalez, Ardalan Tajbakhsh, Pinhas Ben-Tzvi, Aaron M. Johnson

机构 * University of Miami(迈阿密大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究通过三种控制方法证明占空比比步态类型更能预测四足运动的鲁棒性,并作为低维参数指导狭窄地形下的鲁棒运动选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22069 2026-09-21 cs.CV 新提交

OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation

OmniVBench:面向全参考到视频生成的基准与大规模数据集

Wenxue Li, Peiyan Guan, Haoyang Jiang, Junxian Cai, Hualuo Liu, Chunjie Zhang, Chong Guan, Songlian Li, Taiyi Wu, Yongjian Yu, Xiaotong Zhao, Alan Zhao, Eric Liu, Xi Chen, Yu Liu, Lei Zhu

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对现有基准无法全面评估全参考到视频生成的问题,本文提出OmniVBench基准和Omni-R2V大规模数据集,涵盖7个任务族、18个细粒度任务及12,172个检查项,并揭示当前模型性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22068 2026-09-21 cs.AI 新提交

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

CodeMidas:从代码本身扩展智能体编码强化学习环境

Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang, Hanglong Lv, Yuanxin Liu, Wenhan Ma, Hao Tian, Rang Li, Jinhao Dong, Yikai Zhao, Xiangwei Deng, Hailin Zhang, Liang Zhao, Qi Liu, Lingpeng Kong, Tong Yang, Fuli Luo

机构 * Xiaomi(小米) Peking University(北京大学) University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

AI总结 CodeMidas提出从源代码自动构建编码RL环境的智能体流水线,生成5,545个跨23种语言的任务,训练后显著提升多种编码基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22064 2026-09-21 cs.LG q-bio.NC 新提交

BrainWideBench: Benchmarking large-scale pretraining and across-animal transfer in multi-region neural recordings

BrainWideBench:多区域神经记录中的大规模预训练与跨动物迁移基准

Alexandre Andre, Shivashriganesh P. Mahato, Vinam Arora, Keshav Balaji, Divyansha Lachi, Nanda H. Krishna, Jingyun Xiao, Yizi Zhang, Ximeng Mao, Wenrui Ma, Han Yu, International Brain Laboratory, Daniel Birman, Niccolò Bonacchi, Gaelle A. Chapuis, Joana A. Catarino, Felicia Davatolhagh, Mayo Faulkner, Laura Freitas-Silva, Fei Hu, Julia M. Huntenburg, Anup Khanal, Inês Laranjeira, Petrina Lau, Guido T. Meijer, Nathaniel J. Miska, Jean-Paul Noel, Alejandro Pan-Vazquez, Georg Raiser, Cyrille Rossant, Karolina Z. Socha, Anne E. Urai, Miles J. Wells, Steven J. West, Olivier Winter, Blake Richards, Guillaume Lajoie, Cole Hurwitz, Mehdi Azabou, Matthew R. Whiteway, Liam Paninski, Eva L. Dyer

机构 * University of Pennsylvania(宾夕法尼亚大学) Mila(米拉研究所) Université de Montréal(蒙特利尔大学) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学) Allen Institute(艾伦研究所) William James Center for Research(威廉·詹姆斯研究中心) ISPA - Instituto Universitário(ISPA 大学研究所) University of Geneva(日内瓦大学) Karolinska Institutet(卡罗林斯卡学院) UCLA(加州大学洛杉矶分校) University College London(伦敦大学学院) Champalimaud Foundation(尚帕利莫基金会) Lingang Laboratory(临港实验室) The Chinese University of Hong Kong(香港中文大学) Donders Institute(唐德斯研究所) University of Minnesota(明尼苏达大学) Princeton University(普林斯顿大学) Leiden University(莱顿大学) McGill University(麦吉尔大学) IBM

AI总结 BrainWideBench基于跨276个脑区、139只小鼠的数据,提出三套任务基准,系统评估预训练方法在跨动物迁移中的表现,发现当前方法在行为、动态和解剖结构上的泛化仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22062 2026-09-21 cs.RO 新提交

Gripper-Aware Automatic Dense Packing of Irregular Objects

抓爪感知的不规则物体自动密集装箱

Tianhao Qin, Connor McCann, Berk Calli, Jing Xiao

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

AI总结 提出一种集成感知、抓爪感知放置优化与力引导执行的闭环流水线,在真实机械臂上实现不规则物体密集装箱,并通过消融和基线对比验证其有效性。

Comments Accepted at ISRR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22060 2026-09-21 cs.CV 新提交

Traffic Sign Recognition for Autonomous Driving Using Branched YOLOv2 and Geometric Features

用于自动驾驶的基于分支YOLOv2与几何特征的交通标志识别

Arefeh Rezaei

机构 * K. N. Toosi University of Technology(K. N. Toosi 科技大学)

AI总结 针对自动驾驶中的交通标志识别,提出基于分支YOLOv2与几何特征的系统,实现检测分类并降低计算量,实验表明几何验证提升mAP至0.713。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22055 2026-09-21 cs.LG cs.RO 新提交

Benchmarking World Models for Continual Learning on Compositional Tasks

组合任务持续学习的世界模型基准测试

Haoyu Zhou, Joe Watson, Anson Lei, Ingmar Posner

机构 * University of Oxford(牛津大学)

AI总结 针对机器人操作中的世界模型,提出组合持续学习基准,以分离知识重用与学习新任务,评估显示模块化模型优于传统方法但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22053 2026-09-21 cs.LG 新提交

Particle Competition and Cooperation for Robust Graph Convolutional Network Learning Under Label Noise

粒子竞争与合作用于标签噪声下鲁棒图卷积网络学习

Fabricio Breve

机构 * São Paulo State University - UNESP(圣保罗州立大学)

AI总结 针对GCN对标签噪声敏感的问题,提出PCC+GCN混合框架,利用粒子竞争与合作进行标签精炼,在多个噪声场景下提升准确率并降低计算开销。

Comments Submitted to Neurocomputing. Code and experimental results are publicly available at https://github.com/fbreve/PCC-GCN and https://github.com/fbreve/NoisyGL

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22043 2026-09-21 cs.CL 新提交

An Interpretable Memory Decision Controller for LLM Agents Based on Three-Signal Complementarity: Decoupling Confidence and Consistency

一种基于三信号互补的可解释记忆决策控制器:解耦置信度与一致性

Yiming Zhang, Jinghong Zhang, Haoran Zhao, Yiren Ma, Chunlei Zhao

机构 * Tianjin University of Technology(天津理工大学)

AI总结 提出记忆决策层(MDL),通过三信号互补编码器解耦置信度与一致性,实现零参数白盒记忆信任决策,将冲突记忆下幻觉率降低56.04%,高风险场景接近零幻觉。

Comments 17 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22041 2026-09-21 cs.LG 新提交

$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource

$λ$-Controlled GRPO:将流匹配比率不稳定性转化为预算化资源

Yufeng Wang, Parivesh Priye, Meeshawn Marathe, Ramit Pahwa

机构 * Stony Brook University(石溪大学) Rivian and Volkswagen Group Technologies(Rivian和大众集团科技公司)

AI总结 本文提出$λ$-Controlled GRPO,将流匹配强化学习中的路径方差作为可预算资源,按预测规律校准重要性比率并分配梯度,提升文本准确性和偏好奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22040 2026-09-21 cs.CV cs.RO 新提交

PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models

PRIME:VLA模型中的情境记忆嵌入感知反馈

Erik Deinzer, Naya Baslan, Luca Paparusso, Narunas Vaskevicius, Peter Knott, Luigi Palmieri

机构 * RWTH Aachen University(亚琛工业大学) Robert Bosch GmbH(罗伯特·博世有限公司)

AI总结 PRIME通过情境记忆嵌入的感知反馈机制,以极小参数代价实现意图驱动的感知注意力,在Bench2Drive上取得最先进驾驶得分82.47和60%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22038 2026-09-21 cs.CL 新提交

QuranicMMLU: A Cognitively-Aware Benchmark for Evaluating Generative AI Solutions on Quranic Linguistic Knowledge

QuranicMMLU:一个用于评估生成式AI解决方案在《古兰经》语言学知识上的认知感知基准

Rawan El Ghali, Umm Kulsoom, Anas Madkoor, Dima Faris Alsaudi, Roaa Abdelmagid, Roaa Ibrahim, Raghad Mousa, Hamza Aljaji, Abdullah Khanafer, Abdallah Alkanani, Salah Feras Alali, Rawan Khaled Mohamed, Ehsaneddin Asgari

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University(哈马德·本·哈利法大学卡塔尔计算研究所) Carnegie Mellon University Qatar(卡内基梅隆大学卡塔尔分校) University of Doha for Science and Technology(多哈科技大学) Qatar University(卡塔尔大学) American University of Beirut(贝鲁特美国大学) University of Birmingham(伯明翰大学)

AI总结 QuranicMMLU是一个基于五支柱语言学分类的基准,含980个人工审核问题,用于评估生成式AI在《古兰经》阿拉伯语上的表现,发现多项选择得分虚高,掩盖了开放式回答中的失败。

Journal ref Arabic NLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22008 2026-09-21 cs.CL cs.AI 新提交

DiaVLo: Diagnosing Behaviours of Vision-Language Models

DiaVLo:诊断视觉-语言模型的行为

Lorenzo Corti, Jie Yang

机构 * Delft University of Technology(代尔夫特理工大学)

AI总结 DiaVLo是一个诊断框架,通过人工策展和生成能力构建行为规范,提供因果估计,识别VLM行为中的不一致,并揭示概念处理模式。

Comments 34 pages. To appear in EMNLP 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22005 2026-09-21 cs.LG cs.CL 新提交

Abstention and Noise Filtering: Two Missing Primitives of Softmax Attention

软注意力中的弃权与噪声过滤:两个缺失的原语

Richard Zhe Wang

机构 * St. John Fisher University(圣约翰费舍尔大学)

AI总结 本研究提出并验证了软注意力缺失的两种原语——弃权(不执行)与噪声过滤,发现其收益随模型规模呈相反趋势,且两者结合在10M至350M参数规模上均达到最优性能。

Comments 21 pages (8 pages main text plus appendices), 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.22000 2026-09-21 cs.CL cs.SE 新提交

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents

RecreationWorld:面向混合型计算机使用智能体的可扩展且可验证环境

Shuai Bai, Jiayong Deng, Yikun Fu, Chang Gao, Xuhao Hu, Mianqiu Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Keliang Li, Ning Li, Wanli Li, Dayiheng Liu, Dunjie Lu, Changwei Luo, Que Shen, Zheyuan Wang, Zijian Wang, Jie Wu, Gao Wu, Zhihui Xie, Rui Xie, Haiyang Xu, An Yang, Jiakang Yuan, Yanming Zhang, Jiajun Zhang, Xi Zhang, Zhenru Zhang, Zhuo Zhen, Mingkang Zhu, Bowen Zhou

机构 * Alibaba Token Hub(阿里巴巴通义实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出RecreationWorld,一个五平台可扩展环境,用于训练和评估混合计算机使用智能体,通过复现参考应用行为并提供可验证测试,显著提升跨域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21996 2026-09-21 cs.AI 新提交

A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

语言模型的测谎测试:读取模型不会透露的知识

Hiskias Dingeto

机构 * StackOne Technologies(StackOne 科技公司)

AI总结 本文提出内部识别探针(PIR)方法,借鉴法医隐蔽信息测试,通过读取模型内部状态识别其隐藏的已知答案,以区分模型不愿回答与不能回答,支持表现不佳审计和遗忘验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21995 2026-09-21 cs.LG 新提交

Assessment of Machine Learning-Based Critical Heat Flux Models in the CTF Subchannel Code for Square Rod Bundle Prediction

机器学习临界热流密度模型在CTF子通道程序中方形棒束预测中的评估

Aidan Furlong, Vinicius de Melo Monteiro, Robert Salko, Juliana Pacheco Duarte, Xu Wu

机构 * North Carolina State University(北卡罗来纳州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 本研究评估了基于机器学习的临界热流密度模型在CTF子通道程序中的方形棒束预测性能,发现管束训练的ML模型可有效迁移至棒束应用,局部混合LUT模型表现最佳,显著优于传统方法。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21992 2026-09-21 cs.CL cs.CY stat.ML 新提交

Moral Entropy: Auditing Bias and Uncertainty in Moral Judgment

道德熵:审计道德判断中的偏差与不确定性

Maciej Skorski

机构 * University of Luxembourg(卢森堡大学)

AI总结 本文提出道德熵框架,用贝叶斯后验分解标注分歧为偶然与认知不确定性,并审计共识规则,发现任意标注者规则产生约30%假阳性,多数规则遗漏63-83%真阳性。

Comments accepted to UncertaiNLP @ EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21989 2026-09-21 cs.LG 新提交

Time series generation with spectrally aligned latent flow matching

时间序列生成与谱对齐潜在流匹配

Camilo Carvajal Reyes, Felipe Tobar

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 本文提出谱对齐潜在流时间序列生成器,通过傅里叶、小波及签名变换的微调损失改善谱失配,在真实基准上验证了其生成真实性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21983 2026-09-21 cs.RO 新提交

SkelWAM: A Skeleton-Guided World-Action Model for Zero-Shot Cross-Embodiment Manipulation

SkelWAM:一种用于零样本跨本体操作(Cross-Embodiment Manipulation)的骨架引导的世界-动作模型(World-Action Model)

Pengjun Niu, Yujia Xie, Rui Peng, Hang Zhao, Ke Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Feagine IIIS, Tsinghua University(清华大学智能产业研究院) Research Center for Robotics, Peking University(北京大学机器人研究中心)

AI总结 SkelWAM提出骨架引导的世界-动作模型,通过共享25维状态实现零样本跨本体操作,在LIBERO-Cross10基准上以43.3%成功率超越基线36.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21967 2026-09-21 cs.CL cs.AI 新提交

NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities

NemotronLabs VoiceChat:具备工具调用能力的开源全双工语音到语音模型

Jagadeesh Balam, Travis Bartley, Edresson Casanova, Sanjay Chauhan, Chen Chen, Zhehuai Chen, Zijia Chen, Francesco Ciannella, Slyne Deng, Mikyas Desta, Harishchandra Dubey, Slim Essid, Nourchene Ferchichi, Boris Ginsburg, Mariana Graterol Fuenmayor, Negar Habibi, Kevin Hu, Anand Joseph, Viraj Karandikar, Myungjong Kim, Viacheslav Klimkov, Seelan Lakshmi Narasimhan, Lily Lee, Jason Li, Eileen Long, Ameya Mahabaleshwarkar, Aditya Malte, Adi Margolin, Sasha Meister, Valentin Mendelev, Oluwatobi Olabiyi, Ankita Pasad, Yifan Peng, Elena Rastorgueva, Jayda Ritchie, Jason Roche, Nikhil Srihari, Yuanhang Su, Yoshi Suhara, Viet Anh Trinh, Jinhan Wang, Piotr Zelasko, Hui Wang, Puhui Meng, Chaosen Zhang, Yunsheng Liu, Shawn Wang, Wenjing Li, Zhonglei He

机构 * NVIDIA(英伟达)

AI总结 该论文提出开源全双工语音到语音模型NemotronLabs VoiceChat,通过流式架构整合语音编解码、RNN-T转录和工具调用,在多项基准上实现低接管率、高响应质量及82.5%工具选择F1,证明全双工交互与外部工具可统一集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21962 2026-09-21 cs.AI q-bio.TO 新提交

Learning Cardiac Features: ECG Biometrics Across Time and~Exercise

学习心脏特征:跨时间和运动的ECG生物识别

Luca Thiebaud, Paul Chauchat, Mustapha Ouladsine, Stéphane Delliaux

机构 * Aix-Marseille Univ(艾克斯-马赛大学) CNRS(法国国家科学研究中心) LIS(计算机与系统实验室) Inserm-INRAE(法国国家健康与医学研究院-法国国家农业、食品与环境研究院) C2VN(神经科学与心血管营养中心) University Hospitals of Marseille(马赛大学医院)

AI总结 本研究评估了ECG生物识别在运动和跨会话条件下的鲁棒性,采用Siamese ResNet与多导联融合,在CYBHi数据集上达到3.9%的EER,证实了心脏特征的内在稳定性。

Journal ref Artificial Intelligence in Healthcare (AIiH 2026), Aug 2026, London, United Kingdom. pp.94-107

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21953 2026-09-21 cs.LG 新提交

RACER: Role-Aligned Competence Estimation for Human-AI Routing

RACER:面向人机路由的角色对齐能力估计

Joshua Strong, Emma Sun, Alexander Capstick, Pramit Saha, Cheng Ouyang, J. Alison Noble

机构 * University of Oxford(牛津大学)

AI总结 RACER提出角色对齐的能力估计框架,利用上下文估计未见专家能力,结合模型后验实现贝叶斯最优的人机路由,在合成和医学影像基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21948 2026-09-21 cs.RO cs.CV 新提交

GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across Embodiments

GALA:面向跨本体视觉-语言-动作模型预训练的几何感知潜在动作建模

Yichen Liu, Puzhen Yuan, Xiang Zhu, Yanjiang Guo, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 GALA提出几何感知潜在动作建模框架,通过统一末端执行器运动表示增强跨本体VLA预训练,有效捕捉细粒度关节运动,在RoboCasa-GR1和真实世界任务中分别取得68.3%和75.5%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.21945 2026-09-21 cs.LG 新提交

Learning to Move Cities: Deep Meta-Models and Reinforcement Policies for Calibration and Control in Urban Networks

学习移动城市:用于城市网络校准与控制的深度元模型和强化策略

Adewumi Augustine Adepitan, Christopher J. Haruna, Oluwasegun Adegoke, Ayooluwatomiwa Ajiboye, Oluwatobi Oluwasakin

机构 * George Mason University(乔治梅森大学) University of South Dakota(南达科他大学) Syracuse University(雪城大学) Federal University of Technology Akure(联邦理工大学阿库雷分校)

AI总结 本文提出共享潜在空间框架,结合MLP-自编码器与深度Q学习,实现城市交通模拟器校准和动态控制,在基准网络上将系统出行时间降低最多51%。

Comments 7 pages, 2 figures. Accepted for publication in the Proceedings of the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC), Naples, Italy. (c) 2026 IEEE. Personal use of this material is permitted; permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏