arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 共 2806 篇
2610.10539 2026-10-08 cs.CV 新提交

Tetris3D: 3D Scene Generation With Objects That Fit Together

Tetris3D:通过契合物体进行三维场景生成

Jaeyeong Kim, Jinhyuk Jang, Jongmin Lee, Kyehong Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

AI总结 Tetris3D通过显式条件化周围物体几何与物理关系,实现单图像三维场景中物体形状和姿态的连贯生成,并引入120万场景的ComOb数据集,在生成质量和物理稳定性上达到最优。

Comments Project page: https://cvlab-kaist.github.io/Tetris3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10536 2026-10-08 cs.LG cs.AI cs.CL 新提交

Decoupling Exploration from Optimization in RLVR

在RLVR中将探索与优化解耦

Saif Punjwani, Micah Goldblum

机构 * Columbia University(哥伦比亚大学)

AI总结 本研究提出探索-蒸馏(ExpDis)框架,将RLVR中的探索与优化解耦,通过训练探索者策略并蒸馏至学生策略,在不降低质量的前提下扩大探索,在数学推理基准上优于DAPO并提升多样解生成能力。

Comments 20 pages, 16 figures, 9 tables. Code: https://github.com/SaifPunjwani/Exploration-Distillation. Checkpoints: https://huggingface.co/SaifPunjwani/expdis-checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10534 2026-10-08 cs.RO 新提交

RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input

RoboPrompt:基于稀疏人类输入的直观机器人策略引导

Yanwen Zou, Chenyang Shi, Guoxuan Xu, Wenye Yu, Wendi Chen, Ye Pan, Cewu Lu, Chuan Wen

机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Noematrix Ltd.(Noematrix有限公司)

AI总结 提出RoboPrompt,一种无需修改策略架构的轻量级引导系统,通过稀疏人类输入控制动作生成,经DAgger迭代后显著提升多种策略的成功率并减少人类干预。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10533 2026-10-08 cs.CL 新提交

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

EngramEdit:通过条件记忆实现大语言模型中的解耦知识更新

Hongru Cai, Ran Wei, Wenjie Wang, Chengfa Wu, Ning Song, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) ; Hangzhou Diagens Biotechnology Co., Ltd(杭州迪安基因生物技术有限公司) ; University of Science and Technology of China(中国科学技术大学)

AI总结 EngramEdit通过条件记忆架构实现大语言模型的事实知识解耦更新,联合调整共享n-gram嵌入,在保持无关知识的同时达到近乎完美的编辑成功率,并支持多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10528 2026-10-08 cs.RO cs.AI cs.CV 新提交

Long-WAM: Scaling the Context of World-Action Models

Long-WAM:扩展世界-动作模型的上下文

Wei Huang, Bohan Zhang, Chenzhi Liu, Isabella Liu, Shuai Yang, Weian Mao, Luozhou Wang, Yicheng Xiao, Weifeng Lin, Qixin Hu, Bryan Chu, Sifei Liu, Linxi Fan, Xiaojuan Qi, Song Han, Yukang Chen

机构 * NVIDIA(英伟达) ; MIT(麻省理工学院) ; HKU(香港大学) ; UCSD(加州大学圣迭戈分校)

AI总结 Long-WAM通过自回归预训练和流式系统设计,扩展因果世界-动作模型的上下文,在实时控制中显著提升成功率,并支持动态长时程操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10526 2026-10-08 cs.RO cs.CL cs.LG 新提交

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

行动前改写:表征并缓解视觉-语言-动作模型中的语言敏感性

Mikey Watts, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本研究揭示视觉-语言-动作模型对指令措辞高度敏感,通过大型语言模型提炼改写规则,在不修改策略的情况下显著提升分布外任务成功率,并零样本泛化至未见任务。

Comments 9 pages, 8 figures, 3 tables. Project page: https://sttawm.github.io/rephrase-before-you-act

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10524 2026-10-08 cs.CV 新提交

GRACE: Generation-aware latent compression for efficient video generation

GRACE:面向高效视频生成的生成感知潜空间压缩

Jiyoung Kim, Paul Hyunbin Cho, Jisu Nam, Donghoon Lee, Hyunsung Go, Yeonkyeong Lee, Hansaem Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) ; Kakao Corp.(Kakao公司)

AI总结 GRACE通过两阶段框架压缩预训练视频自编码器,保留冻结基础潜变量并学习残差,对齐生成特征,实现8倍令牌减少和11.1倍加速,同时保持生成质量。

Comments Project page : https://cvlab-kaist.github.io/GRACE/, 43 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10520 2026-10-08 cs.LG 新提交

Distilling Graph Geometry: Knowledge Gap from GNNs to MLPs

蒸馏图几何:从GNN到MLP的知识差距

Zhewei Chen, Hao Zhu, Jiaojiao Jiang, Ahad N. Zehmakan

机构 * Australian National University(澳大利亚国立大学) ; Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织) ; University of New South Wales(新南威尔士大学)

AI总结 针对GNN到MLP蒸馏中忽略图几何导致谱欠拟合与过拟合的问题,提出基于Ollivier-Ricci曲率引导的G^2MLP框架,在训练时对齐预测与表示,提升无图推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10517 2026-10-08 cs.SD cs.SY eess.SY 新提交

Unsupervised Maneuver-Aware Acoustic Fault Detection for Autonomous Drones

自主无人机无监督机动感知声学故障检测

Ali M Ali, Ziyi Tang, Nurdaulet Nazarbay, Hashim A. Hashim

机构 * Carleton University(卡尔顿大学) ; University of Alberta(阿尔伯塔大学) ; The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出一种无监督机动感知声学故障检测框架,结合Noise2Noise去噪与机动条件自编码器,利用重建误差检测无人机故障,并在嵌入式平台上实现实时检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10515 2026-10-08 cs.AI cs.RO 新提交

RoboJEPA: Scaling Robotic Latent World Models

RoboJEPA:扩展机器人潜在世界模型

Artem Zholus, Nicolas Beltran-Velez, Jianhao Yuan, Sarath Chandar, Tushar Nagarajan, Daniel Severo, Koustuv Sinha, Michal Drozdzal, Adriana Romero Soriano, Jeannette Bohg, Nicolas Ballas, Mahmoud Assran

机构 * FAIR at Meta(Meta FAIR) ; Chandar Research Lab(Chandar 研究实验室) ; Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) ; Polytechnique Montréal(蒙特利尔理工学院)

AI总结 RoboJEPA基于JEPA架构,在12种机器人形态数据上训练,发现想象误差随计算量呈二阶幂律缩放,可预测下游规划性能,并支持零样本长时程规划,为多形态机器人世界模型建立缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10512 2026-10-08 cs.CV 新提交

Video-Conditioned Generative Joint 2D-3D Hand Motion Recovery

视频条件下的生成式联合二维-三维手部运动恢复

Chen Xu, Yunqi Li, Binbin Huang, Brent Yi, Shenghua Gao, Yi Ma

机构 * The University of Hong Kong(香港大学) ; UC Berkeley(加州大学伯克利分校)

AI总结 针对视频中手部运动恢复因遮挡而不准确的问题,提出生成式框架JoHan,联合生成二维和三维姿态序列,利用二维线索和运动先验,显著提升精度、速度与运动平滑度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10510 2026-10-08 cs.RO 新提交

Factorized Tactile Representation and Control for Sim-to-Real Manipulation

因子化触觉表征与控制用于仿真到现实操作

Siqi Shang, Bianca Aumann, Tye Brady, Joshua Migdal, Taskin Padir

机构 * Amazon Fulfillment Technologies & Robotics(亚马逊履约技术与机器人) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Northeastern University(东北大学)

AI总结 提出因子化触觉表征与控制框架,将接触响应分解为几何、力分布和时间变化,通过触觉门控策略实现仿真到现实迁移,在插销插入等任务中显著提升性能。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10508 2026-10-08 cs.CL 新提交

Your Prompt Should Do More: Effects of Retrieval Instructions in Embedding Models

你的提示词应发挥更大作用:检索指令对嵌入模型的影响

Amanda Myntti, Jenna Kanerva, Veronika Laippala, Filip Ginter

机构 * TurkuNLP(图尔库NLP) ; University of Turku(图尔库大学) ; Ellis Institute Finland(芬兰ELLIS研究所)

AI总结 本文研究嵌入模型在非对称检索中遵循指令的机制,发现查询侧干扰项导致模型失败,通过加入此类干扰项微调可显著提升性能且对其他任务影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10507 2026-10-08 cs.AI 新提交

RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing

RECAST:通过自适应证据路由学习计算正确的上下文

Yilun Hao, Krishna Sayana, Isabella Ye, James S Ren, Sukhdeep Sodhi, Craig Boutilier, Chuchu Fan

机构 * MIT(麻省理工学院)

AI总结 RECAST通过自适应证据路由将证据构建视为顺序决策过程,利用RouterLM和CompilerLM主动推导证据,在六个基准上平均成功率75.6%,比最强基线高15.9%。

Comments 35 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10506 2026-10-08 cs.AI cs.CL econ.GN q-fin.EC 新提交

Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models

无真实标签的有效性:陈述偏好经济学为语言模型评估提供的启示

Daniel Robert Kling Alexander, Catherine Louise Kling

机构 * University of Michigan(密歇根大学) ; Cornell University(康奈尔大学)

AI总结 本文借鉴陈述偏好经济学的有效性框架,提出一种无需真实标签评估语言模型的方法,并通过水质调查数据对六个模型进行测试,区分了模型的理论有效性与收敛效度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10499 2026-10-08 cs.LG stat.ML 新提交

Oracle-Efficient and Parameter-Free Agnostic Smoothed Online Learning

Oracle高效且无参数的不可知平滑在线学习

Sasha Voitovych, Adam Block, Alexander Rakhlin, Abhishek Shetty

机构 * MIT(麻省理工学院) ; Columbia University(哥伦比亚大学) ; Georgia Tech(佐治亚理工学院)

AI总结 本文提出首个无需基测度知识、无参数且Oracle高效的不可知平滑在线学习算法,基于高斯跟随扰动领导者,实现次线性遗憾,填补了理论与实用间的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10498 2026-10-08 cs.AI 新提交

EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution

EmbodiedRSI:通过假设引导的协同进化实现主动持续机器人学习

Python Song, Zhixuan Liang, Kelsey Fu, Mengdi Wang, Junfeng Yang, Shilong Liu

机构 * Columbia University(哥伦比亚大学) ; Princeton University(普林斯顿大学)

AI总结 EmbodiedRSI通过快慢双系统架构和假设图,自主选择实验并协同进化代码与技能,在多个基准和真实机器人上显著提升持续学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10497 2026-10-08 cs.CV 新提交

QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation

QuadTok:用于自回归图像生成的四叉树视觉分词器

Yucheng Mao, Zeyuan Chen, Xiaojun Shan, Xiang Zhang, Divyansh Srivastava, Bingnan Li, Zhuowen Tu

机构 * University of California, San Diego(加州大学圣迭戈分校)

AI总结 QuadTok提出了一种层次化四叉树视觉分词器,动态分配表示能力,节省约10%的标记,并利用树结构因果性实现自回归图像生成,在ImageNet上达到2.08 gFID,支持零样本空间控制生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10491 2026-10-08 cs.CV 新提交

Insights from Autoresearch for Solar Panel Segmentation

自动研究在太阳能电池板分割中的见解

Justinas Lekavicius, Kursat Komurcu, Valentas Gruzauskas, Linas Petkevicius

机构 * Vilnius University(维尔纽斯大学) ; IRISA, Université Bretagne Sud(IRISA,南布列塔尼大学) ; European Commission Joint Research Centre(欧盟委员会联合研究中心)

AI总结 本文探讨AutoResearch协议在太阳能电池板分割中的应用,通过编码语言模型在GPU预算内迭代改进训练程序,发现其能提升基线性能但修改不跨硬件迁移,其中Qwen3-8B在真实图像上达到0.836的IoU,略优于GAN增强方案。

Comments Accepted at AutoML4EO 2026 (non-archival AutoML conference workshop). 4 pages + references. accepted-papers/" target="_blank" rel="noopener">https://automl4eo.org/accepted-papers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10489 2026-10-08 cs.RO 新提交

HuMBLE: Human Motion-Driven Behavior Learning for Embodied Locomotion

HuMBLE:基于人体运动驱动的具身运动行为学习

Mike Zhang, Dongho Kang, Kevin Bergamin, Nicola Burger, Robin Deits, Jonathan Foster, Bilal Hammoud, Katie Hughes, Francesco Iacobelli, Twan Koolen, M. Eva Mungai, Zach Nobles, Shane Rozen-Levy, Jean Pierre Sleiman, Fangzhou Yu, Yunbo Zhang, Alfred Rizzi, Jessica Hodgins, Scott Kuindersma, Yeuhi Abe, Sylvain Bertrand, Farbod Farshidian

机构 * RAI Institute, USA(RAI研究所,美国) ; Boston Dynamics, USA(波士顿动力公司,美国) ; Carnegie Mellon University, USA(卡内基梅隆大学,美国)

AI总结 本文提出HuMBLE框架,通过教师-学生蒸馏和多任务RL平衡指令跟踪与人体数据风格,生成可操控、鲁棒且仿生的人形运动策略,并在多款机器人上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10483 2026-10-08 cs.LG cs.IR stat.ML 新提交

Two-Level Softmax Sampling Done Right: Correcting Bias from Size Imbalance and Dispersion

两级Softmax采样正确做法:纠正大小不平衡与离散度带来的偏差

Walid Bendada, Guillaume Salha-Galvan

机构 * Spotify ; SJTU Paris Elite Institute of Technology(上海交通大学巴黎卓越工程师学院)

AI总结 针对两级softmax采样因忽略簇大小不平衡和簇内离散度而产生的偏差,提出S-2LS和SD-2LS两种校正方法,在五个大规模数据集上验证了改进的采样性能,建议替代标准2LS。

Comments NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10479 2026-10-08 cs.RO cs.CV 新提交

Agentic RSR: Real-to-Sim-to-Real through Scene Reconstruction and Execution-Grounded Robot Policies

Agentic RSR:通过场景重建和执行接地机器人策略实现真实到仿真到真实

Yihan Li, Yating Feng, Shengjiu Sun, Jianing Chen, Hao Ren, Bowen Yang, Weisheng Xu, Qiwei Wu, Hui Cheng, Renjing Xu

机构 * Sun Yat-sen University(中山大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Agentic RSR框架通过场景重建与执行接地策略,实现真实到仿真到真实的闭环,在18个场景中深度误差0.1057米,真实机器人任务成功率保留仿真性能的80%。

Comments 25 pages including appendices, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10478 2026-10-08 cs.AI cs.SE 新提交

Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models

在它们能解决之前:从基础模型预测训练后编码智能体的性能

Tan Yu, Alexander Bukharin, Khushi Bhardwaj, Jennifer Williams, Zirui Liu, Jonathan Lingjie Li, Soumye Singhal, Joseph Jennings, Sanjeev Satheesh, Yash Jain, Ashish Vaswani, Venkat Krishna Srinivasan, Matthew Papakipos, Hyunwoo Kim, Jian Zhang, Oleksii Kuchaiev, Markus Kliegl, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jonathan Cohen, Jiantao Jiao

机构 * NVIDIA(英伟达) ; University of Minnesota – Twin Cities(明尼苏达大学双城分校) ; University of California, Berkeley(加州大学伯克利分校)

AI总结 提出三种基于成功轨迹和验证器的筛选方法,无需冷启动即可预测基础模型经后训练后的编码智能体性能,与SWE-bench Verified排名高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10473 2026-10-08 cs.CV q-bio.CB 新提交

Label-free cell counting and viability prediction with brightfield imaging and deep learning

基于明场成像和深度学习的无标记细胞计数与活力预测

Amir Reza Vazifeh, Christian Zeigler, Sornanathan Meyyappan, Richard Jeske, Jason W. Fleischer

机构 * Princeton University(普林斯顿大学) ; Waters Corporation(沃特世公司)

AI总结 该研究提出基于明场成像和深度学习的无标记细胞活力分析方法ViabiLens,通过检测和分类模型实现准确预测,在CHO细胞上误差仅2.68%,并发布基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10472 2026-10-08 cs.RO 新提交

Robotic Boomerang Throwing via Model-Based Release Design

基于模型释放设计的机器人回旋镖投掷

Yang Liu, Colin Jones, Aude Billard

机构 * EPFL(洛桑联邦理工学院)

AI总结 提出基于释放状态的模型框架,通过分阶段动力学识别和参数筛选,为6自由度机械臂设计投掷运动与回旋镖,首次实现机器人产生返回式回旋镖飞行,释放速度51 rad/s,返回距离0.31米。

Comments Project page: https://robot-boomerang.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10470 2026-10-08 cs.RO 新提交

CMP-IRRT*: A Perception-Assisted Height-Adaptive Planner for Quadruped Robots

CMP-IRRT*:一种面向四足机器人的感知辅助高度自适应规划器

Mingfan Zhao, Wendong Mao, Zhongfeng Wang

机构 * School of Integrated Circuits, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区集成电路学院)

AI总结 针对四足机器人二维规划中低障碍物处理低效的问题,提出基于CMP-IRRT*的感知辅助高度自适应规划器,通过高度条件碰撞检测和Mamba引导采样,减少探索节点,在可穿越场景中路径长度最多缩短16.3%。

Comments Accepted at the 18th Asian Conference on Machine Learning (ACML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10465 2026-10-08 cs.RO cs.SY eess.SY 新提交

LLA-MPPI: Rapidly Adaptive Whole-body Control of Legged Robots with GPU-Accelerated Parallel Simulations

LLA-MPPI:基于GPU加速并行模拟的腿式机器人快速自适应全身控制

Sebin Jung, Maitham F. AL-Sunni, Juan Alvarez-Padilla, Zachary Manchester, Changliu Liu, John M. Dolan

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出LLA-MPPI方法,通过GPU并行模拟器选择实现腿式机器人全身自适应控制,无需离线训练,在模拟和硬件上均显著优于基线。

Comments The first two authors are co-first authors (contributed equally to the work)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10462 2026-10-08 cs.RO cs.AI 新提交

FoldBack: Self-Correcting Masked Generative Policy for Long-Horizon Garment Folding

FoldBack:用于长时程衣物折叠的自校正掩码生成策略

Lipeng Zhuang, Shiyu Fan, Yingdong Ru, Zhuo He, Florent P. Audonnet, Paul Henderson, Gerardo Aragon Camarasa

机构 * University of Glasgow(格拉斯哥大学)

AI总结 FoldBack提出一种自校正掩码生成策略,通过三个推理时决策(细化验证、回滚、重试)实现长时程衣物折叠中的失败检测与修复,在33件真实衣物上达到75.2%成功率,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10460 2026-10-08 cs.LG cs.AI 新提交

Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts

组合每位教师所学:通过教师相对偏移实现多教师在线策略蒸馏

Hejian Sang, Zhengze Zhou, Shayan Mohajer Hamidi, Xiaomin Li, Rohit Jain, Alborz Geramifard

机构 * Iowa State University(爱荷华州立大学) ; LinkedIn(领英) ; Harvard University(哈佛大学)

AI总结 提出Δ-MOPD,通过转移教师相对基础模型的偏移并重新锚定到学生初始化,改善多教师在线策略蒸馏,在组合和路由设置中提升性能并减少顺序偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.10459 2026-10-08 cs.LG 新提交

NeuralBES: A Differentiable, Control-Aware Emulator for Scalable Building Energy Modeling

NeuralBES:一种可微分、控制感知的可扩展建筑能耗建模仿真器

Ting-Yu Dai, Takuya Kurihana, Wing Yee Au, Hon Yung Wong

机构 * Fujitsu Research of America(富士通美国研究院)

AI总结 NeuralBES通过共享神经编码器参数化RC热模型,实现可微分、控制感知的建筑能耗仿真,在保持物理有效性的同时,以更少参数达到与最强基线相差4个MAPE点以内的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
↑