arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 共 3792 篇
2609.38180 2026-09-30 cs.CV 新提交

Point2Part: Unified 3D Partitioning from Point Prompts

Point2Part:基于点提示的统一三维分割

Hao-Tang Tsui, Yu-Rou Tuan, Xiaoxuan Ma, Nicolas Ugrinovic, Takaaki Shiratori, Kris Kitani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Point2Part提出一种基于点提示的统一三维分割方法,通过联合分割整个形状生成非重叠部件,在图像到部件、网格到部件和部件分割任务上均优于现有方法。

Comments Project Page: https://henrytsui000.github.io/Point2Part

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38178 2026-09-30 cs.RO cs.AI cs.LG 新提交

Skill-Space Shooting for Autonomous Robot Policy Improvement

技能空间射击:用于自主机器人策略改进

Zihang Rui, Renhao Wang, Haoxu Huang, Yang Gao

机构 * Tsinghua University(清华大学) ; UC Berkeley(加州大学伯克利分校) ; Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 提出技能空间射击方法,利用基础模型指导通过可重用技能探索修正,将成功试验转化为策略改进,实现自主机器人在任务内和跨任务的可扩展、可泛化策略提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38177 2026-09-30 cs.CV cs.CL 新提交

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

Imagine3D-LLM:在回答前教会多模态大语言模型想象3D场景

Jaewoo Jung, Hyeonseo Yu, Honggyu An, Jisang Han, Mungyeom Kim, Minkyeong Jeon, Heeseong Shin, Wonjun Moon, Federico Tombari, Daniel Barath, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ; ETH Zürich(苏黎世联邦理工学院) ; Google(谷歌) ; TUM(慕尼黑工业大学) ; ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 受人类空间推理启发,提出Imagine3D-LLM,通过可学习摘要标记解码为紧凑3D高斯泼溅表示并联合训练,使MLLM在回答前想象3D场景,显著提升空间推理与3D理解性能。

Comments NeurIPS 2026; Project Page: https://cvlab-kaist.github.io/Imagine3D-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38173 2026-09-30 cs.RO 新提交

In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks

上下文机器人学习简化:一种面向操作任务的民主化配方

Minxing Li, Minghao Han, Weizhi Zhao, Hanwen Wang, Xiangshuo Liu, Shuyao Shang, Jingxiang Zhou, Mingchao Sun, Hongyu Pan, Mu Xu, Yu Liu, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) ; Amap, Alibaba Group(阿里巴巴集团高德地图)

AI总结 本研究明确了机器人上下文学习的定义,提出极简可复现的SimpleICL框架,无需大规模预训练即可在仿真和真实环境中实现强性能,并揭示其关键特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38172 2026-09-30 cs.RO cs.CV cs.GR 新提交

Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation

反事实视频生成实现可扩展的人形机器人移动操作

Zihan Wang, Zhen Wu, Pieter Abbeel, Rocky Duan, Jitendra Malik, Carmelo Sferrazza, C. Karen Liu, Guanya Shi, Angjoo Kanazawa

机构 * Amazon FAR(亚马逊FAR) ; UC Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Stanford(斯坦福大学)

AI总结 提出PRISM框架,通过反事实视频生成和接触锚定仿真重建,从少量真实视频扩展训练数据,实现无需真实微调的人形机器人移动操作泛化。

Comments published at CoRL 2026. Project page: https://prism-real2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38170 2026-09-30 cs.CV 新提交

Adversarial Training for Pixel Diffusion

像素扩散模型的对抗训练

Xin Lin, Zhifei Zhang, Yuqian Zhou, Haitian Zheng, Zhe Lin, Ming-Hsuan Yang, Truong Nguyen

机构 * UC San Diego(加州大学圣迭戈分校) ; Adobe Research(Adobe 研究院) ; UC Merced(加州大学默塞德分校)

AI总结 本研究提出对像素扩散模型进行对抗训练后训练,在不改变架构和采样的情况下,通过添加对抗损失恢复缺失的高频功率,联合提升分布保真度、覆盖率、提示对齐和感知质量,并指出直接输出访问是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38169 2026-09-30 cs.CL cs.AI cs.LG 新提交

STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

STEPQuant:Delta规则循环状态量化中误差何时何地重要

Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Zhenan Sun, Ying Wei

机构 * City University of Hong Kong(香港城市大学) ; Harvard University(哈佛大学) ; Zhejiang University(浙江大学) ; NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所模式识别国家重点实验室与多模态人工智能系统全国重点实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学)

AI总结 针对Delta规则循环状态量化误差的时间与空间影响,提出STEPQuant后训练量化框架,按误差幅度和记忆寿命分配精度,在6位预算下匹配FP32精度,并实现超5倍状态压缩及高达68.7%的内存减少。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38166 2026-09-30 cs.LG cs.AI 新提交

LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

LeapQuant:具有精确循环状态量化机制的高效线性注意力

Yi Pan, Haocheng Xi, Kan Zhu, Xingyang Li, Yibo Wu, Mayank Mishra, Hongtao Zhang, William X. Zheng, Baris Kasikci, Song Han, Kurt Keutzer, Rishabh Iyer, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; MIT(麻省理工学院) ; Perplexity AI ; NVIDIA(英伟达)

AI总结 针对线性注意力循环状态量化误差累积与离群值问题,提出免训练方法LeapQuant,通过逐窗口量化与补偿token,在8位量化下实现近乎无损性能并显著加速推理。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38165 2026-09-30 cs.CV cs.LG 新提交

Cropland PAtteRNS: Parallel Dimensional Attention Networks and Attention to Dataset Disparity for Crop Segmentation in Satellite Imagery Time Series Data

农田PAtteRNS:用于卫星影像时间序列数据中作物分割的并行维度注意力网络与数据集差异关注

Joseph Metcalfe, Sara Sharifzadeh, Fabio Caraffini

机构 * Swansea University(斯旺西大学)

AI总结 提出PAtteRNS混合Transformer-卷积模型,分别对时间、光谱、空间维度使用自注意力,在PASTIS和MTLCC数据集上超越现有模型,并揭示数据集类别分组和瓦片尺寸对公平比较的影响。

Comments Main body: 19 pages, 7 figures; Appendices: 15 pages, 16 figures. All code and models associated with this work are available at https://github.com/JoeMetc/CroplandPAtteRNS , along with preparation guides for the two publicly available crop segmentation datasets used in this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38164 2026-09-30 cs.RO 新提交

Rho: A Foundation for Efficiently Adaptable VLA Models

Rho:高效可适配VLA模型的基础

Rho Team, Simran Bagaria, Daphne Chen, Dean Fortier, Jianlong Fu, Michael Harrison, Tess Hellebrekers, Neel Joshi, Andrey Kolobov, Dalton Moore, Galen Mullins, Michael Murray, Eduardo Salinas, Reuben Tan

机构 * Microsoft Research(微软研究院)

AI总结 Rho是一个开源权重VLA模型家族,通过动作专家架构和本体中间训练,在三种双臂机器人上实现高效数据轻量适配,并具备基于纠正反馈的在线适配能力,性能优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38163 2026-09-30 cs.CV cs.RO 新提交

Rethinking Representations for World-Action Modeling

重新思考世界-动作建模的表示

Haoyi Jiang, Liu Liu, Xinjiang Wang, Zhihao Sun, Zequn Chen, Sen Wang, Xinjie Wang, Xia Chen, Jingfeng Yao, Weiheng Zhao, Shanglin Yuan, Zhizhong Su, Wei Sui, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) ; D-Robotics(地瓜机器人) ; Horizon Robotics(地平线机器人) ; Fudan University(复旦大学) ; Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出ReWAM,一种基于DINO特征的表示中心世界-动作模型,通过特征校准、时间瓶颈和动作接地塑造,无需生成式视频预训练即在RoboTwin 2.0和RoboDojo上取得显著成功。

Comments https://github.com/hustvl/ReWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38161 2026-09-30 cs.LG cs.DM 新提交

A Spectral Theory of Distortion in LLM Graph Reconstruction: Sharp Bounds and Empirical Characterization

LLM图重构中失真的谱理论:尖锐界与实证刻画

Jianru Shen

机构 * Columbia University(哥伦比亚大学)

AI总结 本文提出LLM图重构失真的谱理论,证明Wasserstein距离被边数净变化和对称差所夹住,并实证刻画了135个重构中的单侧与混合编辑模式。

Comments accepted at IEEE ICRAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38157 2026-09-30 cs.SD cs.CL eess.AS 新提交

EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation

EmoRES-TTS:残差增强向量引导的情感语音生成

Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu, Zhaoheng Ni, Hung-yi Lee, Jinwon Lee, Neha Chachra

机构 * Reality Labs at Meta(Meta现实实验室) ; National Taiwan University(国立台湾大学) ; FAIR at Meta(Meta基础人工智能研究团队)

AI总结 针对情感TTS可控性差且训练代价高的问题,提出免训练的EmoRES方法,将情感向量分解为共享与残差分量分别控制,在IEMOCAP上显著提升情感表达准确率与自然度。

Comments Work done at Meta. Code at https://github.com/facebookresearch/EmoRES-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38156 2026-09-30 cs.CV 新提交

DMA$^2$: Pixel-space Distribution Matching with Adversarial and Anchor Losses

DMA$^2$:基于对抗与锚点损失的像素空间分布匹配

Xin Lin, Zhifei Zhang, Yuqian Zhou, Haitian Zheng, Shaoteng Liu, Lehan Yang, Zhe Lin, Ming-Hsuan Yang, Truong Nguyen

机构 * UC San Diego(加州大学圣迭戈分校) ; Adobe Research(Adobe研究院) ; University of Virginia(弗吉尼亚大学) ; UC Merced(加州大学默塞德分校)

AI总结 提出DMA$^2$,通过固定高噪声匹配带、DINO-Adv对抗指导和AF-Loss分布目标,实现像素空间少步扩散蒸馏,四步生成超越25步教师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38155 2026-09-30 cs.CV cs.AI cs.CL cs.IR cs.LG 新提交

Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

超越时间线:利用基于实体的传记增强长视频记忆

Hui Ren, Lei Fan, Henry Pao, Han Guo, Zeeshan Zia, Ying Chen, Alexander Schwing, Gang Hua

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon.com, Inc.(亚马逊公司)

AI总结 提出基于实体的传记框架,通过视觉身份链接分组长视频中同一实体的观察,提升跨事件问答性能,在EgoLifeQA上达72.0%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38153 2026-09-30 cs.CV 新提交

PowerSim: Differentiable Physics Simulation and Rendering with Power Diagrams

PowerSim:基于幂图的微分物理仿真与渲染

Trong-Tung Nguyen, Anand Bhattad

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 PowerSim将可微分物理仿真与渲染结合,通过耦合PowerFoam与物质点法,实现用户交互模拟、材料场恢复、场景合成及动态反射,优于先前框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38152 2026-09-30 cs.CV 新提交

FracGen: Learning How Objects Stretch and Tear with Physics-Informed Video Generation

FracGen:利用物理信息视频生成学习物体如何拉伸与撕裂

Trong-Tung Nguyen, Jiahan Zhang, Anand Bhattad

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 FracGen是一种断裂感知视频生成模型,利用物理信息损失和联合预测物理场,从单张图像生成可控且物理合理的断裂动态,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38149 2026-09-30 cs.CL 新提交

Pretraining Latent Information Feedback Transformers with Teacher Supervision

预训练带教师监督的潜在信息反馈Transformer

Dor Tirosh, Ido Amos, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

AI总结 本研究提出LIFT架构,通过教师监督将循环状态学习转为预测问题,使Transformer在预训练时实现深层到浅层反馈,在多项任务上优于标准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38147 2026-09-30 cs.AI 新提交

Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning

先思后行:通过元推理扩展智能体推理

Paras Dahal, Anton Bakhtin, Taco Cohen, Zhengxing Chen, Carole-Jean Wu, Rob Fergus, Scott Yih, Gabriel Synnaeve, Ruslan Salakhutdinov, Sanjeev Arora, Jason Weston, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

AI总结 本文提出智能体元推理框架,通过控制器显式管理执行决策,在长时程任务中显著提升性能,如ProgramBench上GPT-5.5达71.5%,并随预算增长持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38146 2026-09-30 cs.CV 新提交

LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation

LIFT:大视角变化下基于在线策略自蒸馏的未来布局视频生成

Shengxiang Ji, Boyang Wang, Haiyang Xu, Bingnan Li, Yucheng Mao, Zeyuan Chen, Xiaojun Shan, Xiang Zhang, Gang Hua, Jianwen Xie, Zezhou Cheng, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校) ; University of Virginia(弗吉尼亚大学) ; Meta ; Amazon(亚马逊) ; Lambda

AI总结 LIFT提出统一框架,通过未来布局控制与在线策略自蒸馏,解决大视角变化下视频生成的内容与布局可控性问题,提升视频质量与可控性。

Comments Project Page: https://jsxzs.github.io/LIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38143 2026-09-30 cs.AI cs.CL cs.LG 新提交

Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

学习测试时AI4AI智能体框架设计中的元技能

Cheng Qian, Kunlun Zhu, Beibin Li, Zhenhailong Wang, Heng Ji

机构 * Apodex ; University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究提出元技能方法,使Builder从执行反馈中学习构建智能体环境的原则,在基准测试上显著提升性能,并指向系统级自我改进路径。

Comments 22 Pages, 4 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38142 2026-09-30 cs.AI cs.CL cs.LG 新提交

AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation

AdviSD:通过目标性多轮自蒸馏学习为前沿大语言模型提供建议

Rishabh Agrawal, Hejie Cui, Shasha Li, Shanchan Wu, Sercan Ö. Arık

机构 * University of Southern California(南加州大学)

AI总结 AdviSD通过选择性自蒸馏与强化学习结合,利用反馈修正的评分差异指导训练,使小型顾问有效提升前沿LLM执行器的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38140 2026-09-30 cs.CV cs.AI 新提交

Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

打破均匀性陷阱:通过SplitMoE扩展视频扩散模型

Yu Xu, Yuxin Zhang, Xiao Yang, Haotian Yang, Yizhi Wang, Xinwei Huang, Minxuan Lin, Angtian Wang, Chongyang Ma, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ; ByteDance(字节跳动) ; Canva Research(Canva 研究院) ; University of Science and Technology Beijing(北京科技大学)

AI总结 针对传统MoE在视频数据上的均匀性陷阱,提出SplitMoE,通过分裂专家池为语义与通用专家,结合原型引导路由和推拉正则化,在等效参数下提升收敛、路由连贯性和视频生成质量。

Comments Accepted as a Spotlight paper at NeurIPS 2026. Project page: https://yuci-gpt.github.io/SplitMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38137 2026-09-30 cs.CL 新提交

LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning

LongHarness Bench:对长上下文推理的语言模型框架进行压力测试

Quang Hieu Pham, Thuy Duong Nguyen, Jocelyn Qiaochu Chen, Xi Ye

机构 * University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

AI总结 提出LongHarness Bench基准,用于评估长上下文语言模型框架的有效性与效率,发现相同模型在不同框架下效率差异显著,最佳组合宏平均准确率仅68%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38136 2026-09-30 cs.CV 新提交

CLeaR: A Unified Framework for Resolving the Leakage-Degradation Dilemma in Style Transfer

CLeaR:解决风格迁移中泄漏-退化困境的统一框架

Teng Zhou, Yunhao Chen

机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学)

AI总结 CLeaR提出无训练框架,通过正交子空间投影、集成反演和能量引导校准,解决风格迁移中内容泄漏与风格保真度的困境,在StyleBench上改善风格对齐并减少泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38123 2026-09-30 cs.CV 新提交

HelixWorld: A Real-time Interactive Audio-Visual World Model

HelixWorld:一种实时交互式视听世界模型

Lei Ke, Jiahao Pan, Zeyue Tian, Jiaming Wang, Haoyuan Huang, Kam Man Wu, Pengjun Fang, Hongyu Liu, Chenyang Qi, Lin Wang, Ruibin Yuan, Weijia Chen, Fangneng Zhan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Noiz AI

AI总结 HelixWorld提出首个实时交互视听世界模型,通过双向教师蒸馏实现24 FPS无漂移的视听联合推演,并引入HelixBench评估空间声学一致性,在保持视觉性能的同时显著提升声学沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38121 2026-09-30 cs.LG 新提交

WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms

WUSH-KV:基于数据自适应变换的KV缓存量化

Jiale Chen, Vage Egiazarian, Eldar Kurtić, Torsten Hoefler, Dan Alistarh

机构 * Institute of Science Technology Austria (ISTA)(奥地利科学技术学院) ; Red Hat AI(红帽人工智能) ; ETH Zürich(苏黎世联邦理工学院)

AI总结 WUSH-KV通过数据自适应变换对KV缓存进行低位量化,降低内存和带宽成本,在2比特下性能优于或媲美OSCAR变换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38120 2026-09-30 cs.AI cs.SY eess.SY 新提交

Stochastic World Models for Verifying Vision-Based Neural Feedback Systems

用于验证基于视觉的神经反馈系统的随机世界模型

I. Samuel Akinwande, Mykel J. Kochenderfer, Clark Barrett

机构 * Stanford University(斯坦福大学)

AI总结 本文提出用随机世界模型替代GAN作为感知替代模型,以更忠实地再现观测并支持闭环验证,结合多种分析程序在紧急制动基准上解决了超过80%的状态空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38119 2026-09-30 cs.CV 新提交

VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents

VideoLoop:循环工作记忆对抗长视频智能体中的语义抖动

Jinfa Huang, Jianming Xu, Jingyang Lin, Zhengyuan Yang, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) ; Microsoft(微软)

AI总结 针对长视频智能体仅追加记忆导致的语义抖动问题,提出双循环架构VideoLoop,通过检索与重写有界工作记忆,在多个基准上平均提升4.2个百分点。

Comments Code: https://github.com/philipxjm/videoloop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.38116 2026-09-30 cs.CV 新提交

GA-EIRFS: A Geometry-Augmented Repeat-Factor Sampling Method for Long-Tailed LiDAR 3D Object Detection

GA-EIRFS:一种用于长尾LiDAR 3D目标检测的几何增强重复因子采样方法

Taufiq Ahmed, Constantino Álvarez Casado, Daniel Herrera Castro, Sasan Sharifipour, Abhishek Kumar, Miguel Bordallo López

机构 * Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(奥卢大学机器视觉与信号分析中心) ; University of Jyväskylä(于韦斯屈莱大学)

AI总结 提出GA-EIRFS,一种通过几何分数调制频率重复因子的采样方法,在不改变检测器的情况下提升长尾LiDAR 3D检测性能,在nuScenes上显著提高mAP和NDS。

Comments 5 pages, 4 figures, Submitted to IEEE ICASSP 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
↑