arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
全部学科分类 共 3189 篇
2610.02210 2026-10-02 cs.CV 新提交

Moore, Escher, Penrose: A Conformal Golden Braid

摩尔、埃舍尔、彭罗斯:共形黄金辫

Sophia Feldman, Assaf Shocher

机构 * Technion - Israel Institute of Technology(以色列理工学院)

AI总结 基于埃舍尔《版画画廊》的共形映射,提出将去噪步骤与变换及其广义逆编织,生成自指场景,避免仅提示或事后变换的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02208 2026-10-02 cs.CV 新提交

Sphere Encoder 2

球面编码器2

Kaiyu Yue, Sean McLeish, Ruchit Rawal, Brian Bartoldson, Menglin Jia, Tom Goldstein

机构 * University of Maryland(马里兰大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Cornell University(康奈尔大学)

AI总结 Sphere Encoder 2通过解决潜在空间采样间隙和像素级重建损失导致的模糊问题,在保持自编码器速度与简单性的前提下,显著提升图像生成质量。

Comments Code will be available at this https URL (https://github.com/kaiyuyue/sphere2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02207 2026-10-02 cs.CV cs.AI cs.HC cs.LG 新提交

One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars

一个基元驱动所有:高斯混合形状蒸馏用于实时虚拟化身

Ramazan Fazylov, Stamatis Lefkimmiatis, Ivan Laptev

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; MWS AI(MWS AI公司)

AI总结 针对3D高斯化身实时动画的神经推理瓶颈,提出GALA蒸馏方法,用线性混合近似动画,显著降低CPU成本并保持质量,支持移动端60fps。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02205 2026-10-02 cs.CV 新提交

ROWBench: Do Video Models Render What the Program Specifies?

ROWBench:视频模型是否渲染了程序所指定的内容?

Zheng-Hui Huang, Guixu Lin, Yu-Ju Tsai, Jian-Kai Zhu, Fengbo Lan, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(Alaya实验室)

AI总结 提出PROWBench基准,含170个程序化情节和600个代理视频,通过可重放世界记录和双VLM指标评估视频模型对程序指定事件、实体控制及长时记忆的视觉遵循度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02204 2026-10-02 cs.RO cs.AI eess.SY 新提交

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

重建、练习、实战:具身智能体的引导式自我改进

Yen-Jen Wang, Haozhe Jiang, Shuying Deng, Haoru Xue, Weirui Ye, Rocky Duan, Nika Haghtalab, S. Shankar Sastry, Pieter Abbeel, Haozhi Qi

机构 * UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Amazon FAR(亚马逊FAR) ; University of Chicago(芝加哥大学)

AI总结 提出RPG框架,通过离线数据识别技能、仿真练习与诊断改进,无需更新权重即可提升具身智能体任务成功率,从28.6%提升至95.0%,并完成30次物理试验。

Comments 17 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02203 2026-10-02 cs.CV cs.LG 新提交

Embedding Prediction Helps Image Generation

嵌入预测有助于图像生成

Sihan Xu, Ji Xie, Zilin Wang, Hui Shen, Stella X. Yu

机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出NEPA方法,通过预测下一嵌入作为扩散变换器的条件,结合多嵌入预测与REPA,在ImageNet上以约三分之一的训练计算达到FID 1.32。

Comments Project page: this https URL (https://sihanxu.me/nepa-dit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02202 2026-10-02 cs.AI cs.CL cs.IR 新提交

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

ScholarCatalyst:一个用于检索激发新研究论文的基准

Sohyeon Kim, Yoonho Lee, Bo Liu, Dayoon Ko, Rulin Shao, Seungone Kim, Graham Neubig, Pang Wei Koh, Aakanksha Chowdhery, Akari Asai, Omar Khattab, Yejin Choi, Gunhee Kim, Chelsea Finn

机构 * Stanford University(斯坦福大学) ; Seoul National University(首尔国立大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute for AI(艾伦人工智能研究所) ; MIT(麻省理工学院)

AI总结 该基准由作者标注构建,评估检索激发新研究的论文,发现智能体搜索不优于嵌入检索,需新训练方法以赋予模型专家检索直觉。

Comments 57 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02201 2026-10-02 cs.CV cs.AI cs.LG 新提交

SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

SILSA:用于保持拓扑的高分辨率3D生成的滑动窗口切片潜变量

Tianjiao Yu, Xinzhuo Li, Yifan Shen, Ying Shen, Kiet A. Nguyen, Adheesh Sunil Juvekar, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 SILSA提出滑动窗口切片潜变量与切片级拓扑监督,实现单阶段高分辨率3D生成,提升结构保真度并大幅降低计算成本。

Comments Accepted at NeurIPS 2026. Project link: this https URL (https://plan-lab.github.io/silsa)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02200 2026-10-02 cs.AI cs.CV 新提交

VISTA: A Visual Harness for Reasoning in an Interactive World

VISTA:交互世界中的视觉推理驾驭框架

Qiushi Han, Keya Hu, Linlu Qiu, Cathy Wu, Kaiming He

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 VISTA是一种视觉驾驭框架,通过无损视觉记忆和主动检索,释放多模态模型在交互环境中的推理潜力,在ARC-AGI-3上达到满分并显著超越基线。

Comments Tech report. An early version of this manuscript was in a blogpost published in Aug 5, 2026: this https URL (https://vista-research.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02198 2026-10-02 cs.LG cs.AI cs.RO stat.ML 新提交

FERPO: Forward Entropy-Regularized Policy Optimization

FERPO:前向熵正则化策略优化

Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv

机构 * Applied and Theoretical Aspects of Robot Intelligence (ATARI) Lab(应用与理论机器人智能实验室) ; Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) ; Technical University of Munich(慕尼黑工业大学)

AI总结 针对评论家动作梯度不可靠的问题,提出前向熵正则化策略优化(FERPO),利用前向KL目标与自归一化重要性采样改进策略,促进探索,在MuJoCo和ManiSkill上表现优异且更新更快。

Comments Code: this https URL (https://github.com/Atarilab/FERPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02197 2026-10-02 cs.CV 新提交

HiPhy: Hierarchical Alignment for Physically-Plausible Multi-Principle Video Generation

HiPhy:面向物理合理多原理视频生成的层次对齐方法

Tahira Kazimi, Shubhankar Borse, Munawar Hayat, Fatih Porikli, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) ; Qualcomm AI Research(高通人工智能研究院)

AI总结 HiPhy提出层次物理对齐强化学习框架,通过局部与全局双层目标解决视频生成中多物理原理协同问题,并构建50K数据集和MultiPhyBench基准,显著提升物理常识与语义对齐。

Comments Project page: this https URL (https://hiphy-video.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02196 2026-10-02 cs.RO cs.CV cs.GR 新提交

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

InterEvolve:人形机器人移动操作奖励程序的测试时进化

Zhuo Lin, Sirui Xu, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 InterEvolve提出测试时进化框架,通过对象感知前向-后向模型和LLM奖励程序进化,在无需重训练下释放人形机器人控制器既有技能,解决新移动操作任务。

Comments Project page: this https URL (https://sirui-xu.github.io/InterEvolve)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02193 2026-10-02 cs.CL cs.AI cs.LG 新提交

Hierarchical Continuous Diffusion Language Models

分层连续扩散语言模型

Hui Ren, Zihan Li, Chang Liu, Huidong Liu, Alexander Schwing

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-尚佩恩分校) ; Amazon.com, Inc.(亚马逊公司)

AI总结 提出分层连续扩散语言模型(HC-DLM),通过将离散标记生成与连续潜在轨迹耦合于统一去噪过程,解决扩散模型并行解码中标记独立采样及状态与标记配置脱节的问题,在数独、Countdown和LM1B上超越离散与连续扩散基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02191 2026-10-02 cs.LG 新提交

The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models

缺失的原语:诊断与修复大语言模型中的数学推理

Shuo Xing, Zilin Dai, Chengyuan Qian, Fangzhou Lin, Wenjing Chen, Ping He, Pan Lu, Alvaro Velasquez, Mohit Bansal, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) ; Harvard University(哈佛大学) ; Vanderbilt University(范德堡大学) ; Stanford University(斯坦福大学) ; DARPA(美国国防高级研究计划局) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出数学原语概念和\hlei{}基准,诊断LLMs数学推理的四个维度,发现“发现”是主要瓶颈,并引入原语优先的自蒸馏框架\abs{},有效提升模型数学推理能力。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02189 2026-10-02 cs.LG 新提交

Generative modeling of intrinsically disordered protein regions by reinforcing sparse autoencoder features

通过强化稀疏自编码器特征的内在无序蛋白区域生成建模

Jason X. Liu, Sebastian Ibarraran, Frank Hu, Soojung Yang, Xinyu A. Feng, Abigail Park, Anagha Aneesh, Lacramioara Bintu, Alexander R. Dunn, Grant M. Rotskoff

机构 * Stanford University(斯坦福大学)

AI总结 本文提出IDiom模型和RL-SAE方法,用于内在无序蛋白区域的可解释设计,显著提升功能特征激活率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02188 2026-10-02 cs.CV cs.AI 新提交

DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation

DMAD:分布匹配作为对抗蒸馏用于快速视觉生成

Zhengming Yu, Junkun Yuan, Haotian Yang, Gordon Guocheng Qian, Yizhi Wang, Angtian Wang, Yiding Yang, Bo Liu, Xin Li, Wenping Wang, Chongyang Ma

机构 * Texas A\&M University

AI总结 提出DMAD,将分布匹配蒸馏重构为对抗分类,直接学习对数密度比,无需辅助分数拟合,在图像、文本到图像和视频生成上达到领先的少步性能。

Comments 28 pages, 15 figures. Project page: this https URL (https://yzmblog.github.io/projects/DMAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02186 2026-10-02 cs.LG cs.AI 新提交

Higher-Order Molecular Grammars for Generative and Foundation Models in Chemistry

用于化学中生成模型和基础模型的高阶分子文法

Yiming Huang, Yujie Zeng, Vijay Prakash Dwivedi, Simone Foti, Jianmin Wang, Jure Leskovec, Tolga Birdal

机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Stanford University(斯坦福大学) ; Imperial College London(帝国理工学院) ; Yonsei University(延世大学)

AI总结 本文提出高阶文法表示(HGR),将分子解析为规则序列以高效编码高阶拓扑,并构建富环基准RingDiv,在生成和表示学习任务中均取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02185 2026-10-02 cs.LG 新提交

Decoding Looped Transformers Better for (Almost) Free

更好地解码循环Transformer(几乎免费)

Weihao Liu, Huangjie Zheng, Tianrong Chen, Rohit Dilip, Richard He Bai, Yizhu Jiao, Yuyang Wang, Ruixiang Zhang

机构 * Apple(苹果公司)

AI总结 本文提出LoopCD,一种无需训练的对比解码框架,利用循环Transformer的中间状态作为引导信号,在减少推理计算的同时提升解码质量,并支持循环次数减半。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02182 2026-10-02 cs.LG cs.AI 新提交

SoftServe: A Scalable Quasi-Newton Method for Deep Learning

SoftServe:一种用于深度学习的高可扩展拟牛顿方法

Joohwan Ko, Tetiana Parshakova, Diana Cai, Robert M. Gower

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Flatiron Institute(熨斗研究所) ; Cornell University(康奈尔大学)

AI总结 SoftServe提出一族无需线搜索的拟牛顿方法,通过正定曲率估计和Newton-Schulz迭代实现大规模深度学习优化,在病态任务上优于Adam等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02181 2026-10-02 cs.CV 新提交

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

OmniSeek:面向多轮音视频推理的原生工具集成

Haibo Wang, Jiteng Mu, Jialu Li, Jingru Yi, Yuanjun Xiong, Jianming Zhang, Lifu Huang, Mingze Xu

机构 * Adobe Research(Adobe研究院) ; University of California Davis(加州大学戴维斯分校)

AI总结 OmniSeek将全模态大模型转变为主动多轮推理智能体,通过动态决定查看或聆听的时间窗口来检索关键证据,并利用合成轨迹与两阶段强化学习优化,显著提升跨模态音视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02180 2026-10-02 cs.CV cs.AI 新提交

Generative Cinematographer: Composing Camera and Object Motion in 3D

生成式电影摄影师:在3D中编排相机与物体运动

Jiahan Zhang, Chaohao Yang, Namitha Guruprasad, Vivekjyoti Banerjee, Trong-Tung Nguyen, Alan Yuille, Anand Bhattad

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对现有视频生成中2D控制歧义问题,提出GenCine系统,将单图提升为3D场景脚手架,通过局部3D手柄联合编排相机与前景运动,并投影为引导图控制预训练模型,实现相机相对运动一致与强可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02179 2026-10-02 cs.LG 新提交

From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation

从梯度到能力:理解多教师同策略蒸馏

Siqi Zhu, Suozhi Huang, Kaixuan Zhang, Yuheng Yang, Zhanyang Jin, Yihang Sun, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-尚佩恩分校) ; Princeton University(普林斯顿大学) ; Westlake University(西湖大学)

AI总结 本研究通过分析Qwen3-1.7B多教师同策略蒸馏中的梯度、优化器更新和精度影响,揭示了损失平均、Adam一阶矩、BF16舍入及KL梯度截断对参数更新和任务性能的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02175 2026-10-02 cs.LG q-bio.MN 新提交

Effective Resistance and Graph Neural Network Reliability in Tissue-Specific Interactomes

有效电阻与组织特异性相互作用组中的图神经网络可靠性

Jianru Shen

机构 * University of Montana(蒙大拿大学)

AI总结 本研究利用有效电阻作为信号,在24个组织特异性相互作用组中探究其与图神经网络节点损失的关系,发现残差信号可解释额外损失,且效应随深度增强。

Comments Accepted at IEEE BIBM (Doctoral Forum)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02173 2026-10-02 cs.LG cs.CL 新提交

Every Ablation Is a Dose: Counterweights and the Semblance of Self-Repair

每一次消融都是一次剂量:配重与自我修复的表象

Areeb Ahmad, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi 实验室)

AI总结 本研究提出消融可视为剂量,揭示语言模型自我修复实为配重效应,通过仿射定律预测修复响应,并在多个模型上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02170 2026-10-02 cs.RO cs.AI cs.MA 新提交

Watch, Infer, Coordinate: Inferring Robot Partner Constraints for Zero-Shot Coordination

观察、推断、协调:推断机器人伙伴约束以实现零样本协调

Suyu Ye, Zheyuan Zhang, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Tianmin Shu, Homanga Bharadhwaj, Nakul Agarwal

机构 * Honda Research Institute USA(本田美国研究院) ; Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本文提出观察、推断、协调方法,通过观察联合行为推断机器人伙伴的物理约束,显著提升零样本协调性能,接近真实约束预言机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02163 2026-10-02 cs.CL 新提交

AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents

AutoCompact:在长时程编码智能体中学习何时压缩上下文

Xuan Zhang, Longtao Zheng, Cunxiao Du, Bo An, Xin Dong

机构 * Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学) ; Harvard University(哈佛大学)

AI总结 AutoCompact通过策略学习压缩决策,利用修正轨迹训练并强化学习优化,在SWE基准上显著提升编码智能体通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02162 2026-10-02 cs.CV 新提交

World Observer: Joint Actor-Observer Generation for Persistent World Modeling

世界观察者:用于持久世界建模的联合演员-观察者生成

Hyunwook Choi, Dahyun Chung, Hyunsung Kim, Siyoon Jin, Jinhyeok Choi, Junyoung Seo, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能)

AI总结 本文提出世界观察者,通过联合生成演员与全景观察者解耦观察与行动,实现持久世界建模,显著提升视野外动态,同时保持视觉保真度与3D一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02161 2026-10-02 cs.RO cs.AI 新提交

DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication

DuoMind:通过语义通信实现分布式多机器人协调

Hanchu Zhou, Dechen Gao, Hang Wang, Brendan Lynch, Boqi Zhao, Qiyao Ma, Raman Goyal, Junshan Zhang

机构 * University of California, Davis(加州大学戴维斯分校) ; Microsoft Research(微软研究院) ; Analog Devices(亚德诺半导体)

AI总结 提出DuoMind分布式分层框架,通过VLM编排器与VLA动作模型结合语义通信实现多机器人长期任务协调,并构建RoboPoly基准验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02160 2026-10-02 cs.CV 新提交

4Director: Controlling Video World Models with Rigid 3D Geometry

4Director:利用刚性三维几何控制视频世界模型

Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

机构 * Stability AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 4Director通过显式四维场景表示和运动适配器,实现对视频中相机与物体运动的精确控制,并在新数据集上验证了其优越性。

Comments 28 pages, 15 figures. Project page: this https URL (https://stability-ai.github.io/4director/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.02159 2026-10-02 cs.LG 新提交

When Do Intrinsic Rewards Lead to Exploration?

内在奖励何时导致探索?

Scott W. Viteri (Stanford University), Laura Gomezjurado Gonzalez (Stanford University), Clark Barrett (Stanford University)

机构 * Stanford University(斯坦福大学)

AI总结 本文提出反事实信息作为探索标准,证明现有内在奖励在简单环境中获取反事实信息时是帕累托次优的,并给出成功条件及改进目标。

Comments 45 pages, 4 figures; includes mathematical appendices. Code, data, and Lean proof sources: this https URL (https://github.com/scottviteri/what-is-exploration)

详情

展开后加载摘要…

URL PDF HTML 收藏
↑