arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 共 3062 篇
2610.08791 2026-10-07 cs.CV 新提交

World Models' Last Exam in Physics

世界模型物理终极考试

Mingju Gao, Qingle Liu, Yuzhao Peng, Xinjie Lin, Ziming Qin, Zheng Jiang, Wenyi Li, Calvin Xiao, Youjie Zheng, Kaisen Yang, Qinhuai Na

机构 * Navers Lab, Einsia.AI(Navers实验室,Einsia.AI) ; Peking University(北京大学) ; Tsinghua University(清华大学)

AI总结 针对视频世界模型物理不一致问题,提出基于测量的基准,含40个任务覆盖多物理领域,评估8个模型,最佳得分57.76,为诊断与进展提供可解释依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08789 2026-10-07 cs.RO cs.LG 新提交

QF3: Fast Flow RL with Filtered Q-Gradients

QF3:基于滤波Q梯度的快速流强化学习

Chung Min Kim, Brent Yi, David McAllister, Hongsuk Choi, Himanshu Gaurav Singh, Jinkun Cao, Ken Goldberg, Pieter Abbeel, Carmelo Sferrazza, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校) ; Amazon FAR(亚马逊FAR)

AI总结 QF3是一种离策略流强化学习算法,通过滤波Q梯度训练流策略,实现从零训练人形运动策略并零样本迁移到硬件,速度比FPO++快10倍,且能微调预训练操作策略。

Comments Project page: https://qf3-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08785 2026-10-07 cs.LG 新提交

Conformal Prediction Sets Quantify Information Gain: A Theoretical Perspective

共形预测集量化信息增益:一个理论视角

Kevin Zhang, Stephen Bates

机构 * MIT(麻省理工学院)

AI总结 本文从理论角度证明共形预测集大小减少可作为信息增益度量,引入广义信息度量族,并在11个分类设置中验证其与香农互信息的联系及差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08784 2026-10-07 cs.RO 新提交

PEARS: Physical-Prior-Guided Efficient Adaptation via Failure Reasoning and Diffusion Steering for Tactile Manipulation

PEARS:基于物理先验引导的高效适配,通过失败推理与扩散引导实现触觉操作

Kun Song, Yiming Wang, Yilin Chen, Tianyi Ding, Jiaxin Tian, Tianqi Gong, Daolin Ma, Jia Pan

机构 * The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xense Robotics ; University of Pennsylvania(宾夕法尼亚大学)

AI总结 PEARS提出物理先验引导的混合强化学习框架,通过失败推理与扩散引导,在触觉操作中实现样本高效在线适配,显著提升成功率并减少交互次数。

Comments 9 pages, 4 figures. Project website: https://song-kun.github.io/pears

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08782 2026-10-07 cs.CV cs.AI cs.GR 新提交

4D-HOF: Hand-Object Flow Matching for Feed-Forward 4D Interaction Reconstruction

4D-HOF:用于前馈4D交互重建的手-物体流匹配

Shiqi Li, Sean Cho, Yijie Li, Fengzhi Guo, Bowen Wen, Cheng Zhang

机构 * NVIDIA(英伟达) ; Texas A&M University(德克萨斯A&M大学)

AI总结 4D-HOF提出一种前馈流匹配框架,利用视觉基础模型的粗略估计重建4D手-物体交互,通过条件流匹配和测试时引导实现稳定准确的生成式重建。

Comments Project page: https://tamu-visual-ai.github.io/4D-HOF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08781 2026-10-07 cs.CL cs.AI 新提交

IdeaAnchor: Teaching LLMs to Turn Literature into Research Ideas

IdeaAnchor:教大语言模型将文献转化为研究思路

Ziyu Chen, Yilun Zhao, Jiashuo Sun, Yiling Ma, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tata Consultancy Services(塔塔咨询服务公司)

AI总结 IdeaAnchor通过结构化规范作为监督信号,训练大语言模型从文献中生成研究思路,结合锚点训练与检索增强,显著提升思路质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08780 2026-10-07 cs.RO cs.AI cs.CV 新提交

DepthWorld: 3D World Model for Robot Manipulation

DepthWorld:用于机器人操作的3D世界模型

Jai Bardhan, Josef Sivic, Vladimir Petrik

机构 * Czech Technical University in Prague(捷克理工大学)

AI总结 本文提出DepthWorld,一种基于稳定视频扩散的3D世界模型,通过校准的DROID-3D数据集和联合深度-RGB预测,实现机器人操作的精确几何建模与策略评估。

Comments Accepted at the Conference on Robot Learning (CoRL) 2026. Project page: https://www.jaibardhan.com/depthworld. 32 pages including supplementary material, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08779 2026-10-07 cs.CV 新提交

ALIVE: Interaction-Aligned Object Insertion for First-Frame-Guided Video Editing

ALIVE:面向首帧引导视频编辑的交互对齐物体插入

Zhenghong Zhou, Zhe Lin, Jiebo Luo, Yuqian Zhou

机构 * University of Rochester(罗切斯特大学) ; Adobe Research(Adobe 研究院)

AI总结 ALIVE通过首帧编辑和指令,使插入物体与源视频内容产生连贯交互,并训练VLM预测引导,显著提升交互保真度。

Comments Project page: https://real-time-video-research.github.io/alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08778 2026-10-07 cs.AI cs.CL 新提交

Sherpa: Teaching LLMs to Teach Adaptively

Sherpa:教大语言模型自适应教学

Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang

机构 * Stanford University(斯坦福大学) ; Georgia Tech(佐治亚理工学院) ; Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出多轮强化学习框架Sherpa,通过模拟多样学生原型并直接最大化学习成果,训练LLM教师自适应教学,平均提升学生表现20.5个百分点,教学得分从52.5%升至79.2%。

Comments 32 pages, 6 figures. Code and model are available at https://github.com/SALT-NLP/Sherpa

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08777 2026-10-07 cs.CV 新提交

CtrlCache: Accelerating Interactive Video World Models with Control-Aware Caching

CtrlCache:利用控制感知缓存加速交互式视频世界模型

Shangye Song, Dong Gong, Hong Jia, Yun Sing Koh, Xinyu Zhang

机构 * University of Auckland(奥克兰大学) ; UNSW Sydney(新南威尔士大学)

AI总结 提出CtrlCache,一种免训练的控制感知缓存框架,利用控制序列调度计算,在交互式视频世界模型中实现1.21-1.41倍加速并提升生成质量。

Comments 18 pages. Project page: https://wrecklong.github.io/CtrlCache/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08775 2026-10-07 cs.AI 新提交

Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?

瓶中智能体:LLM智能体能否将其能力转化为廉价、可扩展的工件?

Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri, Seong Joon Oh

机构 * University of Tübingen(蒂宾根大学) ; ELLIS Institute Tübingen(ELLIS研究所蒂宾根) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tübingen AI Center(蒂宾根人工智能中心) ; École Polytechnique(巴黎综合理工学院) ; Institut Polytechnique de Paris(巴黎综合理工学院) ; CNRS(法国国家科学研究中心) ; KAIST AI(韩国科学技术院人工智能研究所)

AI总结 本研究提出BOTTLED基准,检验LLM智能体能否将通用能力转化为廉价可扩展的特定任务解决方案,发现零样本性能不等于装瓶能力,但装瓶可大幅降低成本并保持较高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08773 2026-10-07 cs.CL cs.AI cs.LG 新提交

AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model

AdvSim2Real:在网络世界模型中针对自适应提示注入训练网络智能体

Sarim Hashmi, Mukul Ranjan, Kshitij Mishra, Mikhail Kuznetsov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Amazon(亚马逊) ; Massachusetts Institute of Technology(麻省理工学院)

AI总结 AdvSim2Real通过共同演化任务课程、注入对手和智能体,在冻结网络世界模型中训练,使4B智能体在未见攻击下完成率提升33.6%,并增强鲁棒性与真实浏览器迁移能力。

Comments Code at https://github.com/Sarim-MBZUAI/advsim2real

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08772 2026-10-07 cs.CV 新提交

Backend-Agnostic Sparse Attention for Fast High-Resolution Visual Generation

后端无关的稀疏注意力用于快速高分辨率视觉生成

Liao Ma, Jiayi Song, Yunfeng Wu, Songhua Liu, Peilin Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算及数据科学学院)

AI总结 针对扩散变换器高分辨率生成中全注意力计算昂贵的问题,提出后端无关的稀疏注意力 BASA,通过跨块窗口移位实现全局交互,无需定制内核,在 FLUX 和 Wan 上实现接近理论值的加速并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08770 2026-10-07 cs.CV 新提交

Data Leakage in Patch-Based Hyperspectral Image Classification: Quantifying the Impact of Spatial Overlap

基于Patch的高光谱图像分类中的数据泄漏:量化空间重叠的影响

Mohammed Q. Alkhatib

机构 * University of Dubai(迪拜大学)

AI总结 本文量化了基于Patch的高光谱图像分类中随机采样导致的空间重叠数据泄漏,提出OP和AOR度量,实验表明3D-CNN在随机采样下OA达96.17%,非随机下降至55.20%,证明随机评估会显著高估性能。

Comments paper accepted for presentation at IEEE-WHISPERS

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08765 2026-10-07 cs.RO cs.SY eess.SY 新提交

LBA-CBF: Rapidly Adaptive Safety Filters via Parallel Dynamics Inference

LBA-CBF:通过并行动力学推理实现快速自适应安全滤波器

Maitham F. AL-Sunni, Timeea-Andreea Radu, Hassan Almubarak, Henry Z. Liao, Michael Görner, Francesco Maurelli, John M. Dolan

机构 * Carnegie Mellon University(卡内基梅隆大学) ; Constructor University(康斯特大学) ; King Fahd University of Petroleum and Minerals(法赫德国王石油与矿业大学)

AI总结 针对动力学突变导致CBF失效的问题,提出LBA-CBF,通过并行推理候选模型并自适应滤波,在仿真和实验中实现安全且高成功率的目标到达。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08761 2026-10-07 cs.AI cs.RO 新提交

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

VeriFine:具身推理中自我改进的验证扩展

Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding

机构 * NVIDIA(英伟达) ; UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)

AI总结 VeriFine通过策略、课程与评判者共同进化扩展验证,在具身推理中实现持续自我改进,实验证明驾驶和导航任务中策略与评判能力均持续提升。

Comments Project Website: https://veri-fine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08760 2026-10-07 cs.SD cs.AI cs.CV eess.AS 新提交

WorldSonus: Bringing Sound to Worlds

WorldSonus:为世界赋予声音

Pengjun Fang, Jingyi Fa, Kam Man Wu, Jiaming Wang, Haoyuan Huang, Yaguang Wu, Xiangjun Huang, Ziyang Ma, Weijia Chen, Hongyu Liu, Zeyue Tian, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Noiz AI ; MetaX ; Shanghai Jiao Tong University(上海交通大学)

AI总结 WorldSonus提出交互式视频到音频框架,通过流式因果自回归扩散架构实现低RTF实时生成,支持交互控制与空间对齐,在开放域基准上达到或超越最先进模型。

Comments 25 pages, 4 figures, 16 tables. Project page: https://noizai.github.io/WorldSonus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08756 2026-10-07 cs.CV 新提交

Post-Training Semantic Lifting for 3D Gaussian Splatting: Separating Detector, Lifting and Representation Error

3D高斯溅射的后训练语义提升:分离检测器、提升与表示误差

Iván Verdugo Guerra, Ezequiel López Rubio, Jorge García González

机构 * University of Málaga(马拉加大学)

AI总结 提出一种后训练语义提升方法,通过多视角证据加权累积和双阈值过滤,分离检测器、提升与表示误差,在ScanNet++上显著提升mIoU。

Comments 18 pages, 11 figures, 9 tables. Code: https://github.com/ivanver02/semantic-lifting-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08747 2026-10-07 cs.CL 新提交

The Missing Minimal Pair: Stereotype Evaluation in LLMs

缺失的最小对:大语言模型中的刻板印象评估

Nataliya Stepanova, Ivan Titov, Emily Allaway, Björn Ross

机构 * University of Edinburgh(爱丁堡大学) ; University of Amsterdam(阿姆斯特丹大学)

AI总结 针对大语言模型刻板印象评估中单对比较不可靠的问题,提出双最小对设置及数据增强框架,并引入基于互信息的评估指标,实现跨语言和模型的稳健比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08743 2026-10-07 cs.LG cs.AI 新提交

Reinforcement Learning with Conformal Action Sets: An Application to Sequential Recommendation

带共形动作集的强化学习:在序列推荐中的应用

Wenwen Si, Honghao Wei

机构 * University of Pennsylvania(宾夕法尼亚大学) ; Washington State University(华盛顿州立大学)

AI总结 针对序列推荐中固定候选集大小的问题,提出带校准剪枝的强化学习(RLCP),通过评论家分数和在线阈值自适应调整动作集,在19种配置中至少一种变体实现最高目录多样性,达最强基线的1.11至5.21倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08740 2026-10-07 cs.LG 新提交

On the Computational Tractability of Robust Bandits

关于鲁棒多臂老虎机计算可处理性的研究

Vanessa Kosoy, Vinayak Pathak

机构 * Technion(以色列理工学院) ; CORAL(计算理性智能体实验室)

AI总结 本文研究鲁棒多臂老虎机问题的计算可处理性,发现一个特例存在多项式时间且遗憾为Õ(√T)的学习器,而其若干推广为NP难,为AI对齐提供计算高效学习器迈出一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08738 2026-10-07 cs.CL cs.LG 新提交

Denoising Hierarchical Representations: Joint Continuous Diffusion for Language Modeling

去噪层次化表示:用于语言建模的联合连续扩散

Mathias Ollu, Nikos Komodakis

机构 * Ecole Polytechnique(巴黎综合理工学院) ; Archimedes, Athena RC(Archimedes,雅典研究与创新中心) ; University of Crete(克里特大学) ; IACM-Forth(希腊研究与技术基金会计算医学研究所)

AI总结 提出层次化连续扩散语言模型(H-CDLMs),通过并行扩散多粒度令牌表示,以极小开销提升连续扩散语言模型性能,在多个基准上超越基线及同等规模离散模型。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08737 2026-10-07 cs.RO 新提交

PhoneBot: A Low-Cost Open Humanoid Robot Platform Reusing Smartphones

PhoneBot:一种重用智能手机的低成本开源人形机器人平台

Ruochen Hou, Quanyou Wang, Daniel Koh, Dennis W. Hong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 PhoneBot利用智能手机作为感知和计算核心,结合13个低成本执行器,构建了低成本开源人形机器人平台,实现稳定行走、视觉跟随和交互,适用于教育和研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08735 2026-10-07 cs.LG cs.DS 新提交

Optimal and Efficient Online Inverse Optimization

最优且高效的在线逆向优化

Anupam Gupta, Guru Guruganesh, Honghao Lin, Vahab Mirrokni, Renato Paes Leme, David P. Woodruff

机构 * Google Research(谷歌研究院) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种确定性多项式时间算法,在在线逆向线性优化中达到最优遗憾 $O(\sqrt d)$,通过变度量更新撤销机制解决了Sakaue提出的开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08733 2026-10-07 cs.RO 新提交

Towards an Extensible Benchmark for Spoken Dialogue with Social Robots

面向社交机器人语音对话的可扩展基准测试

Casey Kennington, Ross Mead, Saad Elbeleidy, Jesse Thomason

机构 * Boise State University(博伊西州立大学) ; Semio(Semio公司) ; Peerbots(Peerbots公司) ; Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究提出一个可扩展的社交机器人语音对话基准,涵盖澄清、打断、具身信号和时间约束,并采用实时通信框架Retico以支持人机语音交互。

Comments Accepted to and presented at the IROS 2026 Workshop on Human-Robot Dialogue

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08726 2026-10-07 cs.RO cs.AI 新提交

EgoLAP: Learning from Egocentric Human Data through Language-Action Reasoning

EgoLAP:通过语言-动作推理从自我中心人类数据中学习

Lihan Zha, Shresth Grover, Tenny Yin, Samuel M. Bateman, Hengkai Pan, Mengchao Zhang, Aykut Onol, Allen Z. Ren, Dhruv Shah, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) ; Toyota Research Institute(丰田研究所) ; Physical Intelligence

AI总结 EgoLAP提出一种VLA预训练框架,通过语言动作思维链联合学习人类与机器人轨迹,利用运动意图跨具身迁移,在真实世界任务中达80.1%进展,性能提升2.3倍。

Comments Project website: https://ego-lap.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08722 2026-10-07 cs.AI cs.LG 新提交

Does an Agent's History Tell You When Compaction Will Hurt? A Modest, Bounded Effect on the TRACE Paired-Replay Corpus

代理的历史能否预示压缩何时会带来损害?TRACE配对重放语料库上的一个适度、有界效应

Egor Pakhomov, Erik Nijkamp

机构 * Salesforce AI Research(赛富时人工智能研究院)

AI总结 本研究探究代理历史能否预测上下文压缩的损害,发现预测能力弱,最佳触发器避免21%有害边界并保留84%压缩机会,但需更多语料库验证。

Comments Accepted at the IAB Workshop (Interpreting Agent Behavior) at NeurIPS 2026 (non-archival). 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08720 2026-10-07 cs.AI 新提交

WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?

WorldSolver:LLM智能体能否通过求解器生成来模拟物理动力学?

Siru Jiang, Yongzhe Lyu, Shuo Lu, Yubin Wang, Yuxiang Zhang, Yue Liao, Bin Wang, Jian Liang, Tieniu Tan

机构 * NLPR & MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室与多模态人工智能系统全国重点实验室) ; PKU(北京大学)

AI总结 WorldSolver提出一个包含168个物理模拟任务的基准,评估LLM智能体生成求解器的能力,发现现有前沿智能体在视觉和物理正确性上表现不佳,最高得分仅48.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08718 2026-10-07 cs.CL cs.LG 新提交

When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting

当遗忘并非灾难性:关于虚假遗忘的机制

Vedant Palit, Florent Draye, Nicolas Zucchet, Zhijing Jin, Bernhard Schölkopf

机构 * MPI for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所(蒂宾根)) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; Hector Foundation(赫克托基金会) ; Stanford University(斯坦福大学) ; ELLIS Institute Tübingen(ELLIS研究所(蒂宾根))

AI总结 研究微调中语言模型的虚假遗忘机制,发现遗忘包含可逆的共享访问丧失与不可逆的个体事实侵蚀,后者才是灾难性的,其主导性取决于新数据对旧记忆的移动方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2610.08717 2026-10-07 cs.CV cs.LG 新提交

Co-Evolving Paths and Flows via Path-Flow Alignment

路径与流的协同演化:通过路径-流对齐

Zeyu Michael Li, William Xingxu Chen, Xiang Cheng

机构 * Duke University(杜克大学)

AI总结 提出路径-流对齐统一训练目标,联合训练端点保持路径网络与流网络,识别路径过拟合失效模式并引入随机路径正则化器抑制低熵瓶颈,在ImageNet-256x256上持续改善FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
↑