arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2606.12688 2026-06-16 cs.LG cs.AI cs.DC 新提交

M*: A Modular, Extensible, Serving System for Multimodal Models

M*: 一个模块化、可扩展的多模态模型服务系统

Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出M*系统,通过将模型表示为数据流图并引入Walk Graph抽象,支持多模态复合模型的高效服务,在多个任务上降低延迟并提升吞吐量。

Comments The codebase is available at https://github.com/mstar-project/mstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06007 2026-06-16 cs.LG 版本更新

Diffusion Models for Adaptive Sequential Data Generation

自适应序列数据生成的扩散模型

Haoyang Cao, Minshuo Chen, Yinbin Han, Renyuan Xu

机构 * Department of Applied Mathematics and Statistics, Data Science and AI Institute, and Mathematical Institute for Data Science, Johns Hopkins University(应用数学与统计学系、数据科学与人工智能研究所、数据科学数学研究所,约翰霍普金斯大学) Department of Industrial Engineering and Management Sciences, Northwestern University(工业工程与管理科学系,西北大学) Department Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)

AI总结 提出一种顺序前向后向扩散框架,通过沿序列逐步注入和去除噪声并基于历史生成条件确保自适应性,用于生成自适应时间序列数据,并引入新的分数匹配目标实现高效并行训练,在合成数据和均值-方差最优投资组合构建中验证有效性。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02955 2026-06-16 cs.CL cs.AI cs.LG 版本更新

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码

Siva Rajesh Kasa, Yasong Dai, Sumit Negi, Hongdong Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。

Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01110 2026-06-16 physics.geo-ph cs.LG quant-ph 版本更新

Accelerating physics-informed neural networks for full waveform inversion using a hybrid quantum-classical finite-basis architecture

使用混合量子-经典有限基架构加速全波形反演的物理信息神经网络

Hoang Anh Nguyen, Divakar Vashisth, Ali Tura

机构 * Department of Geophysics, Colorado School of Mines(地质学系,科罗拉多矿业学院) Department of Energy Science and Engineering, Stanford University(能源科学与工程系,斯坦福大学) Department of Petroleum Engineering, Colorado School of Mines(石油工程系,科罗拉多矿业学院)

AI总结 提出一种混合量子-经典FBPINN用于声波全波形反演,通过参数化量子电路实现波场和速度网络,在约8倍少的训练迭代次数下达到比经典基线更低的L1速度误差,并泛化至其他波反演问题。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26418 2026-06-16 cs.LG cs.AI cs.DC 版本更新

When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control

深度强化学习何时超越校准基线?自适应资源控制的基准研究

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John Fossaceca

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学)

AI总结 通过RLScale-Bench基准测试,发现校准的基于规则的自动缩放器在所有工作负载上成本均低于六种主流深度强化学习算法,并揭示了算法选择、基线校准和评估协议的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18827 2026-06-16 q-bio.NC cs.AI 版本更新

OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens

OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性

Konstantin F. Willeke, Polina Turishcheva, Alex Gilbert, Goirik Chakrabarty, Hasan A. Bedel, Paul G. Fahey, Yongrong Qiu, Marissa A. Weis, Michaela Vystrčilová, Taliah Muhammad, Lydia Ntanavara, Rachel E. Froebe, Kayla Ponder, Zheng Huan Tan, Emin Orhan, Erick Cobos, Sophia Sanborn, Katrin Franke, Fabian H. Sinz, Alexander S. Ecker, Andreas S. Tolias

机构 * Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所) Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科) Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所) Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)

AI总结 利用小鼠视觉皮层31亿神经元数据,训练多模态多任务模型OmniMouse,在神经预测、行为解码等任务上达到最优,发现性能随数据量可靠提升但模型规模收益饱和,与AI领域标准扩展规律相反。

Comments Published at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10031 2026-06-16 cs.LG 版本更新

Graph Learning Should Move Beyond Restrictive Views of Spectral and Message-Passing GNNs

图学习应超越对谱图神经网络和消息传递图神经网络的狭隘观点

Antonis Vasileiou, Juan Cervino, Pascal Frossard, Charilaos I. Kanatsoulis, Christopher Morris, Michael T. Schaub, Pierre Vandergheynst, Zhiyang Wang, Guy Wolf, Ron Levie

机构 * RWTH Aachen University(亚琛工业大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Stanford University(斯坦福大学) University of California San Diego(加州大学圣地亚哥分校) Univ. de Montréal(蒙特利尔大学) Mila(Mila人工智能研究所) Technion – Israel Institute of Technology(技术学院–以色列理工学院)

AI总结 本文澄清了谱图神经网络与消息传递图神经网络的异同,提出基于特征基对称性的谱GNN精确定义,并倡导统一理论框架以推动图学习发展。

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07209 2026-06-16 cs.LG 版本更新

Enhancing Physics-Informed Neural Networks Through Feature Engineering

通过特征工程增强物理信息神经网络

Shaghayegh Fazliani, Zachary Frangella, Madeleine Udell

机构 * Department of Mathematics, Stanford University(数学系,斯坦福大学) Department of Management Science & Engineering, Stanford University(管理科学与工程系,斯坦福大学) ICME, Stanford University(ICME,斯坦福大学)

AI总结 提出SAFE-NET,一种单层自适应特征工程网络,通过傅里叶特征和简化架构,以更少参数实现比深层网络更快的收敛和更低的误差。

Comments Published in Transactions on Machine Learning Research (TMLR), November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25594 2026-06-16 cs.CV cs.AI 版本更新

K-Prism: A Knowledge-Guided and Prompt Integrated Universal Medical Image Segmentation Model

K-Prism: 一种知识引导与提示集成的通用医学图像分割模型

Bangwei Guo, Yunhe Gao, Meng Ye, Difei Gu, Yang Zhou, Leon Axel, Dimitris Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学) The University of Texas at Arlington(德克萨斯大学阿灵顿分校) New York University(纽约大学)

AI总结 提出K-Prism统一分割框架,通过双提示表示和混合专家解码器整合语义先验、上下文知识和交互反馈三种知识范式,在18个数据集上实现语义、上下文和交互分割的最优性能。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21613 2026-06-16 cs.CL cs.SD eess.AS 版本更新

ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech

ChildGuard:针对儿童仇恨言论的专用数据集

Gautam Siddharth Kashyap, Mohammad Anas Azeez, Rafiq Ali, Zohaib Hasan Siddiqui, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) DSEU(德里国家理工学院) Department of Information and Computer Science, KFUPM(科威特石油大学信息与计算机科学系) Stanford University(斯坦福大学)

AI总结 针对社交媒体上针对儿童的仇恨言论问题,构建了大规模英文数据集ChildGuard,包含351,877条标注实例,覆盖三个年龄段,并评估了多种模型性能。

Comments Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14516 2026-06-15 cs.AI cs.CL cs.CY 新提交

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Every Eval Ever:AI评估结果的统一模式与社区仓库

Jan Batzner, Sree Harsha Nelaturu, Damian Stachura, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

机构 * Technical University Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Weizenbaum Institute(魏岑鲍姆研究所) Zuse Institute Berlin(柏林祖泽研究所) Evidence Prime Trustible Kitware ETH Zurich(苏黎世联邦理工学院) StickFlux Labs Stanford University(斯坦福大学) Northeastern University(东北大学) IBM Research(IBM研究院) Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco(思科) University of Notre Dame(圣母大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Oxford(牛津大学) Ohio University(俄亥俄大学) Writer TCS Research(塔塔咨询服务研究院) Oxford University Press(牛津大学出版社) Queen Mary University of London(伦敦玛丽女王大学) Technical University Berlin(柏林工业大学) University of Delaware(特拉华大学) Cinemo Johns Hopkins University(约翰霍普金斯大学) University of Copenhagen(哥本哈根大学) ELLIS(欧洲学习与智能系统实验室) Iowa State University(爱荷华州立大学) Meta FAIR University of Montreal(蒙特利尔大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所) EleutherAI Yale University(耶鲁大学) Hugging Face University of Edinburgh(爱丁堡大学) Harvard University(哈佛大学) ETH AI Center(ETH人工智能中心) MIT(麻省理工学院) MIT-IBM Watson Lab(MIT-IBM沃森实验室)

AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14218 2026-06-15 cs.RO cs.AI cs.LG 新提交

Universal Manipulation Exoskeleton: Learning Compliant Whole-body Policies with Real-time Torque Feedback

通用操控外骨骼:利用实时扭矩反馈学习全身柔顺策略

Litian Liang, Jingxi Xu, Xinda Qi, Yujun Cai, Houzhu Ding, Luqi Wang, Zhixin Sun, Jyh-Herng Chow, Ming Yang, Mark Cutkosky

机构 * Ant Group(蚂蚁集团) Stanford University(斯坦福大学)

AI总结 提出通用操控外骨骼(UME),通过实时触觉扭矩反馈和全身数据采集,使机器人学习主动柔顺策略,在受限空间中完成移动操作、力控翻转等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14072 2026-06-15 cs.CV cs.CL 新提交

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI

Wentao Ke, Jianche Liu

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Medicine, Stanford University(斯坦福大学医学院)

AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13955 2026-06-15 cs.LG 新提交

Smoothing Dark Areas in Molecular Latent Diffusion

分子潜在扩散中的暗区平滑

Xi Wang, Jiahan Li, Yuxuan Xia, Yingcheng Wu, Shaoyi Zheng, Shengjie Wang

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

AI总结 针对分子潜在扩散中存在的暗区问题,提出拓扑优化VAE(TopVAE),通过训练时内化结构和化学约束,减少暗区,提升离后验鲁棒性,在QM9和GEOM-Drugs上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13883 2026-06-15 cs.RO 新提交

Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation

基于蒸馏视觉语言可靠性的引导扩散用于空中导航

Ivan Valuev, Iana Zhura, Valerii Serpiva, Didar Seyidov, Dzmitry Tsetserukou

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出一种可靠性感知的扩散规划器,通过蒸馏视觉语言模型生成场景级可靠性热图,引导去噪过程处理不可靠区域,显著降低无人机导航中的障碍物违反率并提高区域可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13626 2026-06-15 cs.SD cs.LG 新提交

Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of Autoregressive, Latent-Variable, and Adversarial Approaches

巴赫风格符号音乐的生成建模:自回归、潜变量和对抗方法的比较研究

Dezhi Yu, Kyuil Lee, Yongkang Huang

机构 * Stanford University(斯坦福大学)

AI总结 比较自回归LSTM、潜变量模型和生成对抗网络在巴赫风格钢琴音乐生成中的表现,发现带注意力的自回归LSTM生成音乐最连贯,向量量化缓解后验塌陷,对抗方法捕捉局部音高但训练困难。

Comments 11 pages, 13 figures. All authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12360 2026-06-15 cs.LG 新提交

Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal

后训练的解剖:利用可解释性表征数据并塑造学习信号

Leon Bergen, Usha Bhalla, Sidharth Baskaran, Max Loeffler, Raphael Sarfati, Dhruvil Gala, Ryan Panwar, Santiago Aranguri, Thomas Fel, Atticus Geiger, Matthew Kowal, Siddharth Boppana, Daniel Balsam, Owen Lewis, Jack Merullo, Thomas McGrath, Ekdeep Singh Lubana

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

AI总结 提出基于可解释性的数据后训练流程,通过统计假设识别偏好数据中的潜在概念,实现细粒度反馈,减少虚假关联和不良行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24942 2026-06-15 cs.CL q-bio.NC 版本更新

Independent-Component-Based Encoding Models of Brain Activity During Story Comprehension

基于独立成分的故事理解过程中大脑活动的编码模型

Kamya Hari, Taha Binhuraib, Jin Li, Cory Shain, Anna A. Ivanova

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程学院) School of Psychological and Brain Sciences, Georgia Institute of Technology(佐治亚理工学院心理学与脑科学学院) Department of Linguistics, Stanford University(斯坦福大学语言学系)

AI总结 提出基于独立成分的编码框架,从fMRI数据中分离刺激驱动和噪声信号,利用语言模型预测独立成分时间序列,识别出与听觉和语言相关的认知网络,验证了成分的可解释性和跨个体一致性。

Comments Accepted to CCN 2026 (Proceedings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17750 2026-06-15 physics.optics cs.ET cs.LG 版本更新

Arbitrary control over multimode wave propagation for machine learning

用于机器学习的多模波传播的任意控制

Tatsuhiro Onodera, Martin M. Stein, Benjamin A. Ash, Mandar M. Sohoni, Melissa Bosch, Ryotatsu Yanagimoto, Marc Jankowski, Timothy P. McKenna, Tianyu Wang, Gennady Shvets, Maxim R. Shcherbakov, Logan G. Wright, Peter L. McMahon

机构 * School of Applied and Engineering Physics, Cornell University(应用与工程物理系,康奈尔大学) NTT Physics and Informatics Laboratories, NTT Research, Inc.(NTT物理与信息实验室,NTT研究公司) E. L. Ginzton Laboratory, Stanford University(E. L. Ginzton实验室,斯坦福大学) Kavli Institute at Cornell for Nanoscale Science, Cornell University(康奈尔大学纳米科学研究所) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Electrical Engineering and Computer Science, University of California(加州大学电气工程与计算机科学系) Department of Applied Physics, Yale University(耶鲁大学应用物理系)

AI总结 提出一种可快速重编程折射率的二维可编程波导,通过并行电光调制实现多模波传播的任意控制,并用于单次神经网络推理,理论表明面积增长为N^1.5而非N^2。

Journal ref Nat. Phys. 22, 164-171 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13677 2026-06-12 cs.RO cs.AI cs.CV cs.LG 新提交

Mana: Dexterous Manipulation of Articulated Tools

Mana: 铰接工具的灵巧操作

Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, C. Karen Liu

机构 * UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) Amazon FAR(亚马逊FAR)

AI总结 提出Mana框架,将灵巧操作重解释为动画问题,通过粗到细的流水线自动生成操作轨迹,实现铰接工具的零样本仿真到现实迁移。

Comments Project Page: https://zhaohengyin.github.io/mana

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12953 2026-06-12 cs.AI cs.CV cs.LG eess.IV 新提交

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

OpenMedQ:面向医学视觉语言模型的广泛开放预训练

Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学)

AI总结 提出OpenMedQ,在14个数据集(约335万样本)上预训练医学视觉语言模型,在PathVQA上BLEU-1达75.9,超越562B参数的Med-PaLM M,并在8个未见医学分类任务上取得最高平均macro-F1(0.757)。

Comments Medical Imaging with Deep Learning (MIDL) 2026, Short Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12935 2026-06-12 cs.AI 新提交

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略

Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

机构 * Amazon(亚马逊) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12709 2026-06-12 cs.MA cs.CR cs.LG 新提交

Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows

更聪明的破坏者,更好的修复者:线性多智能体工作流中的规模与安全性

Timothy McAllister, Sina Abdidizaji, Ivan Garibay, Ozlem Ozmen Garibay

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 研究模型规模对线性多智能体工作流安全性的影响,发现大模型更易执行恶意指令,但轻量级修复阶段可恢复性能,表明线性结构在适当校正下具有鲁棒性。

Comments 16 pages (4 are main text), 2 figures, 6 tables. Accepted to the AIWILD Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12671 2026-06-12 cs.CV 新提交

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) The University of Queensland(昆士兰大学)

AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。

Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12667 2026-06-12 cs.NI cs.AI cs.SY eess.SY 新提交

Free-Placement Optimization of Ground Station Locations for Low-Earth Orbit Satellites

低地球轨道卫星地面站位置的自由布局优化

Grace Ra Kim, Duncan Eddy, Vedant Srinivas, Mykel J. Kochenderfer

机构 * Department of Aeronautics and Astronautics, Stanford, CA(航空航天系,斯坦福大学,加州斯坦福) Department of Computer Science, Stanford University, Stanford, CA(计算机科学系,斯坦福大学,加州斯坦福)

AI总结 提出SCORE方法,通过两阶段自由布局优化地面站位置,相比差分进化算法减少5倍函数评估次数并提升13%下行吞吐量,相比固定站点方法提升15%总下行量。

Comments 34 pages, 13 figures, 11 tables, Journal of Aerospace Information Systems (JAIS)

详情

展开后加载摘要…

URL PDF HTML 收藏