arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

共收录 1060
2501.02158 2026-07-01 cs.CV 版本更新

Joint Optimization for 4D Human-Scene Reconstruction in the Wild

野外4D人体-场景重建的联合优化

Zhizheng Liu, Joe Lin, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 提出JOSH方法,通过联合优化场景、相机姿态和人体运动,从单目视频中实现野外4D人体-场景重建,优于现有方法。

Comments Project Page: https://vail-ucla.github.io/JOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29047 2026-06-30 cs.CE cs.LG physics.flu-dyn

Weak Dominant Balance for Robust Identification of Dynamically Consistent Fluid Flow Structure

弱主导平衡:用于鲁棒识别动态一致流体流动结构

Samuel Ahnert, Esther Lagemann, H. Jane Bae, Kunihiko Taira, Ricardo Vinuesa, Christian Lagemann, Steven L. Brunton

机构 * Department of Mechanical Engineering, University of Washington, Seattle, WA, USA(华盛顿大学机械工程系) AI Institute in Dynamic Systems, University of Washington, Seattle, WA, USA(动态系统人工智能研究所) Lynn Booth and Kent Kresa Department of Aerospace, California Institute of Technology, Pasadena, CA, USA(加州理工学院航空航天系) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Aerospace Engineering, University of Michigan, Ann Arbor, MI, USA(密歇根大学航空航天工程系)

AI总结 提出弱主导平衡框架,通过弱形式投影避免数值微分噪声,实现从高噪声数据中识别物理机制,并成功应用于湍流管道流动的三阶偏微分方程分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29020 2026-06-30 cs.CV cs.AI cs.ET cs.MM

Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis

语义感知、物理信息、几何基础的天气视频合成

Chenghao Qian, Nedko Savov, Lingdong Kong, Yeying Jin, Rui Song, Wenjing Li, Zhun Zhong, Jiaqi Ma, Gustav Markkula, Luc Van Gool

机构 * University of Leeds, UK(利兹大学,英国) National University of Singapore, Singapore(新加坡国立大学) University of California, Los Angeles, USA(美国加州大学洛杉矶分校) Hefei University of Technology, China(合肥工业大学)

AI总结 提出一种语义感知、物理信息、几何基础的框架,通过语义、动力学和几何三个条件信号引导视频编辑器合成多样且真实的天气效果,并提升自动驾驶语义分割的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27491 2026-06-29 cs.CV 新提交

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

SelectAnyTree: 一种用于3D森林LiDAR点云的可提示实例分割模型

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN(理化学研究所) University of Freiburg(弗莱堡大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(特温特大学) KC Machine Learning Lab(KC机器学习实验室) Hanoi University of Science and Technology(河内科技大学) Ritsumeikan University(立命馆大学)

AI总结 提出SelectAnyTree模型,通过点击提示和树冠高度模型引导的首次提示,实现3D森林点云中任意单木的实例分割,在交互和实例级别上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26429 2026-06-26 cs.LG cs.CL 新提交

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval: 联合模型-项目校准的统一LLM评估

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Arena University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出DualEval框架,通过联合模型-项目校准统一静态基准和竞技场式评估,生成可靠模型排名并支持基准压缩和异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26498 2026-06-26 math.OC cs.LG 新提交

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu

机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)

AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00206 2026-06-25 cs.CV cs.LG eess.IV 版本更新

SparseGS: Sparse View Synthesis using 3D Gaussian Splatting

SparseGS: 使用3D高斯泼溅的稀疏视角合成

Haolin Xiong, Sairisheek Muttukuru, Hanyuan Xiao, Rishi Upadhyay, Pradyumna Chari, Yajie Zhao, Achuta Kadambi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) USC Institute for Creative Technologies(南加州大学创意技术研究所)

AI总结 针对3D高斯泼溅在稀疏视角下出现伪影的问题,提出SparseGS,通过深度先验、新颖深度渲染、剪枝启发和未见视角正则化模块,实现高质量重建。

Comments Version accepted to 3DV 2025. Project page: https://github.com/ForMyCat/SparseGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01482 2026-06-24 math.NA cs.LG cs.NA 版本更新

A Robust Model-Based Approach for Continuous-Time Policy Evaluation with Unknown Lévy Process Dynamics

基于模型的鲁棒方法用于具有未知Lévy过程动力学的连续时间策略评估

Qihao Ye, Xiaochuan Tian, Yuhua Zhu

机构 * Department of Mathematics, University of California, San Diego, CA 92093, United States(加州大学圣地亚哥分校数学系) Department of Statistics and Data Science, University of California, Los Angeles, CA 90095, United States(加州大学洛杉矶分校统计学与数据科学系)

AI总结 针对含布朗和Lévy噪声的连续时间策略评估问题,提出基于模型的框架,通过最大似然估计与迭代尾部校正机制恢复未知系数,并建立策略评估误差的理论界。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02064 2026-06-24 eess.IV cs.CV 版本更新

CrossFusion: A Multi-Scale Cross-Attention Convolutional Fusion Model for Cancer Survival Prediction

CrossFusion: 一种用于癌症生存预测的多尺度交叉注意力卷积融合模型

Rustin Soraki, Huayu Wang, Sitong Liu, Joann G. Elmore, Linda Shapiro

机构 * University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出CrossFusion多尺度特征融合框架,通过交叉注意力机制整合不同放大倍数下的病理图像块,显著提升六种癌症的生存预测准确性。

Comments Accepted at MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23567 2026-06-23 cs.LG cs.AI 新提交

Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models

调度思维:在扩散语言模型中学习思维的顺序

Jiawei Xu, Minghui Liu, Aakriti Agrawal, Yifan Chen, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出自感知调度(SAS),通过策略优化学习扩散语言模型中的去掩码顺序,显著提升Sudoku和数学推理任务的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20474 2026-06-23 cs.LG cs.AI cs.PF 新提交

UltraQuant: 4-bit KV Caching for Context-Heavy Agents

UltraQuant: 面向上下文密集型智能体的4位KV缓存

Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao

机构 * Advanced Micro Devices(超威半导体) University of California, Los Angeles(加州大学洛杉矶分校) Purdue University(普渡大学)

AI总结 针对上下文密集型智能体场景,提出UltraQuant方法,通过4位KV缓存压缩、旋转量化和代码本量化,结合AMD GPU优化,在长上下文多轮任务中延迟降低3.47倍,吞吐量提升1.63倍。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20433 2026-06-23 cs.CL 版本更新

Disentangling Geometry, Performance, and Training in Language Models

解耦语言模型中的几何、性能与训练

Atharva Kulkarni, Jacob Mitchell Springer, Arjun Subramonian, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 系统研究Transformer权重几何(尤其是解嵌入矩阵有效秩)与下游性能的关系,发现有效秩主要反映训练超参数而非性能,不能可靠预测模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01022 2026-06-23 cs.LG eess.SP stat.ML 版本更新

VDW-GNNs: Vector diffusion wavelets for geometric graph neural networks

VDW-GNNs:面向几何图神经网络的向量扩散小波

David R. Johnson, Alexander Sietsema, Rishabh Anand, Deanna Needell, Smita Krishnaswamy, Michael Perlmutter

机构 * Program in Computing, Boise State University, Boise, Idaho, USA(博伊西州立大学计算项目) Department of Mathematics, UCLA, Los Angeles, CA, USA(洛杉矶大学数学系) Department of Computer Science, Yale University, New Haven, CT, USA(耶鲁大学计算机科学系) Department of Genetics, Yale University, New Haven, CT, USA(耶鲁大学遗传学系) Department of Mathematics, Boise State University, Boise, Idaho, USA(博伊西州立大学数学系)

AI总结 提出向量扩散小波(VDW),受向量扩散映射算法启发,可有效融入几何图神经网络(VDW-GNNs),在合成点云和真实风场、神经活动数据上表现良好,并证明其具有框架理论和旋转平移对称性。

Comments Presented at ICML 2026. A previous, shorter version of this work was presented in the "New Perspectives in Advancing Graph Machine Learning" workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16011 2026-06-23 stat.AP cs.AI math.PR math.ST stat.TH 版本更新

Brownian Motion with a Pulse: A Biostatistician's Guide to Diffusions, Bridges, Functional PCA, and First-Passage Models

带脉冲的布朗运动:生物统计学家指南——扩散、桥、函数主成分分析和首达时间模型

Eliuvish Han Cui

机构 * Department of Biostatistics, University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校生物统计学系) Kuntuo, an IQVIA company, China(IQVIA旗下公司Kuntuo,中国)

AI总结 本文教程系统介绍布朗运动在生物统计中的应用,涵盖构造、路径性质、马尔可夫性、Karhunen-Loeve展开、函数主成分分析、反射原理、局部时、随机微分方程、布朗桥及经验过程极限,并通过纵向生物标志物、退化建模等实例展示其应用。

Comments 24 pages, 4 figures, 5 tables; tutorial article with a reproducible illustrative experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20458 2026-06-19 cs.RO 新提交

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation

慢速大脑,快速规划器:延迟鲁棒的VLM增强城市导航

Zhenghao "Mark'' Peng, Honglin He, Quanyi Li, Yukai Ma, Bolei Zhou

机构 * Amazon FAR(亚马逊 FAR) UCLA(加州大学洛杉矶分校) Independent(独立) Zhejiang University(浙江大学)

AI总结 针对移动机器人在人行道导航中轨迹评分差距问题,提出一种无需训练的延迟鲁棒轨迹级融合层,利用VLM选择候选轨迹并与规划器输出融合,在挑战场景下降低ADE 30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14985 2026-06-19 cs.CV cs.CL 版本更新

IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models

IdealGPT: 通过大型语言模型迭代分解视觉与语言推理

Haoxuan You, Rui Sun, Zhecan Wang, Long Chen, Gengyu Wang, Hammad A. Ayyubi, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出IdealGPT框架,利用大型语言模型迭代分解视觉语言推理任务,通过子问题生成、子答案获取和最终答案推理的循环过程,在零样本设置下显著提升多步推理性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19122 2026-06-18 cs.RO 新提交

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

基于混合2D-3D学习的人行道机器人单目3D占用感知

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) Coco Robotics(Coco机器人) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18548 2026-06-18 cs.CY cs.AI 新提交

Engagement Intensity as a Learner-Modeling Signal for Adaptive AI Ethics Instruction

参与强度作为自适应AI伦理教学的学习者建模信号

Yongkyung Oh, Lynn Talton, Alex Bui

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

AI总结 本研究比较了三种学习者特征(使用频率、自评熟悉度、先前AI教育)与AI感知结果的关系,发现使用频率与所有五项结果显著相关,为自适应AI伦理教学提供了简单的入学者建模信号。

详情

展开后加载摘要…

URL PDF HTML 收藏