arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

共收录 1149
2507.04749 2025-12-30 cs.CV

MatDecompSDF: High-Fidelity 3D Shape and PBR Material Decomposition from Multi-View Images

MatDecompSDF:从多视角图像中恢复高保真3D形状和PBR材质分解

Chengyu Wang, Isabella Bennett, Henry Scott, Liang Zhang, Mei Chen, Hao Li, Rui Zhao

机构 * San Francisco State University 1600 Holloway Avenue San Francisco California USA 94132 Department of Electrical \& Computer Engineering, Boston University 8 Saint Mary’s Street Boston MA USA 02215 University of California, Berkeley 2150 Shattuck Avenue Berkeley California USA 94704 Stanford University 450 Serra Mall Stanford California USA 94305 Carnegie Mellon University 5000 Forbes Avenue Pittsburgh Pennsylvania USA 15213 University of Washington 185 Stevens Way Seattle Washington USA 98195 San Francisco State University Department of Electrical \& Computer Engineering, Boston University University of California, Berkeley Stanford University Carnegie Mellon University University of Washington

AI总结 MatDecompSDF通过联合优化SDF、神经场和MLP模型,实现从多视角图像中高保真3D形状和PBR材质的分解。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17479 2025-12-30 cs.AI cs.CY cs.HC cs.LG

Culturally-Attuned Moral Machines: Implicit Learning of Human Value Systems by AI through Inverse Reinforcement Learning

文化适应的道德机器:通过逆强化学习让AI隐式学习人类价值观系统

Nigini Oliveira, Jasmine Li, Koosha Khalvati, Rodolfo Cortes Barragan, Katharina Reinecke, Andrew N. Meltzoff, Rajesh P. N. Rao

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Institute for Learning and Brain Sciences, University of Washington(学习与脑科学研究所,华盛顿大学)

AI总结 本文提出通过逆强化学习让AI隐式学习不同文化的价值观,展示AI能从人类行为中习得文化适应的道德系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2025-12-30 cs.CV

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22248 2025-12-30 cs.LG

Amortized Inference for Model Rocket Aerodynamics: Learning to Estimate Physical Parameters from Simulation

模型火箭气动学的 amortized 推断:从仿真中学习估计物理参数

Rohit Pandey, Rohan Pandey

机构 * bellevue High School(贝尔维尤高中) University of Washington(华盛顿大学)

AI总结 本文提出了一种基于仿真的 amortized 推断方法,通过训练神经网络在合成飞行数据上,实现对模型火箭气动参数的高效估计,显著提升了真实飞行中的预测精度。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19486 2025-12-30 cs.LG cs.AI

Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectification

利用有限人类数据高效推理:微调后再校正

Lei Wang, Zikun Ye, Jinglong Zhao

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院) Questrom School of Business, Boston University(波士顿大学questrom商学院)

AI总结 本文提出一种两阶段框架,结合微调与校正,并优化有限标记样本的分配,以提高估计和推理性能,实现成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00654 2025-12-30 cs.CV cs.CL cs.LG

ICONS: Influence Consensus for Vision-Language Data Selection

ICONS: 视觉-语言数据选择中的影响共识

Xindi Wu, Mengzhou Xia, Rulin Shao, Zhiwei Deng, Pang Wei Koh, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Allen Institute for AI(人工智能研究院)

AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21809 2025-12-29 cs.CL cs.CY

On The Conceptualization and Societal Impact of Cross-Cultural Bias

关于跨文化偏见的概念化与社会影响

Vitthal Bhandari

机构 * University of Washington / Seattle(华盛顿大学/西雅图)

AI总结 本文探讨了跨文化偏见在NLP中的概念化与社会影响,提出观察结果以帮助研究者更有效地评估偏见的危害。

Comments Term paper for LING 575 (Societal Impacts of Language Technologies)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21551 2025-12-29 cs.HC cs.AI cs.CL

Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

人机交互对齐:为互惠人机未来设计、评估和演化以价值为中心的AI

Hua Shen, Tiffany Knearem, Divy Thakkar, Pat Pataranutaporn, Anoop Sinha, Yike, Shi, Jenny T. Liang, Lama Ahmad, Tanu Mitra, Brad A. Myers, Yang Li

机构 * NYU Shanghai, New York University(纽约大学上海校区) Google(谷歌) Massachusetts Institute of Technologyy(麻省理工学院) Google, Paradigms of Intelligence(谷歌、智能范式) Carnegie Mellon University, New York University(卡内基梅隆大学、纽约大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

AI总结 本研讨会探讨如何通过设计、评估和演化以价值为中心的AI,实现人机之间的互惠协作与动态对齐。

Comments CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21529 2025-12-29 cs.CV cs.AI

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20218 2025-12-24 cs.LG

Cost-TrustFL: Cost-Aware Hierarchical Federated Learning with Lightweight Reputation Evaluation across Multi-Cloud

跨多云环境的成本感知联邦学习:轻量级声誉评估的分层联邦学习

Jixiao Yang, Jinyu Chen, Zixiao Huang, Chengda Xu, Chi Zhang, Sijia Li

机构 * Westcliff University(韦斯特克莱夫大学) University of Virginia(弗吉尼亚大学) University of Washington(华盛顿大学) Northeastern University(东北大学) University of Michigan(密歇根大学)

AI总结 Cost-TrustFL通过轻量级声誉评估和成本感知聚合策略,在多云环境中实现模型性能与通信成本的联合优化,有效防御中毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20128 2025-12-24 cs.CV

milliMamba: Specular-Aware Human Pose Estimation via Dual mmWave Radar with Multi-Frame Mamba Fusion

milliMamba:基于双频毫米波雷达的镜面感知人体姿态估计方法

Niraj Prakash Kini, Shiau-Rung Tsai, Guan-Hsun Lin, Wen-Hsiao Peng, Ching-Wen Ma, Jenq-Neng Hwang

机构 * National Yang Ming Chiao Tung University University of Washington

AI总结 milliMamba通过双频毫米波雷达和多帧Mamba融合,实现镜面感知的人体姿态估计,提升鲁棒性和精度。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11750 2025-12-24 physics.ao-ph cs.AI cs.LG

Improving Medium Range Severe Weather Prediction through Transformer Post-processing of AI Weather Forecasts

通过AI天气预报的Transformer后处理改进中等范围严重天气预测

Zhanxiang Hua, Ryan Sobash, David John Gagne, Yingkai Sha, Alexandra Anderson-Frey

机构 * Department of Atmospheric and Climate Science University of Washington(大气科学与气候系华盛顿大学) US NSF National Center for Atmospheric Research(美国NSF大气研究中心)

AI总结 本研究利用Transformer后处理提升AI天气预报的中等范围严重天气预测能力,通过改进模型结构和训练方法,提高预测准确性和可靠性。

Comments revision update

Journal ref Artificial Intelligence for the Earth Systems 5.1 (2026): 250045

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06085 2025-12-24 cs.DS cs.CR cs.LG math.PR stat.CO

Algorithmic Aspects of the Log-Laplace Transform and a Non-Euclidean Proximal Sampler

Log-Laplace变换的算法方面及非欧几里得近端采样器

Sivakanth Gopi, Yin Tat Lee, Daogao Liu, Ruoqi Shen, Kevin Tian

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学)

AI总结 本文提出了一种非欧几里得近端采样器,利用log-Laplace变换实现正则化,改进了差分隐私凸优化在ℓp和Schatten-p范数中的复杂度,同时保持最优风险界。

Comments Fixed error in previous version, main result weakened by a quadratic factor (see discussion in Section 1.4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08985 2025-12-23 cs.LG

Low-Regret and Low-Complexity Learning for Hierarchical Inference

低后悔和低复杂度学习用于分层推断

Sameep Chattopadhyay, Vinay Sutar, Jaya Prakash Champati, Sharayu Moharir

机构 * 1 Paul G. Allen School of Computer Science \& Engineering, University of Washington, 2 Department of Electrical Engineering, IIT Bombay, 3 Department of Computer Science, University of Victoria Email

AI总结 本文提出HI-LCB和HI-LCB-lite策略,通过低复杂度学习实现分层推断中的低后悔和高效资源利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03790 2025-12-22 cs.CL cs.LG stat.ML

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16853 2025-12-19 cs.CV cs.AI

GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation

GenEval 2:解决文本到图像评估中的基准漂移问题

Amita Kamath, Kai-Wei Chang, Ranjay Krishna, Luke Zettlemoyer, Yushi Hu, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR 部门) University of Washington(华盛顿大学) University of California, Los Angeles(洛杉矶大学) Allen Institute for AI(人工智能研究院)

AI总结 GenEval 2通过改进的视觉概念覆盖和组合性,解决文本到图像评估中的基准漂移问题,提供更符合人类判断的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16842 2025-12-19 cs.CV cs.AI cs.RO

OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction

OPENTOUCH:将全手触觉带入现实世界交互

Yuxin Ray Song, Jinzhou Li, Rao Fu, Devin Murphy, Kaichen Zhou, Rishi Shiv, Yaqi Li, Haoyu Xiong, Crystal Elaine Owens, Yilun Du, Yiyue Luo, Xianyi Cheng, Antonio Torralba, Wojciech Matusik, Paul Pu Liang

机构 * MIT(麻省理工学院) Duke University(杜克大学) Brown University(布朗大学) University of Washington(华盛顿大学) Harvard University(哈佛大学)

AI总结 OpenTouch是首个现实场景的第一人称全手触觉数据集,通过同步视频-触觉-姿态数据和详细注释,推动多模态感知和机器人操作研究。

Comments https://opentouch-tactile.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16000 2025-12-19 cs.IT cs.LG math.AP math.DS math.IT

Information theory and discriminative sampling for model discovery

信息论与判别采样用于模型发现

Yuxuan Bao, J. Nathan Kutz

机构 * Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) Department of Electrical and Computer Engineering, University of Washington(电气与计算机工程系,华盛顿大学)

AI总结 本文通过信息论与判别采样方法,提升数据驱动模型发现的效率和性能,优化采样策略以减少数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11900 2025-12-19 cs.CL

Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection

寻找有缺陷的虚构作品:通过情节漏洞检测评估语言模型的复杂推理

Kabir Ahuja, Melanie Sclar, Yulia Tsvetkov

机构 * Paul G. Allen Center for Computer Science & Engineering(保罗·G·艾伦计算机科学与工程中心) University of Washington(华盛顿大学)

AI总结 本研究提出通过情节漏洞检测评估语言模型的复杂推理能力,发现先进模型在检测漏洞时表现不佳,且生成故事易引入漏洞。

Comments CoLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15699 2025-12-18 cs.LG cs.SE

FrontierCS: Evolving Challenges for Evolving Intelligence

FrontierCS: 蒸馏智能面临的挑战

Qiuyang Mang, Wenhao Chai, Zhifei Li, Huanzhi Mao, Shang Zhou, Alexander Du, Hanchen Li, Shu Liu, Edwin Chen, Yichuan Wang, Xieting Chu, Zerui Cheng, Yuan Xu, Tian Xia, Zirui Wang, Tianneng Shi, Jianzhu Yao, Yilong Zhao, Qizheng Zhang, Charlie Ruan, Zeyu Shen, Kaiyuan Liu, Runyuan He, Dong Xing, Zerui Li, Zirong Zeng, Yige Jiang, Lufeng Cheng, Ziyi Zhao, Youran Sun, Wesley Zheng, Meiyuwang Zhang, Ruyi Ji, Xuechang Tu, Zihan Zheng, Zexing Chen, Kangyang Zhou, Zhaozi Wang, Jingbang Chen, Aleksandra Korolova, Peter Henderson, Pramod Viswanath, Vijay Ganesh, Saining Xie, Zhuang Liu, Dawn Song, Sewon Min, Ion Stoica, Joseph E. Gonzalez, Jingbo Shang, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) UCSD(加州大学圣迭戈分校) X-camp Academy(X-camp学院) Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学) University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) New York University(纽约大学) MIT(麻省理工学院)

AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。

Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11963 2025-12-18 cs.LG

QLENS: Towards A Quantum Perspective of Language Transformers

QLENS:迈向语言转换器的量子视角

Aditya Gupta, Kirandeep Kaur, Vinayak Gupta, Chirag Shah

机构 * Issaquah High School, Washington, USA(华盛顿州伊萨夸高中) University of Washington, Washington, USA(华盛顿大学)

AI总结 QLENS从量子力学角度提出语言转换器的物理视角,通过将潜在激活转换为希尔伯特空间中的状态向量,利用单位ary算子和哈密顿量建模转换器生成过程,探索其概率分布和预测轨迹的演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14404 2025-12-17 stat.ML cs.LG math.OC physics.comp-ph

From STLS to Projection-based Dictionary Selection in Sparse Regression for System Identification

从STLS到基于投影的字典选择在稀疏回归中的系统识别应用

Hangjun Cho, Fabio V. G. Amaral, Andrei A. Klishin, Cassio M. Oishi, Steven L. Brunton

机构 * AI Institute in Dynamic Systems, Department of Mechanical Engineering, University of Washington(动态系统人工智能研究所,机械工程系,华盛顿大学) Department of Mechanical Engineering, University of Hawai‘i at Mānoa(机械工程系,夏威夷大学马诺阿分校) Departamento de Matemática e Computação, Faculdade de Ciências e Tecnologia, Universidade Estadual Paulista “Júlio de Mesquita Filho”(数学与计算系,科技学院,保罗斯州立大学“朱利奥·梅斯奎塔·弗洛雷斯”分校)

AI总结 本文提出基于评分的字典选择方法,提升动态系统识别的准确性和可解释性,适用于SINDy算法的改进。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09605 2025-12-17 eess.IV cs.AI cs.LG q-bio.QM

TomoGraphView: 3D Medical Image Classification with Omnidirectional Slice Representations and Graph Neural Networks

TomoGraphView: 基于全方位切片表示和图神经网络的3D医学图像分类

Johannes Kiechle, Stefan M. Fischer, Daniel M. Lang, Cosmin I. Bercea, Matthew J. Nyflot, Lina Felsner, Julia A. Schnabel, Jan C. Peeken

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息技术学院,慕尼黑技术大学) Department of Radiation Oncology, TUM School of Medicine, TUM University Hospital rechts der Isar, Technical University of Munich(放射肿瘤学系,TUM医学院,TUM大学医院rechts der Isar,慕尼黑技术大学) Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich(生物医学影像机器学习研究所,海德堡慕尼黑) Institute of Radiation Medicine, Helmholtz Munich(放射医学研究所,海德堡慕尼黑) School of Biomedical Engineering and Imaging Sciences, King's College London(生物医学工程与成像科学学院,伦敦国王学院) Department of Radiation Oncology, University of Washington(放射肿瘤学系,华盛顿大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 TomoGraphView通过整合全方位体积切片与图神经网络,解决3D医学图像分类中切片方向限制和空间一致性问题。

Comments Preprint submitted to Medical Image Analysis (MedIA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17985 2025-12-17 cs.HC cs.AI

How K-12 Educators Use AI: LLM-Assisted Qualitative Analysis at Scale

K-12教育工作者如何使用AI:大规模LLM辅助定性分析

Alex Liu, Lief Esbenshade, Shawon Sarkar, Victor Tian, Zachary Zhang, Kevin He, Min Sun

机构 * University of Washington(华盛顿大学) Hensun Innovation(翰森创新)

AI总结 本研究通过大规模LLM辅助分析,探讨K-12教育工作者在教学中使用AI工具的模式与方法,揭示其教学推理过程并为教育工具设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17756 2025-12-16 cs.LG cs.SY eess.SY

SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling

SuperGen: 一种高效的超高清视频生成系统,支持草图和分块

Fanjiang Ye, Zepeng Zhao, Yi Mu, Jucheng Shen, Renjie Li, Kaijian Wang, Saurabh Agarwal, Myungjin Lee, Triston Cao, Aditya Akella, Arvind Krishnamurthy, T. S. Eugene Ng, Zhengzhong Tu, Yuke Wang

机构 * Rice University(里士满大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德克萨斯农工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco(思科公司) NVIDIA(英伟达公司) University of Washington(华盛顿大学)

AI总结 SuperGen通过分块技术实现高效超高清视频生成,无需额外训练,降低计算和内存成本,提升生成速度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12233 2025-12-16 cs.RO

Robust Underwater Localization of Buoyancy Driven microFloats Using Acoustic Time-of-Flight Measurements

利用声学时间飞行测量实现抗干扰的水下浮力驱动微浮体定位

Murad Mehrab Abrar, Trevor W. Harrison

机构 * Applied Physics Laboratory University of Washington Seattle, WA, USA(应用物理实验室 华盛顿大学 塞维亚, 美国)

AI总结 本文提出了一种基于双向声学时间飞行测量的稳健水下定位方法,通过过滤技术显著降低定位误差,提高微浮体的定位鲁棒性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏