arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2349
2512.10316 2025-12-12 cs.CV

ConStruct: Structural Distillation of Foundation Models for Prototype-Based Weakly Supervised Histopathology Segmentation

ConStruct:用于基于原型的弱监督病理分割的基模态结构蒸馏

Khang Le, Ha Thach, Anh M. Vu, Trang T. K. Vo, Han H. Huynh, David Yang, Minh H. N. Le, Thanh-Huy Nguyen, Akash Awasthi, Chandra Mohan, Zhu Han, Hien Van Nguyen

机构 * Ho Chi Minh City University of Technology(胡志明市技术大学) University of Technology Sydney(悉尼技术大学) University of Houston(休斯顿大学) University of Information Technology(信息科技大学) College of Medical Science and Technology, Taipei Medical University(台北医学院医学科技学院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Montefiore Medical Center, Albert Einstein College of Medicine(蒙特福伊医疗中心,阿尔伯特·爱因斯坦医学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 ConStruct通过结合CONCH的形态感知表示、SegFormer的多尺度结构线索和文本引导的语义对齐,提出一种高效的弱监督病理分割方法,提升分割精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10314 2025-12-12 cs.CV

DualProtoSeg: Simple and Efficient Design with Text- and Image-Guided Prototype Learning for Weakly Supervised Histopathology Image Segmentation

DualProtoSeg: 基于文本和图像引导的原型学习的简单高效设计用于弱监督病理图像分割

Anh M. Vu, Khang P. Le, Trang T. K. Vo, Ha Thach, Huy Hung Nguyen, David Yang, Han H. Huynh, Quynh Nguyen, Tuan M. Pham, Tuan-Anh Le, Minh H. N. Le, Thanh-Huy Nguyen, Akash Awasthi, Chandra Mohan, Zhu Han, Hien Van Nguyen

机构 * University of Houston(德克萨斯大学休斯顿分校) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) University of Technology Sydney(悉尼技术大学) Vin University(文大学) Department of Computer Science, Emory University(埃默里大学计算机科学系) College of Medical Science and Technology, Taipei Medical University(台北医学院医学科学与技术学院) Montefiore Medical Center, Albert Einstein College of Medicine(蒙特福医院,阿尔伯特·爱因斯坦医学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 DualProtoSeg通过结合文本和图像引导的原型学习,提升弱监督病理图像分割的性能与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21888 2025-12-12 cs.CV

CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding

CAPE:一种基于CLIP的互补热图线索点集用于具身参照理解

Fevziye Irem Eyiokur, Dogucan Yaman, Hazım Kemal Ekenel, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Istanbul Technical University(伊斯坦布尔技术大学) Carnegie Mellon University(卡内基梅隆大学) KIT Campus Transfer GmbH (KCT)(KIT校园转移有限责任公司)

AI总结 CAPE通过双模型框架和CLIP-aware Pointing Ensemble模块,提升具身参照理解任务中指向线索的多模态推理能力,实现75.0 mAP的高精度表现。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10132 2025-12-12 cs.DS cs.AI

Universal Hirschberg for Width Bounded Dynamic Programs

宽度受限动态程序的通用Hirschberg算法

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

AI总结 本文提出通用Hirschberg算法,通过高度压缩递归树实现宽度受限动态程序的空间高效回溯。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10058 2025-12-12 cs.AI cs.CY cs.HC cs.SI

Mind the Gap! Pathways Towards Unifying AI Safety and Ethics Research

注意差距!迈向统一人工智能安全与伦理研究的路径

Dani Roytburg, Beck Miller

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学)

AI总结 本文通过文献计量学分析揭示人工智能安全与伦理研究的结构性分裂,并提出通过共享基准、跨机构平台和混合方法整合两者以构建更公正的人工智能系统。

Comments Accepted for presentation at IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09797 2025-12-11 cs.NI cs.LG

M3Net: A Multi-Metric Mixture of Experts Network Digital Twin with Graph Neural Networks

M3Net: 一种基于图神经网络的多指标专家混合网络数字孪生

Blessed Guda, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 M3Net通过图神经网络实现多指标专家混合网络,提升网络性能预测的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11482 2025-12-11 cs.CV

OpenConstruction: A Systematic Synthesis of Open Visual Datasets for Data-Centric Artificial Intelligence in Construction Monitoring

OpenConstruction: 一种系统性地合成开放视觉数据集的系统,用于数据驱动的建筑监控人工智能

Ruoxin Xiong, Yanyu Wang, Jiannan Cai, Kaijian Liu, Yuansheng Zhu, Pingbo Tang, Nora El-Gohary

机构 * College of Architecture & Environmental Design, Kent State University(建筑与环境设计学院,肯特州立大学) Bert S. Turner Department of Construction Management, Louisiana State University(建设管理伯特·S·Turner部门,路易斯安那州立大学) School of Civil & Environmental Engineering, and Construction Management, The University of Texas at San Antonio(土木与环境工程学院及建设管理学院,德克萨斯大学圣安东尼奥分校) Department of Civil, Environmental, and Ocean Engineering, Stevens Institute of Technology(土木、环境和海洋工程系,史蒂文斯理工学院) Department of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学系,罗切斯特理工学院) Department of Civil and Environmental Engineering, Carnegie Mellon University(土木与环境工程系,卡内基梅隆大学) Department of Civil and Environmental Engineering, University of Illinois at Urbana-Champaign(土木与环境工程系,伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究系统性地整合了51个开放视觉数据集,构建了OpenConstruction开源目录,旨在提升建筑领域数据驱动的人工智能应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08763 2025-12-10 cs.LG

Learning and Editing Universal Graph Prompt Tuning via Reinforcement Learning

通过强化学习学习和编辑通用图提示微调

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出LEAP模型,通过强化学习在保留通用图提示理论基础的同时,优化提示选择与编辑,提升图和节点任务的性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08738 2025-12-10 cs.CV cs.CL

Pose-Based Sign Language Spotting via an End-to-End Encoder Architecture

基于姿态的的手势 spotting 通过端到端编码器架构

Samuel Ebimobowei Johnny, Blessed Guda, Emmanuel Enejo Aaron, Assane Gueye

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于姿态的端到端编码器架构,用于手语 spotting 任务,通过减少计算成本和视觉噪声,实现了在连续手语序列中检测特定手语的高准确率。

Comments To appear at AACL-IJCNLP 2025 Workshop WSLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08613 2025-12-10 cs.AI

Protein Secondary Structure Prediction Using Transformers

基于变换器的蛋白质二级结构预测

Manzi Kevin Maxime

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

AI总结 本文提出基于变换器的模型,利用注意力机制预测蛋白质二级结构,通过数据增强提升泛化能力,有效捕捉局部和长距离残基相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08267 2025-12-10 cs.LG

SOFA-FL: Self-Organizing Hierarchical Federated Learning with Adaptive Clustered Data Sharing

SOFA-FL:具有自适应聚类数据共享的自组织分层联邦学习

Yi Ni, Xinkun Wang, Han Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 SOFA-FL通过自适应聚类数据共享和动态拓扑重构,解决联邦学习中数据异质性和网络拓扑刚性的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08063 2025-12-10 cs.LG

Deep Kernel Aalen-Johansen Estimator: An Interpretable and Flexible Neural Net Framework for Competing Risks

深度核Aalen-Johansen估计器:一种可解释且灵活的神经网络框架用于竞争风险

Xiaobin Shen, George H. Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于深度学习的可解释竞争风险模型,通过核函数学习权重来预测累积发病率函数,并在多个数据集上验证了其解释能力。

Comments Machine Learning for Health (ML4H) 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09494 2025-12-10 cs.LG stat.ME

Representation Retrieval Learning for Heterogeneous Data Integration

异构数据整合的表示检索学习

Qi Xu, Annie Qu

机构 * Department of Statistics & Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Statistics and Applied Probability, University of California, Santa Barbara(统计与应用概率系,加州大学圣芭芭拉分校)

AI总结 本文提出了一种表示检索学习框架,通过整合性概念和选择性整合惩罚提升异构数据整合的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07848 2025-12-10 cs.LG

RaX-Crash: A Resource Efficient and Explainable Small Model Pipeline with an Application to City Scale Injury Severity Prediction

RaX-Crash:一种资源高效且可解释的小模型流水线及其在城市规模伤害严重性预测中的应用

Di Zhu, Chen Xie, Ziwei Wang, Haoyun Zhang

机构 * 1 Department of Computer Science Engineering, Santa Clara University, Santa Clara, USA Email 2 Manning College of Information \& Computer Sciences, University of Massachusetts Amherst, Amherst, MA, USA Email 3 Department of Electrical Computer Engineering, Carnegie Mellon University, Pittsburgh, USA Email 4 University of Pennsylvania, Philadelphia, USA Email

AI总结 RaX-Crash通过高效小模型和可解释性方法,在城市规模伤害严重性预测中实现优于小语言模型的性能,同时通过SHAP分析揭示关键影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07168 2025-12-09 cs.SD cs.AI cs.LG eess.AS

JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention

JEPA作为一种神经令牌化器:利用密度自适应注意力学习鲁棒的语音表示

Georgios Ioannides, Christos Constantinou, Aman Chadha, Aaron Elkins, Linsey Pang, Ravid Shwartz-Ziv, Yann LeCun

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon GenAI(亚马逊生成人工智能) James Silberrad Brown Center for Artificial Intelligence(詹姆斯·西伯拉德·布朗人工智能中心) University of Bristol(布里斯托大学) Stanford University(斯坦福大学) Northeastern University(东北大学) New York University(纽约大学)

AI总结 本文提出了一种结合JEPA和密度自适应注意力机制的两阶段自监督框架,用于高效学习鲁棒的语音表示,通过令牌化和高保真重建实现高效压缩。

Comments UniReps: Unifying Representations in Neural Models (NeurIPS 2025 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07005 2025-12-09 cs.SD cs.AI

Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition

多语调普通话干声唱Dataset:歌唱语调识别基准

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学) Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学)

AI总结 本文提出多语调普通话干声唱语料库,用于评估语音模型在歌唱场景中的表现,并探讨方言和元音对语调变化的影响。

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12714-12721, October 27, 2025. Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20616 2025-12-09 cs.LG cs.SY eess.SY

Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning

通过单次强化学习训练多轮任务规划的LLM代理

Hanjiang Hu, Changliu Liu, Na Li, Yebin Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

AI总结 本文通过单次强化学习训练LLM代理进行多轮任务规划,利用GRPO实现高效策略优化,实验显示其在复杂任务规划中的表现优于大参数基线模型。

Comments Accepted by IEEE Control Systems Letters (L-CSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06274 2025-12-09 cs.LG cs.AI

Networked Restless Multi-Arm Bandits with Reinforcement Learning

网络化 restless 多臂老虎机与强化学习

Hanmo Zhang, Zenghui Sun, Kai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出网络化RMAB框架,结合RMAB与独立级联模型以捕捉网络环境中的臂间相互作用,并通过Q学习算法验证了网络效应的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06158 2025-12-09 cs.CV

Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation

基于跟踪的4D生成:用于3D模型动画的基础跟踪器运动先验

Su Sun, Cheng Zhao, Himangi Mittal, Gaurav Mittal, Rohith Kukkala, Yingjie Victor Chen, Mei Chen

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

AI总结 Track4DGen通过结合基础跟踪器和混合4D高斯点划法,提升多视角视频生成和4D生成的稳定性与精度。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06104 2025-12-09 cs.LG

ARC-AGI Without Pretraining

ARC-AGI无需预训练

Isaac Liao, Albert Gu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 CompressARC通过最小化描述长度(MDL)在无需预训练的情况下解决ARC-AGI谜题,展示了深度学习在极低数据条件下产生智能的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05969 2025-12-09 cs.CV cs.AI

Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices

视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务

Hokin Deng

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。

Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23880 2025-12-09 cs.CV cs.GR

TRELLISWorld: Training-Free World Generation from Object Generators

TRELLISWorld: 从物体生成器中无需训练的世界生成

Hanke Chen, Yuan Liu, Minchen Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 TRELLISWorld通过无需训练的模块化瓷砖生成器实现通用语言驱动的3D场景生成,支持多样布局、高效生成和灵活编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16028 2025-12-09 cs.LG cs.AI

TimeAutoDiff: A Unified Framework for Generation, Imputation, Forecasting, and Time-Varying Metadata Conditioning of Heterogeneous Time Series Tabular Data

TimeAutoDiff:一个统一框架,用于生成、填补缺失数据、预测以及时间变化元数据条件下的异质时间序列表格数据

Namjoon Suh, Yuning Yang, Din-Yin Hsieh, Qitong Luan, Shirong Xu, Shixiang Zhu, Guang Cheng

机构 * UCLA(美国大学联盟) Microsoft(微软公司) Xiamen Univ.(厦门大学) CMU(卡内基梅隆大学)

AI总结 TimeAutoDiff通过统一框架实现时间序列生成、填补、预测及元数据条件生成,结合轻量级VAE和扩散模型,提升效率与泛化能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18886 2025-12-09 cs.LG cs.AI

A Survey on Diffusion Models for Time Series and Spatio-Temporal Data

时间序列和时空数据扩散模型综述

Yiyuan Yang, Ming Jin, Haomin Wen, Chaoli Zhang, Yuxuan Liang, Lintao Ma, Yi Wang, Chenghao Liu, Bin Yang, Zenglin Xu, Shirui Pan, Qingsong Wen

机构 * University of Oxford(牛津大学) Griffith University(格里菲斯大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Salesforce Research(Salesforce研究) East China Normal University(东华大学) Fudan University(复旦大学)

AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。

Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05922 2025-12-08 cs.CV

LPD: Learnable Prototypes with Diversity Regularization for Weakly Supervised Histopathology Segmentation

LPD: 可学习原型与多样性正则化用于弱监督病理分割

Khang Le, Anh Mai Vu, Thi Kim Trang Vo, Ha Thach, Ngoc Bui Lam Quang, Thanh-Huy Nguyen, Minh H. N. Le, Zhu Han, Chandra Mohan, Hien Van Nguyen

机构 * University of Houston(德克萨斯大学休斯顿分校) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息科技大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) University of Technology Sydney(悉尼技术大学) The University of Danang - VNUK Institute for Research and Executive Education(丹绒大学 - VNUK研究与执行教育学院) Carnegie Mellon University(卡内基梅隆大学) Montefiore Medical Center, Albert Einstein College of Medicine(蒙特夫iore医疗中心,阿尔伯特·爱因斯坦医学院)

AI总结 本文提出一种单阶段可学习原型框架,通过多样性正则化提升病理分割性能,实现BCSS-WSSS上的最佳mIoU和mDice指标。

Comments Note: Khang Le and Anh Mai Vu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05364 2025-12-08 cs.CL

Transformer-Enabled Diachronic Analysis of Vedic Sanskrit: Neural Methods for Quantifying Types of Language Change

基于Transformer的吠陀梵语历时分析:神经方法用于量化语言变化类型

Ananth Hariharan, David Mortensen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究利用神经方法分析梵语历时变化,通过弱监督技术量化语言复杂度动态分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00607 2025-12-08 cs.CC cs.AI

On the Holographic Geometry of Deterministic Computation

确定性计算的全息几何

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

AI总结 本文提出确定性计算在一维工作带上的全息表示,通过几何和信息论方法证明空间时间本体的算法信息由边界数据决定。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏