BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields
BLaDA: 在3DGS场域中实现语言到功能灵巧动作的桥梁
Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao, Wanjun Jia, Dongsheng Luo, Jiacheng Lin, Kailun Yang, Zhiyong Li, Yaonan Wang
机构
*
School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
;
National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)
;
Key Laboratory of Advanced Manufacturing Technology of the Ministry of Education, Guizhou University(教育部贵州大学先进制造技术重点实验室)
EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution
EvoSpark:内生交互代理社会的统一长周期叙述进化
Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu
机构
*
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
;
Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)
机构
*
Shanghai Tech University(上海科技大学)
;
Tongji University(同济大学)
;
East China University of Science and Technology(东华大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
专题命中
GUI与屏幕智能体
:multimodal large language model(abstract);分类 cs.AI
机构
*
SKLCCSE, Beihang University(北京航空航天大学安全实验室)
;
Institute of Information Engineering, CAS(中国科学院信息工程研究所)
;
China University of Petroleum (East China)(中国石油大学(华东))
;
Zhejiang University of Technology(浙江工业大学)
;
University of Chinese Academy of Science(中国科学院大学)
;
AI Security Lab(360人工智能安全实验室)
;
The University of Sydney(悉尼大学)
;
Henan University of Science and Technology(河南理工大学)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见
Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang
机构
*
School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院)
;
Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所)
;
Faculty of Education, East China Normal University(东华师范大学教育学院)
机构
*
Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)
;
Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
大规模安全:大型模型和智能体安全的全面综述
Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang
机构
*
Fudan University(复旦大学)
;
The University of Melbourne(墨尔本大学)
;
Singapore Management University(新加坡国立大学)
;
Deakin University(德肯大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
City University of Hong Kong(香港城市大学)
;
University of Oxford(牛津大学)
;
Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The University of Sydney(悉尼大学)
;
Griffith University(格里菲斯大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Sea AI Lab(Sea AI实验室)
;
Tsinghua University(清华大学)
;
Virginia Tech(弗吉尼亚理工大学)
;
CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部)
;
University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
;
Purdue University(普渡大学)
;
Duke University(杜克大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
RIKEN(理化学研究所)
;
The University of Tokyo(东京大学)
Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
大型视觉-语言模型高效推理:瓶颈、技术与前景
Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li
机构
*
The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
Representation geometry shapes task performance in vision-language modeling for CT enterography
表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用
Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham
机构
*
Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门)
;
Department of Gastroenterology(消化内科部门)
;
Department of Emergency Medicine(急诊医学部门)
;
Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
Mema:增强视觉-语言理解的内存增强适配器
Ying Liu, Yudong Han, Kean Shi, Liyuan Pan
机构
*
Beijing Institute of Technology(北京理工大学)
;
Peking University(北京大学)
;
Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV