SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
SynPO:融合描述性和偏好优化的视频详细描述生成
Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu
机构
*
Sun Yat-Sen University(中山大学)
;
Lanzhou University(兰州大学)
;
The University of Hong Kong(香港大学)
;
Beijing Institute of Technology(北京理工大学)
;
National University of Singapore(新加坡国立大学)
Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D
Hoi3DGen:生成高质量的人-物交互的3D模型
Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll
机构
*
University of Tübingen(图宾根大学)
;
Tübingen AI Center(图宾根人工智能中心)
;
Max Planck Institute for Informatics(马克斯·普朗克信息学院)
;
Technische Universität Nürnberg(纽伦堡技术大学)
专题命中
其他VLM
:multimodal large language model(abstract);分类 cs.CV、cs.LG
Know When to Abstain: Optimal Selective Classification with Likelihood Ratios
知何时退避:基于似然比的最优选择性分类
Alvin Heng, Harold Soh
机构
*
Department of Computer Science, National University of Singapore(计算机科学系,国立新加坡大学)
;
Smart Systems Institute, National University of Singapore(智能系统研究所,国立新加坡大学)
Simplifying Outcomes of Language Model Component Analyses with ELIA
用ELIA简化语言模型组件分析的结果
Aaron Louis Eidt, Nils Feldhus
机构
*
Technische Universität Berlin(柏林技术大学)
;
Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所)
;
BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
FreshMem: 基于大脑的频率-空间混合内存用于流视频理解
Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen
机构
*
College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院)
;
Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
专题命中
其他VLM
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(教育部计算机网络与信息集成重点实验室)
;
School of Software Technology, Zhejiang University(浙江大学软件学院)
Privacy-Preserving in Connected and Autonomous Vehicles Through Vision to Text Transformation
通过视觉到文本转换实现连接和自动驾驶车辆中的隐私保护
Abdolazim Rezaei, Mehdi Sookhak, Ahmad Patooghy, Shahab S. Band, Amir Mosavi
机构
*
organization= Department of Computre Science, Texas A\&M University Corpus Christi , addressline= 6300 Ocean Dr , city= Corpus Christi , postcode= 78412 , state= Texas , country= USA
;
organization= Department of Information Management, International Graduate School of Artificial Intelligence, National Yunlin University of Science
;
organization= Institute of the Information Society, Ludovika University of Public Service , city= Budapest , postcode= 78412 , country= Hungary
;
organization= North Carolina A\&T State University , addressline= 601 E Market , city= Greensboro , postcode= 27411 , country= USA
Understanding World or Predicting Future? A Comprehensive Survey of World Models
理解世界还是预测未来?世界模型的全面综述
Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li
机构
*
Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)
专题命中
其他VLM
:multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结
本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。
CommentsExtended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables
机构
*
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院机械工程系)
;
Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院电气工程与计算机科学系)
;
Department of Computer Science, Technical University of Munich, Munich, Germany(慕尼黑技术大学计算机科学系)
Amirmojtaba Sabour, Michael S. Albergo, Carles Domingo-Enrich, Nicholas M. Boffi, Sanja Fidler, Karsten Kreis, Eric Vanden-Eijnden
机构
*
NVIDIA(NVIDIA公司)
;
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Harvard University(哈佛大学)
;
Kempner Institute(凯姆纳研究所)
;
IAIFI(IAIFI机构)
;
Microsoft Research(微软研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Courant Institute, New York University(纽约大学应用数学学院)
;
ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)
专题命中
其他VLM
:vision language model(abstract);分类 cs.AI、cs.LG
Find Them All: Unveiling MLLMs for Versatile Person Re-identification
找到它们全部:揭示MLLMs用于多功能人物重识别
Jinhao Li, Zijian Chen, Lirong Deng, Guangtao Zhai, Changbo Wang
机构
*
School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)
;
Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所)
;
Macao Polytechnic University(澳门 polytechnic 大学)
;
Shanghai AI Laboratory(上海人工智能实验室)