arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2410.10650 2024-10-15 cs.CL cs.AI 62%

Generative AI and Its Impact on Personalized Intelligent Tutoring Systems

Subhankar Maity, Aniket Deroy

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Scientific Report (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10614 2024-10-15 cs.CE cs.AI cs.CL q-fin.CP 62%

Modeling News Interactions and Influence for Financial Market Prediction

Mengyu Wang, Shay B. Cohen, Tiejun Ma

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10088 2024-10-15 cs.RO cs.AI cs.CV cs.LG 62%

The Ingredients for Robotic Diffusion Transformers

Sudeep Dasari, Oier Mees, Sebastian Zhao, Mohan Kumar Srirama, Sergey Levine

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09776 2024-10-15 cs.CV cs.CL 62%

ECIS-VQG: Generation of Entity-centric Information-seeking Questions from Videos

Arpan Phukan, Manish Gupta, Asif Ekbal

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted in EMNLP 2024, https://openreview.net/forum?id=CriKOn01dI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08588 2024-10-14 eess.IV cs.AI cs.CV 62%

ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation

Siyou Li, Beining Xu, Yihao Luo, Dong Nie, Le Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04701 2024-10-10 cs.CV cs.AI 62%

ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes

Hashmat Shadab Malik, Muhammad Huzaifa, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Journal ref Asian Conference on Computer Vision - 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19676 2024-10-02 cs.CV cs.AI 62%

See Detail Say Clear: Towards Brain CT Report Generation via Pathological Clue-driven Representation Learning

Chengxin Zheng, Junzhong Ji, Yanzhao Shi, Xiaodan Zhang, Liangqiong Qu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Our work has been accepted by EMNLP2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06693 2024-09-27 cs.CV cs.AI cs.CG 62%

DC3DO: Diffusion Classifier for 3D Objects

Nursena Koprucu, Meher Shashwat Nigam, Shicheng Xu, Biruk Abere, Gabriele Dominici, Andrew Rodriguez, Sharvaree Vadgama, Berfin Inal, Alberto Tono

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17457 2024-09-27 cs.CV cs.AI 62%

CadVLM: Bridging Language and Vision in the Generation of Parametric CAD Sketches

Sifan Wu, Amir Khasahmadi, Mor Katz, Pradeep Kumar Jayaraman, Yewen Pu, Karl Willis, Bang Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05200 2024-09-26 cond-mat.mtrl-sci cs.AI cs.CL cs.LG 62%

Are LLMs Ready for Real-World Materials Discovery?

Santiago Miret, N M Anoop Krishnan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04449 2024-09-23 cs.CL cs.CV 62%

MAIRA-2: Grounded Radiology Report Generation

Shruthi Bannur, Kenza Bouzid, Daniel C. Castro, Anton Schwaighofer, Anja Thieme, Sam Bond-Taylor, Maximilian Ilse, Fernando Pérez-García, Valentina Salvatelli, Harshita Sharma, Felix Meissen, Mercy Ranjit, Shaury Srivastav, Julia Gong, Noel C. F. Codella, Fabian Falck, Ozan Oktay, Matthew P. Lungren, Maria Teodora Wetscherek, Javier Alvarez-Valle, Stephanie L. Hyland

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 72 pages, 21 figures. v2 updates the model and adds results on the PadChest-GR dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12973 2024-09-23 cs.CV cs.AI 62%

The Era of Foundation Models in Medical Imaging is Approaching : A Scoping Review of the Clinical Value of Large-Scale Generative AI Applications in Radiology

Inwoo Seo, Eunkyoung Bae, Joo-Young Jeon, Young-Sang Yoon, Jiho Cha

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 25 pages,3 figures, 4 tables, submitted to NPJ imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12244 2024-09-20 cs.CV cs.AI cs.LG 62%

Sparks of Artificial General Intelligence(AGI) in Semiconductor Material Science: Early Explorations into the Next Frontier of Generative AI-Assisted Electron Micrograph Analysis

Sakhinana Sagar Srinivas, Geethan Sannidhi, Sreeja Gangasani, Chidaksh Ravuru, Venkataramana Runkana

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Published at Deployable AI (DAI) Workshop at AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09040 2024-09-17 cs.HC cs.AI cs.CL 62%

ChatSUMO: Large Language Model for Automating Traffic Scenario Generation in Simulation of Urban MObility

Shuyang Li, Talha Azfar, Ruimin Ke

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08260 2024-09-13 cs.CV cs.MM 62%

Improving Text-guided Object Inpainting with Semantic Pre-inpainting

Yifu Chen, Jingwen Chen, Yingwei Pan, Yehao Li, Ting Yao, Zhineng Chen, Tao Mei

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ECCV 2024. Source code is available at https://github.com/Nnn-s/CATdiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07913 2024-09-13 cs.CV cs.AI 62%

UGAD: Universal Generative AI Detector utilizing Frequency Fingerprints

Inzamamul Alam, Muhammad Shahid Muneer, Simon S. Woo

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10671 2024-09-11 cs.CL cs.AI 62%

Qwen2 Technical Report

An Yang, Baosong Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Zhou, Chengpeng Li, Chengyuan Li, Dayiheng Liu, Fei Huang, Guanting Dong, Haoran Wei, Huan Lin, Jialong Tang, Jialin Wang, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Ma, Jianxin Yang, Jin Xu, Jingren Zhou, Jinze Bai, Jinzheng He, Junyang Lin, Kai Dang, Keming Lu, Keqin Chen, Kexin Yang, Mei Li, Mingfeng Xue, Na Ni, Pei Zhang, Peng Wang, Ru Peng, Rui Men, Ruize Gao, Runji Lin, Shijie Wang, Shuai Bai, Sinan Tan, Tianhang Zhu, Tianhao Li, Tianyu Liu, Wenbin Ge, Xiaodong Deng, Xiaohuan Zhou, Xingzhang Ren, Xinyu Zhang, Xipin Wei, Xuancheng Ren, Xuejing Liu, Yang Fan, Yang Yao, Yichang Zhang, Yu Wan, Yunfei Chu, Yuqiong Liu, Zeyu Cui, Zhenru Zhang, Zhifang Guo, Zhihao Fan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14176 2024-08-28 cs.CV cs.AI 62%

SwiftBrush v2: Make Your One-step Diffusion Model Better Than Its Teacher

Trung Dao, Thuan Hoang Nguyen, Thanh Le, Duc Vu, Khoi Nguyen, Cuong Pham, Anh Tran

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08459 2024-08-22 cs.CL cs.CV cs.LG 62%

JPEG-LM: LLMs as Image Generators with Canonical Codec Representations

Xiaochuang Han, Marjan Ghazvininejad, Pang Wei Koh, Yulia Tsvetkov

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15238 2024-08-20 cs.CL cs.AI cs.LG 62%

Learning Using Generated Privileged Information by Text-to-Image Diffusion Models

Rafael-Edy Menadil, Mariana-Iuliana Georgescu, Radu Tudor Ionescu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17256 2024-08-20 cs.IT cs.CV cs.MM eess.SP math.IT 62%

Latency-Aware Generative Semantic Communications with Pre-Trained Diffusion Models

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Chuan Heng Foh, Pei Xiao, Mehdi Bennis

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted for publication in IEEE Wireless Communication Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08315 2024-08-19 cs.CV cs.AI 62%

Segment Anything for Videos: A Systematic Survey

Chunhui Zhang, Yawen Cui, Weilin Lin, Guanjie Huang, Yan Rong, Li Liu, Shiguang Shan

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments https://github.com/983632847/SAM-for-Videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07349 2024-08-15 eess.IV cs.CV cs.MM 62%

Automated Retinal Image Analysis and Medical Report Generation through Deep Learning

Jia-Hong Huang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Ph.D. thesis, 124 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06772 2024-08-14 cs.CV cs.AI cs.LG cs.RO 62%

Exploring Domain Shift on Radar-Based 3D Object Detection Amidst Diverse Environmental Conditions

Miao Zhang, Sherif Abdulatif, Benedikt Loesch, Marco Altmann, Marius Schwarz, Bin Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 5 figures, 3 tables, accepted in IEEE International Conference on Intelligent Transportation Systems (ITSC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06632 2024-08-14 cs.HC cs.AI cs.CL 62%

EditScribe: Non-Visual Image Editing with Natural Language Verification Loops

Ruei-Che Chang, Yuxuan Liu, Lotus Zhang, Anhong Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments ASSETS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02711 2024-08-07 cs.SD cs.AI cs.LG eess.AS 62%

Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models

Pushkar Jajoria, James McDermott

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00106 2024-08-02 cs.CV cs.AI 62%

WAS: Dataset and Methods for Artistic Text Segmentation

Xudong Xie, Yuzhe Li, Yang Liu, Zhifei Zhang, Zhaowen Wang, Wei Xiong, Xiang Bai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00096 2024-08-02 cs.CV cs.AI 62%

From Attributes to Natural Language: A Survey and Foresight on Text-based Person Re-identification

Fanzhi Jiang, Su Yang, Mark W. Jones, Liumei Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20584 2024-07-29 cs.CV cs.AI 62%

Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization

Yisu Liu, Jinyang An, Wanqian Zhang, Dayan Wu, Jingzi Gu, Zheng Lin, Weiping Wang

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09760 2024-07-16 cs.CV cs.AI 62%

ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report

Yixiao Yuan, Yingzhe Peng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏