TraversalBench: Challenging Paths to Follow for Vision Language Models
TraversalBench: 为视觉语言模型设计的复杂路径挑战测试集
Clara Petrova, Zhuo Chen, Marin Soljačić
机构
*
Massachusetts Institute of Technology, Department of Physics(麻省理工学院物理系)
;
Massachusetts Institute of Technology, Institute for Data, Systems, and Society(麻省理工学院数据、系统与社会研究所)
;
NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用AI研究所)
Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization
基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理
Yang Li, Ruichen Zhang, Yinqiu Liu, Guangyuan Liu, Abbas Jamalipour, Xianbin Wang, Dong In Kim
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学)
;
The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼)
;
Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦)
;
Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索
An Yu, Weiheng Lu, Jian Li, Zhenfei Zhang, Yunhang Shen, Felix X. -F. Ye, Ming-Ching Chang
机构
*
Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系)
;
School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)
;
Nanjing University(南京大学)
;
Xiamen University(厦门大学)
;
Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)
Video Understanding by Design: How Datasets Shape Video Models
通过设计理解视频:数据集如何塑造视频模型
Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao
机构
*
School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学)
;
School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)
专题命中
视频多模态
:multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Toward Scalable Co-located Practical Learning: Assisting with Computer Vision and Multimodal Analytics
迈向可扩展的协同实践学习:协助计算机视觉和多模态分析
Xinyu Li, Linxuan Zhao, Yueqiao Jin, Yuchen Liu, Jin Zhou, Roberto Martinez-Maldonado, Dragan Gasevic, Lixiang Yan
机构
*
Centre for Learning Analytics at Monash(墨尔本大学学习分析中心)
;
Monash University(墨尔本大学)
;
Department of Civil and Environmental Engineering(土木与环境工程系)
;
School of Education(教育学院)
;
The University of Hong Kong(香港大学)
CR-JEPA: Cross-Modal Joint-Embedding Predictive Learning for Remote Sensing Image Retrieval
CR-JEPA:用于遥感图像检索的跨模态联合嵌入预测学习
Md Aminur Hossain, Ayush V. Patel, Nitant Dube, Biplab Banerjee
机构
*
Space Applications Centre, Indian Space Research Organisation(印度空间研究组织空间应用中心)
;
Centre of Studies in Resources Engineering, Indian Institute of Technology Bombay(印度理工学院孟买资源工程研究中心)
CommentsWe have curated a paper list on RAG security in https://github.com/TreeAI-Lab/Awesome-RAG-Security, and we warmly welcome authors who wish to have their new work included to contact us via email
Conditional Normalizing Flows for Forward and Backward Joint State and Parameter Estimation
条件归一化流用于前向和后向联合状态与参数估计
Luke S. Lagunowich, Guoxiang Grayson Tong, Daniele E. Schiavazzi
机构
*
Department of Computer Science and Engineering University of Notre Dame(计算机科学与工程系诺特达姆大学)
;
Department of Pediatrics Stanford University(儿科系斯坦福大学)
;
Department of Applied and Computational Mathematics and Statistics University of Notre Dame(应用与计算数学与统计系诺特达姆大学)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵
Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu
机构
*
Georgetown University(乔治城大学)
;
University of Southern California(南加州大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
Arizona State University(亚利桑那州立大学)
专题命中
多模态生成
:multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
UESTC
;
University of Virginia(弗吉尼亚大学)
;
HKUST(GZ)(香港科技大学(广州))
;
Cornell University(康奈尔大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
机构
*
Boston University School of Engineering(波士顿大学工程学院)
;
Stanford University(斯坦福大学)
;
University of Pittsburgh Medical Center(匹兹堡大学医学中心)
;
Boston University School of Medicine(波士顿大学医学院)
MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding
MotionGPT-2:用于运动生成与理解的通用运动-语言模型
Yuan Wang, Di Huang, Yaqi Zhang, Wanli Ouyang, Jile Jiao, Xuetao Feng, Dan Xu, Shixiang Tang
机构
*
Tsinghua University(清华大学)
;
The University of Sydney(悉尼大学)
;
University of Science and Technology of China(中国科学技术大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Intime Department Store(Intime百货)
;
Deepeleph
;
HKUST(香港科技大学)
Learning What's Real: Disentangling Signal and Measurement Artifacts in Multi-Sensor Data, with Applications to Astrophysics
学习真实内容:在多传感器数据中分离信号和测量伪影,应用于天体物理学
Pablo Mercader-Perez, Carolina Cuesta-Lazaro, Daniel Muthukrishna, Jeroen Audenaert, V. Ashley Villar, David W. Hogg, Marc Huertas-Company, William T. Freeman
机构
*
Massachusetts Institute of Technology(麻省理工学院)
;
Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会)
;
Institute for Advanced Studies(高级研究 institute)
;
Harvard University(哈佛大学)
;
New York University(纽约大学)
;
Instituto de Astrofísica de Canarias(加那利大天文台)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks
FieldWorkArena:面向真实作业任务的代理AI基准测试
Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang
机构
*
Fujitsu Limited(富士通株式会社)
;
Fujitsu Research of America(富士通美国研究部)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Master’s Student, The University of Tokyo(东京大学硕士研究生)
;
Agent Research Collective(代理研究集体)