Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition
视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿
Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales
机构
*
Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学)
;
IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)
机构
*
Multimodal Language Department(多模态语言部门)
;
Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所)
;
Department of Linguistics(语言学系)
;
Boğaziçi University(博多伊奇大学)
;
Donders Institute for Brain Cognition and Behaviour(多纳尔斯脑认知与行为研究所)
;
Radboud University(拉德堡德大学)
;
Department of Linguistics and Communication(语言学与沟通系)
;
University of Birmingham(伯明翰大学)
AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows
AgentCo-op: 基于检索的互操作多智能体工作流合成
Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma
机构
*
Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系)
;
Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)
机构
*
Northwestern University in Qatar(卡塔尔西北大学)
;
Independent Researcher(独立研究员)
;
Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)
;
University of Tübingen(图宾根大学)
专题命中
视觉定位与Grounding
:vision language model(abstract);grounding(abstract)
机构
*
School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院)
;
Wuhan University, Wuhan, China(武汉大学)
;
Lab for Intelligence and visiON (LION)(智能与视觉实验室)
;
Xi'an Jiaotong University(西安交通大学)
IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools
IndusAgent: 通过智能工具增强开放词汇工业异常检测
Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao
机构
*
State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)
;
Santa Clara University(圣克拉拉大学)
;
LongCat Team(LongCat团队)
;
Independent Researcher(独立研究者)
;
New York University(纽约大学)
;
Sun Yat-sen University(孙中山大学)
;
Nanyang Technological University(南洋理工大学)
;
Stanford University(斯坦福大学)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.CV
DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos
DeformMaster: 一个用于从视频中生成变形物体交互物理-神经世界模型
Can Li, Zhoujian Li, Ren Li, Jie Gu, Lei Lei, Jingmin Chen, Lei Sun
机构
*
Nankai University(南开大学)
;
Zhejiang University(浙江大学)
;
Southern University of Science and Technology(南方科技大学)
;
Rightly Robotics, A4X(Rightly Robotics,A4X)
;
University of Science and Technology of China(中国科学技术大学)
机构
*
Dream-X Team(Dream-X团队)
;
Stanford University(斯坦福大学)
;
National University of Singapore(新加坡国立大学)
;
Independent Researcher(独立研究者)
;
Case Western Reserve University(凯斯西储大学)
;
UC Santa Cruz(加州大学圣克鲁兹分校)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.CV
CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization
CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪
Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei
机构
*
Autel Robotics(Autel机器人公司)
;
Nanjing University(南京大学)
;
Peking University(北京大学)
;
Southern University of Science and Technology(南方科技大学)
;
University of Hong Kong(香港大学)