arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2607.10530 2026-07-14 cs.CE 新提交 78%

Integrating Physics-Informed Neural Networks and 3D Vascular Geometry Learning for Cerebral Aneurysm Detection and Multimodal Rupture-Risk Prediction

将物理信息神经网络与3D血管几何学习相结合用于脑动脉瘤检测和多模态破裂风险预测

Eshan Vipuil, Xianqi Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在结合物理信息神经网络与3D血管几何学习用于脑动脉瘤检测及多模态破裂风险预测。通过基于PointNeXt的检测器识别动脉瘤,利用物理信息神经网络生成血流动力学描述符,多模态模型整合多种变量预测风险,取得良好检测及预测效果,提供了定量多模态评估策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09948 2026-07-14 physics.med-ph cs.LG 新提交 78%

Artificial Intelligence Across the Cardiac Amyloidosis Diagnostic Pathway: From Single-Modality Detection to Multimodal Clinical Integration

人工智能在心脏淀粉样变性诊断途径中的应用:从单模态检测到多模态临床整合

Diana Shadibaeva, Rochak Dhakal, Kui Zhang, Xiaofeng Yang, Saurabh Malhotra, Weihua Zhou

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究心脏淀粉样变性诊断中人工智能的应用,按筛查、检测等临床任务综合相关研究,揭示其成熟度梯度,骨闪烁显像和SPECT/CT的二元检测及量化接近临床转化,亚型识别等任务尚处早期。

Comments Diana Shadibaeva and Rochak Dhakal contributed equally to this work. Total Pages = 35, No. of Figures = 4, No. of Tables on Manuscript = 1, Supplementary Tables = 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 78%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 78%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06973 2026-07-09 cs.LG 新提交 78%

Rethinking Multimodal Time-Series Forecasting Evaluation

重新思考多模态时间序列预测评估

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对现有多模态时间序列预测基准的问题,引入TimesX基准,通过自动数据生成管道获取多样真实世界时间序列。经实证研究发现,一些在现有基准上好的方法在TimesX上可能失败,而利用文本上下文的简单集成方法表现出色。

Journal ref Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03907 2026-07-07 eess.SP 新提交 78%

Task-Oriented Multimodal Edge Intelligence via Integrated Sensing-Communication-Computation

通过集成传感-通信-计算实现面向任务的多模态边缘智能

Weiwei Chen, Yinghui He, Zhong Ye, Dingzhu Wen, Guanding Yu

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

AI总结 针对现有单模态集成传感通信计算(ISCC)设计易受多种问题影响、多模态ISCC设计不足的情况,提出面向任务的多模态ISCC框架,用最大编码率降低准则及算法提升性能,实验表明优于基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03826 2026-07-07 eess.SP 新提交 78%

LAMBDA: A Low-Altitude Multimodal Base Dataset for UAV Sensing and Communication

LAMBDA:用于无人机传感与通信的低空多模态基础数据集

Lin Zhou, Peichuan Rao, Chenshuo Zhang, Jianhua Mo, Shu Sun, Zhiyong Chen, Meixia Tao

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究低空综合传感与通信需对齐多模态数据,为此引入LAMBDA数据集,通过高保真数字孪生管道生成,具有多种特性,涵盖多场景多条件,支持多种参数设置,经评估有可靠性与可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27886 2026-06-29 cs.LG 新提交 78%

A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset

HARMES数据集上多模态人类活动识别融合技术的比较

Ahmed Mohamady, Robin Burchard, Kristof Van Laerhoven

机构 * University of Siegen(锡根大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 系统比较七种传感器融合方法在HARMES多模态数据集上的性能,发现门控多模态融合在留一参与者评估中宏F1分数达0.82,优于拼接式后期融合基线(0.76)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 78%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26164 2026-06-26 cs.LG cs.NA math.NA physics.data-an stat.CO 新提交 78%

\chisao{}: A GPU-Native Parallel Optimizer for Multimodal Black-Box Functions via Convergence-Anticonvergence Oscillation

Chisao: 一种基于收敛-反收敛振荡的多模态黑盒函数的GPU原生并行优化器

Ira Wolfson

机构 * Braude College of Engineering(布劳德工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出GPU原生群体优化器Chisao,通过收敛-反收敛振荡循环逃离局部陷阱并冻结确认模态,在42个基准函数上实现100%模态恢复,速度提升达39倍。

Comments 22 pages, 4 Appendixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18640 2026-06-26 cs.LG q-bio.QM 新提交 78%

MetaboNet-Bench: A Multi-modal Benchmark for Glucose Forecasting in Type 1 Diabetes

MetaboNet-Bench:1型糖尿病血糖预测的多模态基准

Nathaniel Jeffries, Miriam Wolff, Sam Royston, Elizabeth Healey, Caleb Mayer, David Klonoff, Michael Snyder, Tao Wang

机构 * Department of Genetics, Stanford University School of Medicine(斯坦福大学医学院遗传学系) Replica Health Boston Children’s Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院) Diabetes Research Institute, Mills-Peninsula Medical Center(米尔斯半岛医学中心糖尿病研究所)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 针对1型糖尿病血糖预测算法缺乏标准化评估基准的问题,提出MetaboNet-Bench多模态基准,集成血糖、胰岛素和碳水化合物数据,通过多个模型对比验证多模态数据对模型性能的影响。

Comments main content in 10 pages with 5 figures; supplementary section with 11 more pages and 5 more figures. v2: fix figure 4 and 5's misordering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10637 2026-06-26 hep-ex 新提交 78%

A Multimodal Domain-Adversarial Network for Fragmentation Background Suppression in AMS Heavy Nuclei Measurements

用于AMS重核测量中碎裂本底抑制的多模态域对抗网络

Zhen Liu, Valerio Formato, Muhammad Waqas

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对AMS重核测量中碎裂本底问题,提出多模态域对抗网络,融合硅径迹仪和飞行时间探测器数据,通过域对抗训练实现模拟到飞行数据的迁移,有效抑制本底。

Comments 16 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-06-25 eess.SP 新提交 78%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 78%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 78%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19675 2026-06-19 cs.RO 新提交 78%

ForEnt: A Multi-Modal Dataset for Characterizing Quadruped Robot Entrapments in Forest Environments

ForEnt: 用于表征四足机器人在森林环境中被困的多模态数据集

Natapat Kirdwichai, Danesh Tarapore

机构 * University of Southampton(南安普顿大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对四足机器人在森林中因植被缠绕而倾覆的问题,提出多模态数据集ForEnt,包含RGB-D、LiDAR、本体感知和第三人称视频,记录69次被困事件,支持可重复的基准测试。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19140 2026-06-18 cs.LG 新提交 78%

ChronoSurv: A Clinical Pathway-Guided Graph Framework for Multimodal Survival Analysis

ChronoSurv:一种临床路径引导的多模态生存分析图框架

Hugo Miccinilli, Theo Di Piazza

机构 * Université Paris-Saclay, CentraleSupélec, MICS, France(巴黎萨克雷大学,中央超算学院,MICS,法国) University of Lyon, INSA Lyon, CREATIS, France(里昂大学,里昂国家理工学院,CREATIS,法国)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出ChronoSurv,一种基于有向图的多模态生存分析框架,通过层次化拓扑和异质消息传递建模临床轨迹,在头颈癌数据集上取得最优判别性能与可靠校准。

Comments Accepted at MICCAI 2026. Submitted version due to embargo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15559 2026-06-16 cs.SE cs.DC cs.LG 新提交 78%

SDVDiag: Multimodal Causal Discovery for Online Diagnosis in Software-defined Vehicles

SDVDiag:软件定义车辆中用于在线诊断的多模态因果发现

Matthias Weiß, Athreya Hosahalli Prakash, Falk Dettinger, Nasser Jazdi, Michael Weyrich

机构 * University of Erlangen-Nuremberg(埃尔兰根-纽伦堡大学) Fraunhofer Institute for Software and Virtual Systems(弗劳恩霍夫软件与虚拟系统研究所)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出SDVDiag多模态因果发现管道,融合日志和指标表示构建因果图,结合异常触发实现持续在线诊断,在自动泊车测试中因果图更稀疏,根因定位准确。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14969 2026-06-16 cs.RO 新提交 78%

Multimodal Physiological Assessment of Contact-Rich Physical Human-Robot Interaction Under Varying Environmental Conditions

多变环境条件下接触丰富型物理人机交互的多模态生理评估

Yanyi Chen, Xi Wang, Min Deng

机构 * Texas Tech University(德克萨斯理工大学) Texas A&M University(德克萨斯农工大学) University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究通过多模态生理测量(EDA、sEMG、眼动追踪)和主观舒适度评估,揭示了接触丰富型物理人机交互中操作者因环境压力(温度、噪声、照度)而付出的隐藏生理代价,并发现操作者通过增加生理努力维持任务性能的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13043 2026-06-12 physics.med-ph 新提交 78%

Radiology-Report Semantic Modelling and Host-Response Laboratory Biomarkers for Multimodal Survival Prediction in Lung Cancer

放射学报告语义建模与宿主反应实验室生物标志物用于肺癌多模态生存预测

Jingxiang Shi, Yiming Wang, Zhengda Li, Yan Zhang, Weihua Meng, Yuqi Ma, Xiaoyan Li, Feng-Ming, Kong, Gen Yang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出多模态自适应风险评分(AMRS),融合放射学报告语义和常规实验室生物标志物,在574例肺癌患者中实现C-index 0.849,优于TNM分期。

Comments 14 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09789 2026-06-09 cs.CY 新提交 78%

Principled Uncertainty in Clinical AI: End-to-End Bayesian Modelling and Algorithmic Equity Auditing Across Multimodal Patient Data

临床AI中的原则性不确定性:跨多模态患者数据的端到端贝叶斯建模与算法公平审计

Oladimeji Anthonio, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi, Joseph Odamo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出端到端贝叶斯不确定性建模框架,结合校准不确定性作为公平性度量,在模拟患者数据中识别出初级/农村设施和低社会经济地位患者的认知不确定性公平差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 78%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 77%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01730 2026-08-04 cs.CV 新提交 77%

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

学习关注何处与如何判断:具备质量感知显著性的分辨率无关图像质量评估

Hakan Emre Gedik, Shashank Gupta, Alan Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出基于CLIP的多尺度补丁驱动模型ReLIQS,解决无参考图像质量评估的分辨率适配、计算效率等问题,在多类基准上泛化能力优于主流基线且成本相当或更低。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 77%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18508 2026-07-22 cs.CV 新提交 77%

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

形式高于内容:情感描述偏好评估的捷径审计

Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 研究多模态情感理解中EmoPrefer评估指标,通过内容盲探针审计发现仅用描述长度和生成器标识的逻辑回归性能与复杂模型相当,揭示当前得分可不验证描述与视频达成,建议未来评估采用源平衡配对等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交 77%

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 77%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12911 2026-07-15 cs.CV 新提交 77%

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD:通过智能分解实现基于知识的营养估计

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型用于膳食评估时检索增强基础方法是否仍有价值。提出无需训练、可本地部署的Open-KNEAD框架,通过营养感知检索关联食物项与FNDDS代码,提高份量估计,还能恢复非美国烹饪风格估计偏差,优势显著并开源相关框架与知识库。

Comments 10 pages main paper, 5 pages supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02674 2026-07-07 cs.CV 新提交 77%

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions

EmoteGPT:从自然语言描述生成3D人类面部表情

Haoran Wang, Mohit Mendiratta, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息学园区) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全中心)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究如何从文本精确控制3D面部表情,将其转化为3D可变形模型解缠参数空间中的回归问题。引入Txt2Emote数据集,提出EmoteGPT框架,经大规模数据增强训练,在表情识别等方面超越现有方法。

Comments Project page: https://genintel.github.io/EmoteGPT

详情

展开后加载摘要…

URL PDF HTML 收藏