arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 148 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 18 篇

2603.20336 2026-03-24 cs.IR cs.AI cs.DB 57%

GEM: A Native Graph-based Index for Multi-Vector Retrieval

GEM:一种基于图的多向量检索索引

Yao Tian, Zhoujin Tian, Xi Zhao, Ruiyuan Zhang, Xiaofang Zhou

机构 * The Hong Kong University of \ Hong Kong Generative AI Research \& Development Center Hong Kong China The Hong Kong University of Science Hong Kong Generative AI Research \& Development Center

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 GEM提出一种针对多向量表示的原生索引框架,通过构建向量集的接近图,保留细粒度语义并实现高效导航,提升检索效率和准确性。

Comments This paper has been accepted by SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 14 篇

2504.14145 2026-03-24 cs.DC cs.AI 79%

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20781 2026-03-24 cs.CL 79%

Code-MIE: A Code-style Model for Multimodal Information Extraction with Scene Graph and Entity Attribute Knowledge Enhancement

Code-MIE: 一种基于代码风格的多模态信息提取模型,结合场景图和实体属性知识增强

Jiang Liu, Ge Qiu, Hao Fei, Dongdong Xie, Jinbo Li, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部与可信计算重点实验室,教育部,武汉大学计算机科学与工程学院) University of Oxford(牛津大学) Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) China United Network Communications Co., Ltd. Research Institute(中国联合网络通信有限公司研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Code-MIE框架,通过统一代码理解和生成解决多模态信息提取问题,引入实体属性、场景图和文本参数,提升结构化信息提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12015 2026-03-24 cs.GR 78%

M^3ashy: Multi-Modal Material Synthesis via Hyperdiffusion

M^3ashy:基于超扩散的多模态材料合成

Chenliang Zhou, Zheyuan Hu, Alejandro Sztrajman, Yancheng Cai, Yaru Liu, Cengiz Oztireli

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出M^3ashy框架,通过超扩散和神经场实现复杂真实材料的高质量重建,支持多种条件下的材料合成,并贡献了新的材料数据集和BRDF评估指标。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 62%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04317 2026-03-24 cs.CV cs.CL 62%

WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AI

WiFi-GEN:利用生成式人工智能进行高分辨率室内成像

Jianyang Shi, Bowen Zhang, Amartansh Dubey, Ross Murch, Liwen Jing

机构 * Pengcheng Laboratory(鹏城实验室) College of Big Data and Internet(大数据与互联网学院) Shenzhen Technology University(深圳技术大学) Department of Electrical Engineering(电子工程系) Indian Institute of Technology Delhi(印度理工学院德里分校) Department of Electronic and Computer Engineering(电子与计算机工程系) HKUST(香港科技大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出WiFi-GEN,通过生成式人工智能将测量到的WiFi功率转换为高分辨率室内图像,其形状重建精度比物理模型方法高275%,且Frechet Inception Distance得分降低82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22027 2026-03-24 cs.CV 57%

Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models

在推理过程中调整现实世界图像恢复:一种适用于流匹配模型的测试时间缩放范式

Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, China Kuaishou Tech, China

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ResFlow-Tuner框架,基于FLUX.1-dev模型,结合多模态融合与测试时间缩放,实现高质量图像恢复。通过奖励模型动态调整去噪方向,提升性能并控制计算开销,实验表明其在多个基准上达到最优。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 57%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21295 2026-03-24 cs.CV 57%

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV 57%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13733 2026-03-24 cs.RO cs.AI cs.LG 57%

Implicit Maximum Likelihood Estimation for Real-time Generative Model Predictive Control

隐式最大似然估计用于实时生成模型预测控制

Grayson Lee, Minh Bui, Shuzi Zhou, Yankai Li, Mo Chen, Ke Li

机构 * School of Computing Science, Simon Fraser University(计算科学系,西蒙弗雷泽大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出隐式最大似然估计(IMLE)作为生成模型的替代方法,实现快速推理和强模式覆盖,适用于实时MPC任务。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22160 2026-03-24 stat.AP cs.LG 50%

Data Curation for Machine Learning Interatomic Potentials by Determinantal Point Processes

通过确定性点过程数据筛选机器学习互原子势

Joanna Zou, Youssef Marzouk

机构 * Computational Science & Engineering Massachusetts Institute of Technology(计算科学与工程 马萨诸塞理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出利用确定性点过程筛选原子构型子集,以生成高质量训练集,提升分子系统机器学习表示的准确性与鲁棒性。

Comments Original publication at https://openreview.net/forum?id=PKGP7tg65A

Journal ref ICLR AI4MAT Workshop (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21481 2026-03-24 cs.IR 50%

TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation

TagLLM: 一种用于笔记推荐的细粒度标签生成方法

Zhijian Chen, Likai Wang, Lei Chen, Yaguang Dou, Jialiang Shi, Tian Qi, Dongdong Hao, Mengying Lu, Cheng Ye, Chao Wei

专题命中 多模态生成 :multimodal(abstract)

AI总结 TagLLM通过用户兴趣手册和多模态CoT提取构建细粒度标签数据,采用标签知识蒸馏提升小模型生成能力,有效提升笔记推荐的点击率和用户停留时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01192 2026-03-24 cs.RO 50%

Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation

统一的生成-细化规划:连接引导流匹配与基于模型的预测控制以实现社交导航

Kazuki Mizuta, Karen Leung

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种结合奖励引导条件流匹配与模型预测路径积分的统一生成-细化框架,以提升社交导航中安全、任务性能和计算时间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 50%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 20 篇

2512.05959 2026-03-24 cs.CL cs.AI cs.CV 82%

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

M4-RAG:大规模多语言多文化多模态检索增强生成

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata

机构 * Stanford University(斯坦福大学) MBZUAI Indian Institute of Science(印度科学研究院) Ontario Tech University(安大略技术大学) University of Toronto(多伦多大学) Capital One

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 M4-RAG提出一个覆盖42种语言、56种方言和189个国家的多模态大规模基准,通过构建8万多个文化多样化的图像-问题对,评估跨语言和模态的检索增强视觉问答性能,揭示模型大小与检索效果的不匹配问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV 79%

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21245 2026-03-24 cs.CV 79%

CornOrb: A Multimodal Dataset of Orbscan Corneal Topography and Clinical Annotations for Keratoconus Detection

CornOrb:用于角膜变性检测的多模态数据集

Mohammed El Amine Lazouni, Leila Ryma Lazouni, Zineb Aziza Elaouaber, Mohammed Ammar, Sofiane Zehar, Mohammed Youcef Bouayad Agha, Ahmed Lazouni, Amel Feroui, Ali H. Al-Timemy, Siamak Yousefi, Mostafa El Habib Daho

机构 * Biomedical Engineering Laboratory(生物医学工程实验室) Abou Bakr Belkaid University(阿布·巴克·贝卡伊大学) LIST Laboratory(LIST实验室) M’Hamed Bougara Boumerdes University(穆哈梅德·布加拉 Boumerdes 大学) Lazouni Clinic(拉祖尼诊所) University of Western Brittany LaTIM UMR1101(西 Brittany 大学 LaTIM UMR1101) Inserm Brest(里尔 Brest 研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 CornOrb数据集包含744名患者1454只眼的多模态数据,包括889只正常眼和565例角膜变性病例,提供四类角膜图谱及结构化表格数据,用于支持AI驱动的角膜变性检测与分析。

Comments Preprint, 9 pages, 4 figures, dataset paper. Corresponding author: mostafa.elhabibdaho@univ-brest.fr

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 79%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20442 2026-03-24 cs.LG cs.AI 79%

Detecting Neurovascular Instability from Multimodal Physiological Signals Using Wearable-Compatible Edge AI: A Responsible Computational Framework

通过可穿戴设备的边缘AI检测神经血管不稳定性:一种负责任的计算框架

Truong Quynh Hoa, Hoang Dinh Cuong, Truong Xuan Khanh

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix LLC) Department of Cardiology, Hanoi Heart Hospital(心血管科,河内心脏医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Melaguard框架,通过融合多种生理信号检测神经血管不稳定性,优于单一模态设备,通过三阶段验证提升检测性能。

Comments 11 pages, 8 figures, 6 tables. Submitted to IEEE JBHI. Code: https://github.com/ClevixLab/Melaguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16753 2026-03-24 cs.CL 79%

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo:一个用于评估多样化和多模态生成式人工智能输出的部署和可扩展框架

Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 GAICo提供统一框架,支持多种参考指标,用于评估生成式AI输出,提升评估标准化和可复现性,加速AI系统开发。

Comments 11 pages, 7 figures; accepted at IAAI/AAAI 2026; (updated) extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21092 2026-03-24 cs.NI 78%

Generative Artificial Intelligence Assisted Multi-modal Semantic Extraction for NOMA-based Image Transmissions

生成式人工智能辅助的多模态语义提取用于基于NOMA的图像传输

Songhan Zhao, Shimin Gong, Bo Gu, Hongyang Du, Xidong Mu, Zehui Xiong, Yuming Fang

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract)

AI总结 本文提出利用生成式人工智能辅助的多模态语义提取方法,结合NOMA技术优化图像传输,通过联合优化语义特征选择和传输控制提升恢复性能与传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02763 2026-03-24 cs.CV 77%

ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

ClearAIR: 一种受人类视觉感知启发的全能图像修复框架

Xu Zhang, Huan Zhang, Guoli Wang, Qian Zhang, Lefei Zhang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ClearAIR,受人类视觉感知启发,采用分层粗到细的修复策略,通过多模态大语言模型进行整体评估,并引入区域意识和任务识别流程,提升图像修复精度与细节恢复能力。

Comments Accepted to AAAI 2026. Project page: https://github.com/House-yuyu/ClearAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20536 2026-03-24 cs.LG 71%

Towards Practical Multimodal Hospital Outbreak Detection

迈向实用的多模态医院暴发检测

Chang Liu, Jieshi Chen, Alexander J. Sundermann, Kathleen Shutt, Marissa P. Griffith, Lora Lee Pless, Lee H. Harrison, Artur W. Dubrawski

机构 * Auton Lab, Carnegie Mellon University(自主实验室,卡内基梅隆大学) Microbial Genomic Epidemiology Laboratory, Center for Genomic Epidemiology, University of Pittsburgh(微生物基因组流行病学实验室,流行病学研究中心,匹兹堡大学) Division of Infectious Diseases, University of Pittsburgh School of Medicine(传染病科,匹兹堡大学医学院) Department of Epidemiology, School of Public Health, University of Pittsburgh(流行病学系,公共卫生学院,匹兹堡大学)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出利用多模态数据提升医院暴发检测效率,通过机器学习整合质谱、抗菌谱和电子病历数据,提高检测性能并减少全基因组测序依赖。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV 70%

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17495 2026-03-24 cs.CV 57%

GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

GroundingME:通过多维评估揭示MLLMs中的视觉 grounding 隙

Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GroundingME基准,通过四个维度评估MLLMs的视觉 grounding 能力,揭示其在区分相似物体、理解空间关系、处理遮挡和拒绝无解查询方面的不足,发现最佳模型仅达到45.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL 57%

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20669 2026-03-24 cs.RO cs.CV 57%

ToFormer: Towards Large-scale Scenario Depth Completion for Lightweight ToF Camera

ToFormer:面向大规模场景深度补全的轻量级ToF相机

Juncheng Chen, Tiancheng Lai, Xingpeng Wang, Bingxin Liao, Baozhe Zhang, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17508 2026-03-24 cs.CV 57%

Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation

Omni-I2C:一个全面的图像到代码生成基准测试

Jiawei Zhou, Chi Zhang, Xiang Feng, Qiming Zhang, Haibo Qiu, Lihuo He, Dengpan Ye, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researcher(独立研究者) Xidian University(西安电子科技大学) Guangzhou University(广州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-I2C基准测试,评估大多模态模型将复杂数字图形转化为可执行代码的能力,揭示当前模型在视觉感知与生成表达方面的协同挑战及性能差距。

Comments 35 pages, 26 figures, change authors' information in page 1

详情

展开后加载摘要…

URL PDF HTML 收藏