arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2607.29124 2026-08-03 cs.CV cs.LG 新提交 57%

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。

Comments 30 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-03 cs.HC cs.AI 新提交 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28401 2026-07-31 cs.CV 新提交 57%

Large scale cross-regional remote sensing flood monitoring framework for operative mapping and impact analysis

面向操作制图与影响分析的大规模跨区域遥感洪水监测框架

Ilya Novikov, Svetlana Illarionova, Ruslan Dzharkinov, Maria Smirnova, Ayrat Abdullin, Anna Korotkova, Mariia Ulianova, Dmitrii Shadrin, Evgeny Burnaev

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Trofimuk Institute of Petroleum Geology and Geophysics SB RAS(俄罗斯科学院西伯利亚分院特罗菲穆克石油天然气地质与地球物理研究所) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学) Tyumen Industrial University(秋明工业大学) Huawei Russian Research Institute(华为俄罗斯研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出端到端多模态洪水监测框架,对比U-Net++与AnySat两种水面检测策略,结合多模态卫星数据估算洪水影响,在2019年图伦洪水监测中表现良好,为跨区域大规模洪水监测提供可行方案。

Comments 37 pages, 11 figures, 9 tables. Preprint submitted to Earth Systems and Environment. This version has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28187 2026-07-31 cs.AI cs.CR cs.SE 新提交 57%

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 57%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26848 2026-07-30 cs.CV 新提交 57%

ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

ICDAR 2026 原子层沉积/蚀刻(ALD/E)科学图信息提取竞赛

Fahad Ahmed, Sören Auer, Jennifer D'Souza

机构 * TIB - Leibniz Information Centre for Science and Technology(蒂宾根信息中心(莱布尼茨科学技术信息中心)) L3S Research Center, Leibniz University(莱布尼茨大学L3S研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究介绍了ICDAR 2026 ALD/E科学图信息提取竞赛,基于Sci-ImageMiner基准数据集开展多任务评测,发现现有多模态模型在数据提取等任务中存在局限,为领域多模态AI研究提供了平台。

Comments 17 pages, 6 figures, 8 tables, to be published in ICDAR 2026 Conference Proceedings and Volume 16975 of the Lecture Notes in Computer Science series (Springer Nature)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25565 2026-07-29 cs.CV 新提交 57%

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

ReDesign:通过智能分解从图像中恢复可编辑设计结构

Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Helmholtz Munich(慕尼黑亥姆霍兹中心) Korea University(韩国大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究旨在从图像恢复可编辑设计文件,提出ReDesign智能框架,通过跨模态选工具生成层层次结构,引入优雅验证与评估基准,在视觉保真度和编辑性上表现出色,超越基线和管道。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25392 2026-07-29 cs.CV 新提交 57%

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试

Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 介绍用于RGB-D视频显著目标检测的大规模基准测试RDVSv2,其规模大、场景多样。基于SAM2建立强大基线,采用参数高效微调策略联合编码多模态线索,该基线在RDVSv2及现有基准测试中达最优,为相关研究提供资源。

Comments Accepted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24727 2026-07-28 cs.CV 新提交 57%

Infrared Imaging Empowered by Artificial Intelligence for Pediatric Skeletal Triage: A Narrative Review and Future Perspectives

人工智能助力的儿科骨骼分类红外成像:综述与未来展望

Sajad Amiri, Pardis Afshar, Elham Anjomshoa

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 该研究旨在构建结合广谱红外成像与深度学习的混合框架用于儿科骨骼分类。回顾相关光谱窗口及采集方式,总结图像转换和特征匹配算法。指出儿科解剖利于红外穿透,集成多光谱红外+人工智能成像是无辐射补充,但面临多方面障碍。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24224 2026-07-28 cs.CV 新提交 57%

MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving

MATS:一种用于自动驾驶中3D感知的新型多模态多任务学习框架

Junchen Huo, Wanming Hao, Song Wang, Enqing Chen, Shouyi Yang, Guanghui Wang

机构 * School of Electrical and Information Engineering, Zhengzhou University(郑州大学电气与信息工程学院) Tianping College of Suzhou University of Science and Technology(苏州科技大学天平学院) Toronto Metropolitan University(多伦多都会大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对自动驾驶3D感知,提出MATS多模态多任务学习框架,通过模态自适应BEV融合和特定任务MoE模块,在nuScenes基准测试中,多模态输入下显著优于现有技术,单任务也优于基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22727 2026-07-28 cs.CV cs.LG 新提交 57%

Trustworthy Medical Segmentation: Uncertainty-Aware U-Net Evaluation Under Clinical Image Degradation

可信医学分割:临床图像退化下的不确定性感知U-Net评估

Pranav Kaliaperumal, Manisha Kaliaperumal

机构 * University of Colorado Denver(科罗拉多大学丹佛分校) Creighton University(克里顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究在临床图像退化下评估医学分割模型的不确定性,提出可重现框架,用合成脑肿瘤MRI队列训练U-Net等模型,经多种损坏类型及不同严重程度测试,结果表明不确定性感知推理可作安全层,还开源相关代码、模型和协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22703 2026-07-28 cs.CV 新提交 57%

Histopathological Spectrum-Guided Prostate Stratification via Segmentation-Assisted Diagnostic Transformer

基于分割辅助诊断变压器的组织病理学光谱引导前列腺分层

Leyang Li, Lihua Chen, Huangang Hu, Tianhang Hao, Hao Cheng, Xin Zhang, Qianru Sun, Bingxu Lu, Wenlong Yu, Feng Duan

机构 * College of Artificial Intelligence, Nankai University(南开大学人工智能学院) Tianjin First Central Hospital(天津市第一中心医院) School of Electronics and Information Engineering, Tiangong University(天津工业大学电子与信息工程学院) School of Artificial Intelligence, Hebei University of Technology(河北工业大学人工智能学院) North China Digital Health Technology Co., Ltd.(华北数字健康科技有限公司) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对多参数MRI前列腺癌诊断局限,构建数据集并提出LSDT模型,利用零样本分割和多模态融合分类,在患者队列交叉验证中取得较好准确率和召回率,增强了前列腺MRI细粒度分类及风险分层。

Comments 17 pages, 6 figures, and 4 tables. Code will be made publicly available in a future revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 57%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21964 2026-07-27 cs.RO cs.AI 新提交 57%

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21611 2026-07-27 cs.HC cs.AI 新提交 57%

A Systematic Survey on Image Description Techniques for STEM Domains

关于STEM领域图像描述技术的系统综述

Marco Cardia, Letizia Angileri, Marina Buzzi, Giulio Galesi, Barbara Leporini

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 综述20项关于AI描述STEM视觉的研究,关注可及性和人机交互。分析目标视觉类型等多方面内容,指出从静态转向交互式多模态系统,同时存在事实不准确等挑战,最后概述人机交互关键研究方向。

Comments This is the Author's Original Manuscript of an article accepted for publication in International Journal of Human-Computer Interaction, published by Taylor and Francis. The Version of Record is available at DOI 10.1080/10447318.2026.2668031

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21570 2026-07-24 cs.CL cs.HC 新提交 57%

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

MedGame:由大语言模型赋能的用于医学教育的故事化游戏化

Qian Wu, Xinrong Zhou, Zizhan Ma, Kai Chen, Zheyao Gao, Xun Lin, Hongqiu Wu, Longfei Gou, Yixiao Liu, Ann Sin Nga Lau, Qi Dou

机构 * CUHK(香港中文大学) Southern Medical University(南方医科大学) Peking University(北京大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究旨在利用大语言模型助力医学教育,提出MedGame框架,通过双引擎设计将临床病例转化为故事化游戏,构建MedGame Bench进行评估,实验显示特定任务微调提升开源模型表现,学生研究表明其更具吸引力和实用性。

Comments Work in Progress; an explorational design and study on AI+Education+Game

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21424 2026-07-24 cs.CL cs.SD 新提交 57%

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

一种通过受控扰动验证的结构化音频字幕评估框架

Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。

Comments submitted to DCASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20790 2026-07-24 cs.CV 新提交 57%

Ocular Verification for Virtual Reality

虚拟现实中的眼部验证

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

机构 * University of Wyoming(怀俄明大学) San Diego State University(圣地亚哥州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究虚拟现实中眼部验证,评估虹膜质量指标局限性,用生成模型应对数据挑战,进行单模态与多模态识别及融合,发现部分指标在VR数据上失效,图像调整利于眼周识别,多模态融合降低错误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20462 2026-07-24 cs.AI 新提交 57%

Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

标记错误症状:评估医学文本中的大语言模型水印

Melanie Rieff, Robin Staab, Thibaud Gloaguen, Stefan Hegselmann, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林健康研究所) Deutsches Herzzentrum der Charité – Medical Heart Center of Charité and German Heart Institute Berlin(柏林夏里特医学院德国心脏中心与柏林德国心脏研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究LLM水印对医学性能的影响,在11个LLM和7个VLM上对5种水印方案进行多任务基准测试,引入人类专家验证管道补充评估,发现水印会致多种退化,特定领域评估是医学中水印模型安全部署的前提。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 57%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19772 2026-07-23 cs.CV 新提交 57%

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

DRGBT-1K:用于动态RGBT跟踪的大规模高质量基准测试

Zhaodong Ding, Chenglong Li, Zeyu Ding, Futian Wang, Jin Tang

机构 * Anhui University(安徽大学) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电子信息采集与保护技术国家重点实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有基准无法有效评估动态RGBT跟踪器在真实场景下鲁棒性的问题,构建DRGBT-1K基准测试,提供全面注释,评估多种跟踪方法,发布未对齐版本及衍生数据集,并开发在线评估平台,为相关研究提供有力支持。

Comments Submitted to TIP (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19726 2026-07-23 cs.CV 新提交 57%

An Exploratory Analysis of Pain Localization via Explainable Computational Modeling

通过可解释计算建模对疼痛定位进行探索性分析

Ioannis Kyprakis, Stefanos Gkikas, Eric Nichols, Yu Fang, Manolis Tsiknakis

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对自动疼痛定位问题,利用AI4Pain 2026挑战数据集,比较经典特征工程与深度序列学习用于独立于受试者的三类疼痛定位,极端随机树表现最佳,发现疼痛检测与定位存在差距,揭示外周自主神经通路解剖扩散性的基本上限。

Comments Accepted at the 14th International Conference on Affective Computing and Intelligent Interaction (ACII 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19153 2026-07-22 cs.LG cs.AI 新提交 57%

Breaking the Homogeneity Assumption: Specialized Multi-Generator Adversarial Learning for Rare Failure Detection in Predictive Maintenance

打破同质性假设:用于预测性维护中罕见故障检测的专门多生成器对抗学习

Alexis Lazanas, Georgios Kampouropoulos

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究预测性维护中罕见故障检测,提出故障类型感知生成增强程序,采用专门多生成器GAN架构,通过防泄漏实验设计比较多种不平衡处理方法,实验表明该框架能产生更真实少数样本,提升PR-AUC和召回分数。

Journal ref International Journal of Computer Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18887 2026-07-22 cs.AI 新提交 57%

NaviAIS: A Scenario-Level Vessel Trajectory Prediction Dataset withVectorized Lane Priors and the NaviLane Forecasting Framework

NaviAIS:一个具有矢量化航道先验的场景级船舶轨迹预测数据集及NaviLane预测框架

Yuan Gui, Hongchen Luo, Liqi Qu, Longyue Fu, Jiao Wang

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对复杂海洋环境下船舶轨迹预测问题,引入NaviAIS数据集并提出NaviLane框架,通过轨迹-地图联合编码、离散宏动作码本及模块优化评估等方法,提升船舶轨迹预测性能,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18828 2026-07-22 cs.AI 新提交 57%

Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety

在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性

Koyar Afrasyab

机构 * Kinvectum AB(金维图姆公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。

Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16323 2026-07-21 eess.SP cs.CV cs.LG eess.IV 新提交 57%

ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning

心电图大语言模型:基于心电图的心脏推理基础模型

Alexander Selivanov, Friederike Jungmann, Jan Kehrer, Karl-Ludwig Laugwitz, Eimo Martens, Daniel Rueckert

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对一线分诊缺乏确定性成像及现有心电图人工智能系统局限的问题,提出ECG-LLM模型,用多模态到语言监督策略训练,能从心电图回答多样心血管问题,恢复测量值、预测表型,在相关任务中表现良好,为临床推理提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 57%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 57%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16330 2026-07-21 cs.CV 新提交 57%

Local Brushstroke Quality Assessment via Vision-Language Feedback

通过视觉-语言反馈进行局部笔触质量评估

Mio Mitamura, Hirokatsu Kataoka

机构 * Tokyo Institute of Science High School(东京理科大学附属高中) National Institute of Advanced Industrial Science and Technology (AIST)(国立先进工业科学技术研究所) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究多模态语言模型能否评估书法局部笔触质量并生成反馈,构建评估框架让三个模型评估图像对并与专家打分比较,还研究了RAG变体,结果显示模型有一定绝对分数准确性,但与专家排名相关性不强,RAG有正负两方面表现。

Comments 6 pages, 8 figures. Accepted to the SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16222 2026-07-21 cs.LG cs.AI eess.SP 新提交 57%

Fully-sensorized smart-eyewear platform for on-device Machine Learning

用于设备端机器学习的全传感器智能眼镜平台

Andrea Giudici, Christian Veronesi, Pietro Bartoli, Mario Caliò, Aurelio Teliti, Giacomo Gervasoni, Diana Trojaniello, Franco Zappa

机构 * EssilorLuxottica(依视路陆逊梯卡集团) Politecnico di Milano(米兰理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 介绍ARGO智能眼镜平台,通过硬件、固件和人工智能整体协同设计,利用STM32N6微控制器及集成神经处理单元实现设备端机器学习,以优化的YOLOv11模型识别障碍物,展示了高性能、隐私保护辅助设备可行性。

Comments This work was carried out in the EssilorLuxottica "Smart Eyewear Lab", a Joint Research Center between EssilorLuxottica and Politecnico di Milano

详情

展开后加载摘要…

URL PDF HTML 收藏