arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 318 篇

2608.03508 2026-08-14 cs.CV 版本更新 57%

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muzammal Naseer, Sajid Javed

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03799 2026-08-14 cs.CL 版本更新 57%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02892 2026-08-12 cs.CV 版本更新 57%

Modeling Scientific Experiment Scenes: Dataset and Model

科学实验场景建模:数据集与模型

Minghao Zou, Qingtian Zeng, Shangkun Liu, Cong Liu, Paul L. Rosin, Guanghui Yue, Jun Liu, Wei Zhou

机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ABC FINTECH Company Limited(ABC金融科技有限公司) NOVA Information Management School, Universidade Nova de Lisboa(里斯本新大学NOVA信息管理学院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有SGG基准忽略科学实验场景的问题,构建首个物理实验场景SGG数据集PhysScene,并提出跨模态双路径生成器CM-DPG,在PhysScene和VG150上取得具竞争力的SGG性能。

Comments The authors have identified issues that require substantial revision and have therefore decided to withdraw the current version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 57%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09942 2026-08-12 cs.SE cs.AI 版本更新 57%

Anomaly Detection and Root Cause Analysis for Microservice Systems

微服务系统的异常检测与根因分析

Luan Pham

机构 * Viet Nam National University Ho Chi Minh City - University of Technology (HCMUT)(越南国家大学胡志明城-技术大学(HCMUT)) School of Computing Technologies(计算技术学院) College of Science, Technology, Engineering and Maths(科学、技术、工程和数学学院) Royal Melbourne Institute of Technology (RMIT University)(皇家墨尔本理工学院(RMIT大学))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对微服务系统异常检测与根因分析的五大局限性,提出端到端方法BARO、EventADL和TORAI,并构建基准RCAEval,通过实验验证有效性与鲁棒性。

Comments This is the pre-print of my PhD thesis, submitted to RMIT University

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13319 2026-08-12 cs.AI cs.HC 版本更新 57%

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26574 2026-08-11 cs.CR cs.AI cs.LG 版本更新 57%

Attack Ensembles Expose a Safety-Utility Trade-off in Black-Box Guard Defenses Against Encoded VLM Jailbreaks

恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术

Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Yi Feng, Xiao Luo, Zijian Xiao, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12602 2026-08-11 cs.CV 版本更新 57%

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT

解耦与推理:3D胸部CT中自由文本发现的解剖学引导两阶段体素级定位

Kwang-Hyun Uhm, Inhwa Son, Sung-Jea Ko

机构 * Department of Artificial Intelligence, Gachon University(韩国加图立大学人工智能系) MEDAI

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 研究3D胸部CT中自由文本发现的体素级定位难题,提出解耦框架,分病变分割和文本-体积推理两阶段,利用解剖学引导解决空间模糊性,在基准测试中取得领先,证明解耦是处理该复杂性的有效范式。

Comments Accepted to MICCAI 2026 (Spotlight Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14633 2026-08-11 cs.CV 版本更新 57%

VIGIL: Tackling Hallucination Detection in Image Recontextualization

VIGIL:应对图像再上下文化中的幻觉检测

Joanna Wojciechowicz, Maria Łubniewska, Jakub Antczak, Justyna Baczyńska, Wojciech Gromski, Wojciech Kozłowski, Maciej Zieba

机构 * Wroclaw University of Science and Technology(沃拉茨拉夫大学科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 VIGIL通过细粒度分类填补多模态模型图像再上下文化中幻觉检测的空白,提出多阶段检测流程并公开资源促进透明度。

Comments 19 pages, 8 figures, 7 tables. Code and data are available at: https://github.com/mlubneuskaya/vigil and https://huggingface.co/datasets/joannaww/VIGIL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 57%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05825 2026-08-10 cs.CL 版本更新 57%

MoCA: Implicit Social Context Analysis

MoCA:隐式社会语境分析

Wenhao Xu, Kaiwen Zhang, Hao Li, Maowei You, Yongzheng Ji, Siyuan Zuo, Jingxuan Yu, Sina A, Xinyao Tan, Bobo Li, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 57%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28247 2026-08-07 cs.CV 版本更新 57%

Space2Ground 2.0: A Multi-Source Dataset and Framework for Agricultural Monitoring through Fusion of Street-Level and Satellite Imagery

Space2Ground 2.0:结合街景与卫星影像的农业监测多源数据集及框架

Iason Tsardanidis, Alkiviadis Koukos, George Choumos, Vasileios Sitokonstantinou, Charalampos Kontoes

机构 * Operational Unit BEYOND Centre, IAASARS, National Observatory of Athens(雅典国家天文台IAASARS研究所BEYOND中心业务单元) DHI Water & Environment(DHI水环境公司) Artificial Intelligence Group, Wageningen University & Research(瓦赫宁根大学及研究中心人工智能组)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出Space2Ground 2.0多源框架,整合卫星与街景影像构建农业监测基准数据集,实验证实街景影像可提升作物分类效果,为多模态农业监测提供了可复现方法。

Comments This paper has been accepted for presentation at the 45th EARSeL Symposium, Athens, Greece. The Space2Ground 2.0 dataset, is publicly available through Zenodo at: https://doi.org/10.5281/zenodo.21219542

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10217 2026-08-07 cs.CV 版本更新 57%

Are Pretrained Image Matchers Good Enough for SAR-Optical Satellite Registration?

预训练图像匹配器在SAR-光学卫星配准中表现如何?

Isaac Corley, Alex Stoken, Gabriele Berton

机构 * Taylor Geospatial(泰勒地理空间公司) Independent Researcher(独立研究者)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文评估了24种预训练匹配器在跨模态卫星配准中的表现,发现显式跨模态训练并非必然提升性能,且部署协议对精度影响显著。

Comments CVPR 2026 Image Matching Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05416 2026-08-07 cs.MM 版本更新 57%

Meaning over Motion: A Semantic-First Approach to 360° Viewport Prediction

基于意义而非运动:一种以语义为先的360度视口预测方法

Arman Nik Khah, Arvin Bahreini, Ravi Prakash

专题命中 多模态评测 :multi-modal(abstract);分类 cs.MM

AI总结 本文提出了一种基于语义的360度视口预测方法,通过整合认知意图和关联前瞻机制,有效缓解了眼跳陷阱问题,提升了视频流媒体的效率和用户体验。

Comments Following an internal verification, the authors identified an inconsistency in the experimental data pipeline that requires the reported results to be recomputed. We are withdrawing this version while we re-run the analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 57%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19322 2026-08-06 cs.CL 版本更新 57%

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

用于评估开放式生成的两级元评分标准:GAMUT,事实完整性基准

Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究如何评估开放式生成内容的事实完整性,提出两级元评分标准框架并实例化为Gamut基准,构建基于真实图像的问题及评分标准,评估多个模型,发现其具挑战性、区分性且对法官选择鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18774 2026-08-06 cs.CV 版本更新 57%

SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for Unpaired RGB+Thermal 3D Reconstruction

SEAR: 一种简单且高效的视觉几何变换器在RGB+热成像3D重建中的适应

Vsevolod Skorokhodov, Chenghao Xu, Shuo Sun, Olga Fink, Malcolm Mielle

机构 * Schindler EPFL Lab(施耐德EPFL实验室) EPFL(瑞士联邦理工学院) Örebro University(奥雷布罗大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SEAR通过简单高效的微调策略,使预训练的几何变换器适应多模态RGB-热成像输入,显著提升了3D重建和姿态估计性能,尤其在低光照和浓烟等挑战条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01737 2026-08-05 cs.CV 版本更新 57%

IDraw: Artist Verification from Digital Drawing Images

IDraw:基于数字绘画图像的艺术家身份验证

Nayoung Kim, Nan Jiang, Bangjie Sun, Jaewon Shin, Sojeong Kim, Jun Han

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对数字绘画作者身份验证的挑战,提出IDraw框架,构建首个多模态数据集,可从完整图像推断绘画行为、抑制内容干扰,在9种主干网络下将验证误差最多降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23258 2026-08-05 cs.AI cs.LG 版本更新 57%

CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics

CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移

Xinhong Xu, Yimeng Zhang, Yuanlong Zhang

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 57%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05238 2026-08-04 cs.AI 版本更新 57%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 57%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 57%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18529 2026-08-03 cs.HC cs.AI 版本更新 57%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00448 2026-07-31 cs.CV eess.IV 版本更新 57%

Learning from Compressed CT: Feature Attention Style Transfer and Structured Factorized Projections for Resource-Efficient Medical Image Analysis

从压缩CT学习:用于资源高效医学图像分析的特征注意力风格迁移和结构化因子化投影

Shadid Yousuf, S. M. Mahbubur Rahman, Mohammed Imamul Hassan Bhuiyan

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气电子工程系,孟加拉工程与技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FAST和SFP方法,通过压缩CT体积进行胸腔异常检测,实现低资源部署和高效数据传输,实验表明CT-Lite在压缩输入下达到接近未压缩基线的AUROC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21809 2026-07-30 cs.CV 版本更新 57%

Clinical Graph-Mediated Distillation for Unpaired MRI-to-CFI Hypertension Prediction

临床图介导的非配MRI到CFI高血压预测

Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Research Convergence Institute(研究融合院) Department of AI Systems Engineering(人工智能系统工程系) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CGMD框架,通过构建临床相似性kNN图将MRI中的高血压知识迁移至视网膜模型,提升非配MRI-视网膜数据下的高血压预测性能。

Comments 10 pages, 2 figures, 2 tables. Under review at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新 57%

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏