arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-26 至 2026-05-26 共收录 28 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 28 篇

2510.22827 2026-05-26 cs.CV cs.LG 85%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25334 2026-05-26 cs.CV 83%

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

双路径几何感知多模态大语言模型用于空间智能

Yufei Zheng, Xuhan Zhu, Zide Liu, Chunpeng Zhou, Chenfeng Wang, Yongchao Xu, Yunnan Wang, Jiawei Liu, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出GAMSI,一种仅以RGB图像为输入、通过双路径查询和专家引导视觉对齐实现3D结构与度量尺度联合感知的多模态大语言模型,在七个空间智能基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 79%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24652 2026-05-26 cs.AI cs.CV cs.MM cs.SD 75%

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

AVBench:面向音视频生成模型的人类对齐与自动化评估基准

Jialiang Yang, Bin Xia, Ruihang Chu, Dingdong Wang, Wanke Xia, Zhun Mou, Tianyang Zhong, Yiting Zhao, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出AVBench,通过细粒度人类中心指标和偏好学习训练的专业评估器,实现音视频生成的自动化、准确评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24702 2026-05-26 cs.CV 74%

Do Image-Text Metrics Respect Semantic Invariances?

图像-文本度量是否尊重语义不变性?

Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe, Michael Avendi, Yassi Abbasi, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 多模态评测 :image-text(title);分类 cs.CV

AI总结 通过空间、物体和社会语言框架三个维度的语义保持扰动,系统评估了五种流行图像-文本评估器(CLIPScore、PAC-S、UMIC、FLEUR和确定性LLM评判)的语义不变性,发现它们对非语义变化敏感,并提出了不变性校准评分作为后处理调整方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12961 2026-05-26 cs.CV cs.LG 70%

Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering

减少偏差与方差:用于图像聚类的生成语义引导与双层集成

Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du

机构 * Institute of Big Data Science and Industry(大数据科学与产业研究院) Key Laboratory of Evolutionary Science Intelligence of Shanxi Province(山西省进化智能科学重点实验室) School of Artificial Intelligence, Shanxi University(山西大学人工智能学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GSEC框架,通过生成语义引导减少偏差、双层集成学习降低方差,在六个基准数据集上超越18种最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25784 2026-05-26 cs.CV cs.MM 62%

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes

VertiCue-Bench: 诊断多模态大语言模型是否利用高度线索解决遥感自然场景中的二维歧义

Jing Huang, Duanchu Wang, Junjie Yang, Zihang Cheng, Cheng Li, Lin Cui, Zhouyi Wu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出VertiCue-Bench基准,通过17个任务1534个实例诊断MLLMs是否真正利用冠层高度模型(CHM)的垂直线索解决遥感自然场景中的语义歧义,发现模型在感知高度线索与语义推理之间存在显著脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00553 2026-05-26 cs.CV cs.AI 62%

A Comprehensive Dataset for Human vs. AI Generated Image Detection

人类与AI生成图像检测的综合数据集

Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Gaytri Jena, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * 1 Kalyani Government Engineering College, India. 2 IIIT Delhi, India. 3 BITS Pilani Hyderabad Campus, India. 4 University of South Carolina, USA. 5 IIIT Guwahati, India. 6 NIT Silchar, India. 7 San Jos\' e State University, USA. 8 UCLA, USA. 9 Washington State University, USA. 10 Vishwakarma Institute of Information Technology, India. 11 Gandhi Institute for Technological Advancement, India. 12 Meta AI, USA. 13 Amazon AI, USA. 14 BITS Pilani Goa, India.

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对AI生成图像检测问题,构建了包含96000个真实与合成数据点的MS COCOAI数据集,并提出了图像真伪分类与生成模型识别两个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20278 2026-05-26 cs.LG cs.AI cs.CV 62%

ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

ClaimDiff-RL: 通过视觉声明比较进行细粒度描述强化学习

Tianle Li, Xuyang Shen, Yan Ma, Rongxin Guo, Shaoxiang Chen, Jiacheng Chen, Haochen Wang, Hongyang Tang, Yucong Zhou, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) MiniMax

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ClaimDiff-RL框架,利用原子声明差异作为奖励单元,通过多模态判断器枚举视觉差异并分配错误类型和严重程度,以解决长描述强化学习中事实性与覆盖度的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24503 2026-05-26 cs.CV cs.AI 62%

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

FoodMonitor:用于可解释合规性分析的多模态大语言模型基准测试

Ruihao Xu, Xingming Shui, Jingxuan Niu, Yiqin Wang, Jilin Yu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有视频异常检测缺乏规则驱动可解释性的问题,提出FoodMonitor基准,包含双通道违规标注和两阶段匹配评估协议,揭示当前多模态大语言模型在空间定位和细粒度规则理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL 62%

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25968 2026-05-26 cs.CV 57%

Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data

基于上下文驱动的缺失模态学习用于图像-表格数据的鲁棒医学诊断

Tianling Liu, Lequan Yu, Tong Han, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University, Tianjin 300350, China.(智能与计算学院,天津大学,天津300350,中国) Department of Statistics and Actuarial Science, School of Computing and Data Science, The University of Hong Kong, Hong Kong.(统计与精算系,计算与数据科学学院,香港大学,香港) Department of Radiology, Tianjin Huanhu Hospital, Tianjin 300350, China.(放射科,天津华和医院,天津300350,中国) Tianjin Key Laboratory of Cerebral Vascular and Neurodegenerative Diseases, Tianjin 300350, China.(天津脑血管与神经退行性疾病重点实验室,天津300350,中国) Medical School of Tianjin University, Tianjin 300072, China.(天津大学医学院,天津300072,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出CMML框架,通过级联残差变换器自编码器合成缺失模态并利用上下文令牌进行语义对齐,在三种医学数据集上超越现有方法。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25874 2026-05-26 cs.CV 57%

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

WBench:面向交互式视频世界模型评估的综合多轮基准

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

机构 * Fudan University(复旦大学) Meituan Longcat Team(美团Longcat团队)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出WBench,一个包含五个维度、289个测试用例和1058轮交互的综合多轮基准,用于系统评估交互式世界模型,并发现现有模型在不同维度上表现不一。

Comments Technical report of WBench. Homepage: https://meituan-longcat.github.io/WBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25781 2026-05-26 cs.CL 57%

Double Triangle Annotation: A Scalable Human-in-the-Loop Framework for High-Precision Historical Document Annotation

双三角形标注:一种可扩展的人机协同高精度历史文档标注框架

Yi Ren

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出双三角形标注框架,通过两层人机协同和跨模型共识自动完成大部分标注工作,实现高精度历史文档结构化信息提取。

Comments 12 pages, 4 figures. ACL ARR 2026 March submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25595 2026-05-26 cs.CV 57%

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark

AI在肝纤维化分期中取得了多大进展?大规模真实世界数据集与基准

Yuanye Liu, Nannan Shi, Zhejia Zhang, Hanxiao Zhang, Boya Wang, Derong Yu, Nao Wang, Yuxin Jin, Yang Zhou, Kunhao Yuan, Siqi Wang, Lida Yang, Xu Qiao, Wentao Liu, Xuelei He, Xin Hong, Guoyan Zheng, Xin Chen, Guang-Zhong Yang, Le Zhang, Lei Li, Yuxin Shi, Xiahai Zhuang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院) Department of Radiology, Shanghai Public Health Clinical Center, Fudan University, Shanghai, China(复旦大学上海公共卫生临床中心放射科) Department of Electrical and Computer Engineering, Northwestern University, Evanston, USA(西北大学电气与计算机工程系) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院) School of Computer Science, University of Nottingham, Nottingham, UK(诺丁汉大学计算机科学学院) Institute of Medical Robotics, School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院医疗机器人研究所) College of Computer Science and Technology, Huaqiao University, Xiamen, China(华侨大学计算机科学与技术学院) School of Electronic Information (School of Artificial Intelligence), Northwest University, Xi'an, China(西北大学电子信息学院(人工智能学院)) Department of Mechanical Engineering, University College London, London, UK(伦敦大学学院机械工程系) Institute of Neuroscience and Cardiovascular Research, University of Edinburgh, Edinburgh, UK(爱丁堡大学神经科学与心血管研究学院) CAS Center for Excellence in Nanoscience, National Center for Nanoscience and Technology, Beijing, China(中国科学院纳米科学卓越中心) School of Control Science and Engineering, Shandong University, Jinan, China(山东大学控制科学与工程学院) School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(伯明翰大学工程学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 基于多中心、多序列MRI的大规模真实世界数据集LiFS,系统评估了9种AI方法在肝纤维化分期中的表现,发现最佳AI与资深放射科医生相当,但跨中心异质性和标签不平衡仍是主要挑战。

Comments Submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25364 2026-05-26 cs.CV 57%

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

MLLMs 能否超越语言进行推理?VisReason:一个面向视觉中心推理的综合基准

Longteng Guo, Yifan Wang, Pengkang Huo, Tailai Chen, Yuze Wu, Jing Liu, Xinxin Zhu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出 VisReason 基准,包含 1505 个日常场景问题,评估多模态大模型在视觉中心推理上的表现,揭示人类与模型间的显著差距。

Comments Accepted by ACL 2026 Findings, resources released at https://github.com/CASIA-IVA-Lab/VisReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12628 2026-05-26 cs.CV 57%

Creative4U: MLLMs-based Advertising Creative Image Selector with Comparative Reasoning

Creative4U: 基于MLLMs的广告创意图像选择器与比较推理

Yukang Lin, Xiang Zhang, Shichang Jia, Bowen Wan, Chenghan Fu, Xudong Ren, Yueran Liu, Wanxian Guan, Pengji Wang, Jian Xu, Bo Zheng, Baolin Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出基于多模态大语言模型的创意图像评估与选择范式,通过构建比较推理数据集CreativePair和强化学习方法Creative4U,实现可解释的创意选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25095 2026-05-26 cs.AI cs.LG math.OC 57%

RECTOR: Priority-Aware Rule-Based Reranking for Compliance-Aware Autonomous Driving Trajectory Selection

RECTOR: 基于优先级规则的合规感知自动驾驶轨迹选择重排序

Hadi Hajieghrary, Benedikt Walter, Chaitanya Shinde, Paul Schmitt, Miguel Hurtado

机构 * TORC Robotics LLC(TORC机器人公司) Daimler Truck AG(戴姆勒卡车集团) Reynolds & Moore(雷诺兹与摩尔公司) MassRobotics(马斯机器人)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出RECTOR,一种后生成重排序层,通过差异化代理和场景条件适用性机制,基于分层规则手册(安全>法律>道路>舒适)对候选轨迹进行评分,并采用确定性ε-词典序规则选择,在无需重新训练预测器的情况下,将安全与法律违规率从28.58%降至20.42%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00934 2026-05-26 cs.CY cs.AI 57%

The Meme Is the Message: Generative Memesis and AI Visuals in the 2024 USA Presidential Elections

模因即信息:生成式模因与2024年美国总统选举中的AI视觉内容

Ho-Chun Herbert Chang, Benjamin Shaman, Yung-chun Chen, Mingyue Zha, Sean Noh, Chiyu Wei, Tracy Weener, Maya Magee

机构 * Program in Quantitative Social Science, Dartmouth College(量化社会科学项目,达特茅斯学院) Department of Mathematics, Dartmouth College(数学系,达特茅斯学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过分析Instagram图像数据集,结合计算机视觉、大语言模型和面部情感分析,发现模因格式比AI生成内容更能预测用户参与度,但AI生成的模因与人类策展结合时产生协同效应,并定义了生成式模因作为AI介导的模因传播新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24159 2026-05-26 cs.CV 57%

EchoVQA: Enabling Conversational Assistance for Point-of-Care Cardiac Ultrasound

EchoVQA:为床旁心脏超声提供对话式辅助

Filippos Bellos, Yutong Li, Jessie N Dong, Zaiyang Guo, Emily Mackay, Yayuan Li, Yannis Avrithis, Alison Pouch, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) Independent Scientist(独立科学家)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对床旁心脏超声图像获取与解读依赖专业知识的问题,提出首个大规模超声心动图VQA数据集EchoVQA(含14,299张图像和74,819个问答对),并开发基于多模态可学习提示的参数高效方法,在多数基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24025 2026-05-26 cs.CV cs.LG 57%

Towards Large Model Feature Coding

面向大模型特征编码

Youwei Pang, Changsheng Gao, Dong Liu, Huchuan Lu, Weisi Lin

机构 * NTU(国立台湾大学) USTC(中国科学技术大学) DUT(东吴大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出大模型特征编码(LaMoFC)基准与评估框架,通过构建涵盖4类16场景的特征数据集LaMoFCBench,揭示现有编码范式与大模型特征异构性之间的严重错位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06415 2026-05-26 cs.LG cs.AI cs.CL cs.CV 56%

E = T*H/(O+B): A Dimensionless Control Parameter for Mixture-of-Experts Ecology

E = T*H/(O+B):混合专家生态的无量纲控制参数

Qingjun Zhang

机构 * School of Integrated Circuits, Wuxi Taihu University(无锡太湖大学集成电路学院)

专题命中 多模态评测 :分类 cs.CV、cs.CL、cs.AI;cross-modal(comments)

AI总结 提出无量纲控制参数E = T*H/(O+B),通过12个控制实验证明E≥0.5可保证混合专家模型无死亡专家,并发现专家复活、正交毒性依赖数据集等六项额外结果。

Comments 12 experiments, 11,000+ training epochs, cross-modal validation (vision + language). Extended version of the Claude-in-the-Loop ecology framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17057 2026-05-26 cs.RO 50%

RoboManipBaselines: A Unified Framework for Imitation Learning in Robotic Manipulation across Real and Simulation Environments

RoboManipBaselines:面向真实与仿真环境的机器人操作模仿学习统一框架

Masaki Murooka, Tomohiro Motoda, Ryoichi Nakajo, Hanbit Oh, Koshi Makihara, Keisuke Shirai, Tetsuya Ogata, Yukiyasu Domae

机构 * Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST)(日本国家先进工业科学技术研究院人工智能研究中心) CNRS-AIST JRL (Joint Robotics Laboratory), IRL(法国国家科学研究中心与日本AIST联合机器人实验室) Institute for AI and Robotics, Future Robotics Organization, Waseda University(早稻田大学未来机器人组织人工智能与机器人研究所) AI Robot Association (AIRoA)(人工智能机器人协会)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出RoboManipBaselines开源框架,统一支持仿真和真实环境下的机器人操作模仿学习全流程,包括数据收集、策略训练和部署,并通过基准测试和研究应用验证其有效性。

Comments Added a Limitations section in response to comments from reviewers

Journal ref IEEE Access 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21137 2026-05-26 cs.LG 50%

Norm$\times$Direction: Restoring the Missing Query Norm in Vision Linear Attention

Norm×Direction:恢复视觉线性注意力中缺失的查询范数

Weikang Meng, Yadan Luo, Liangyu Huo, Yingjian Li, Yaowei Wang, Xin Li, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Pengcheng Laboratory, China(鹏城实验室) The University of Queensland, Australia(昆士兰大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 针对线性注意力中查询范数丢失和非负性导致信息损失的问题,提出基于范数-方向分解的NaLaFormer,通过注入查询范数恢复注意力分布尖峰性,并采用余弦相似度保证非负性,在多项任务上达到线性注意力新标杆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19965 2026-05-26 quant-ph hep-ph 50%

Unlocking Multidimensional Integration with Quantum Adaptive Importance Sampling

用量子自适应重要性采样解锁多维积分

Konstantinos Pyretzidis, Jorge J. Martínez de Lejarza, Germán Rodrigo

专题命中 多模态评测 :multi-modal(abstract)

AI总结 提出混合量子-经典算法QAIS,利用参数化量子电路编码非可分概率密度函数,高效评估多维积分,在尖峰圈费曼积分和多峰基准积分上实现高精度。

Comments 26 pages , 10 figures , Final version to be published in Communications Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24683 2026-05-26 cs.NI 50%

B.O.D.Y.: Beyond-Overlay Deterministic topologY -- A Layer-2 Declarative Ground Truth for AIOps Pipelines under Fragmented Administrative Boundaries

B.O.D.Y.: 超越覆盖的确定性拓扑——面向碎片化管理边界的AIOps管道的第二层声明式地面真相

Matheus Marques, Carlos Alberto Malcher, Cledson de Sousa

专题命中 多模态评测 :multi-modal(abstract)

AI总结 提出B.O.D.Y.方法,通过多模态数据融合管道解决跨校区异构网络中的拓扑漂移和未管理物理段问题,为AIOps提供确定性的物理层地面真相。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24283 2026-05-26 cs.SE 50%

Can Graph-Based Microservice Performance Detection Be Used for Microservice Intrusion Detection?

基于图的微服务性能检测能否用于微服务入侵检测?

Yunjian Ma

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文研究基于图的微服务性能检测方法是否适用于入侵检测,通过构建请求级调用图并使用图卷积网络进行分类,实验表明当前浅层图模型在工程特征集上不如强扁平基线方法。

Comments Preprint. 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11242 2026-05-26 cs.CY 50%

LLMs and Childhood Safety: Identifying Risks and Proposing a Protection Framework for Safe Child-LLM Interaction

大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 多模态评测 :multimodal(abstract)

AI总结 通过系统文献综述识别儿童与大语言模型交互的风险,并基于不同证据流比较提出包含内容安全、发展敏感性和对抗性滥用控制的保护框架。

详情

展开后加载摘要…

URL PDF HTML 收藏