arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2504.00977 2026-06-09 cs.CL 版本更新 57%

Chinese Grammatical Error Correction: A Survey

中文语法纠错:综述

Mengyang Qiu, Qingyu Gao, Linxuan Yang, Yang Gu, Tran Minh Nguyen, Zihao Huang, Jungyeul Park

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文综述中文语法纠错(CGEC)研究,涵盖数据集、标注方案、评估方法和系统进展,指出关键挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06397 2026-06-08 cs.LG 版本更新 57%

The Post-GCN Decade Revisited: Curvature-Stratified Evaluation of Relational Learning

后GCN十年回顾:曲率分层的关联学习评估

Shuo Wang, Xiangyu Wang, Quanxin Wang, Bailin Wu, Bokui Wang, Shunyang Huang, Boyan Deng, Haonan Liu, Ruiyi Fang, Zhenxiang Xu, Boyu Wang, Zhao Kang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学) Western University(西方大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对关联学习中统一基准掩盖几何依赖性性能的问题,提出曲率分层评估框架,通过将数据集按曲率正负零分区,揭示模型性能本质上是几何依赖的,并给出更可靠的评估协议。

Comments Comments: Suggestions and comments are welcomed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03559 2026-06-08 cs.LG math.OC stat.ML 版本更新 57%

Analytical Evaluation of DCA Convergence Properties for Minimizing Prediction Functions of Gaussian RBF Support Vector Regression

高斯RBF支持向量回归预测函数最小化的DCA收敛性分析评估

Yohei Kakimoto, Yuto Omae, Hirotaka Takahashi

机构 * Nihon University(日本大学) Tokyo City University(东京城大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对以训练好的高斯RBF核支持向量回归(RBF-SVR)预测函数为目标函数的非凸优化问题,利用RBF核的解析结构构造显式DC分解,推导出DC分量强凸参数下界μ和子问题梯度Lipschitz常数上界L的闭式表达式,并通过数值实验表明特征量Cαρ主导DCA的收敛性和初始点依赖性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 50%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09251 2026-08-18 cs.DB 版本更新 50%

SQL-RewriteBench: A Correctness-Gated, Full-Denominator Benchmark for Statement-Level SQL Rewriting [Experiment,Analysis & Benchmark]

SQL-RewriteBench:用于语句级SQL重写的正确性门控全分母基准测试[实验、分析与基准测试]

Jiang Long, Tianci Gao, Shiyuan Hao, Haochen Zhang, Shuncheng Liu, Jiang Zhang

专题命中 评测与基准 :LLM(abstract)

AI总结 研究语句级SQL重写,提出SQL-RewriteBench基准测试,应用正确性门控和全分母计算,其指标套件可区分多种指标,定义了SCS和CGOQ,提供多个可执行实例,通过测试发现现有方法存在问题,强调可部署SQL重写需多方面改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-08-18 eess.SP 版本更新 50%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22447 2026-08-18 cs.SE 版本更新 50%

Latent Reuse in Agent Skills: Multi-modal Clone Detection at Ecosystem Scale

SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中

Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 50%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04798 2026-08-18 cs.CV 版本更新 50%

Detector-Augmented SAMURAI for Long-Duration Drone Tracking

增强检测器的SAMURAI用于长时间无人机跟踪

Tamara R. Lenhard, Andreas Weinmann, Hichem Snoussi, Tobias Koch

机构 * Institute for the Protection of Terrestrial Infrastructures, German Aerospace Center (DLR)(地面基础设施保护研究所,德国航空航天中心(DLR)) ACIDA Lab, Technical University of Applied Sciences Würzburg-Schweinfurt(应用技术大学施魏尔堡-施维恩富特学院ACIDA实验室) Data Science Institute, European University of Technology(欧洲技术大学数据科学研究所) LIST3N, Université de Technologie de Troyes(图卢兹理工大学LIST3N)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出增强检测器的SAMURAI模型,用于提升无人机在复杂城市环境中的长时间跟踪鲁棒性,显著提高了成功率并降低了误检率。

Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18135 2026-08-18 cs.CV 版本更新 50%

World-in-World: World Models in a Closed-Loop World

世界中的世界:闭环世界中的世界模型

Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

机构 * JHU(约翰·霍普金斯大学) PKU(北京大学) Princeton(普林斯顿大学) MIT(麻省理工学院) Harvard(哈佛大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 研究人员推出首个具身场景闭环世界模型基准平台World-in-World,发现视觉质量不保障任务成功,后训练缩放比升级预训练视频生成器更有效,增加推理计算可提升闭环性能。

Comments ICLR 2026 Oral. Add acknowledgement in arxiv v2. Code is at https://github.com/World-In-World/world-in-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00077 2026-08-18 q-bio.QM 版本更新 50%

Ribonucleic-Acid Protein Interaction Prediction Based on Deep Learning: A Comprehensive Survey

基于深度学习的核糖核酸-蛋白质相互作用预测:一项综合综述

Danyu Li, Rubing Huang, Chenhui Cui, Dave Towey, Ling Zhou, Jinyu Tian, Bin Zou

专题命中 评测与基准 :language model(abstract)

AI总结 该综述分析2014-2023年179项研究,考察AI在基于深度学习的RPI预测中的应用,总结技术演进、最优模型、挑战及未来方向,填补相关文献空白。

Comments Accepted for publication in Applied Soft Computing. DOI: 10.1016/j.asoc.2025.113795

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10702 2026-08-13 cs.SE 版本更新 50%

ChatGPT: Friend or Foe When Comprehending and Changing Unfamiliar Code

ChatGPT: 何时在理解和修改陌生代码时是朋友还是敌人

Norman Anderson, Tarek Alakmeh, Victoria Jackson, Guilherme Vaz Pereira, Umit Akirmak, Anthony Estey, Rafael Prikladnicki, Thomas Fritz, André van der Hoek, Margaret-Anne Storey

专题命中 评测与基准 :LLM(abstract)

AI总结 研究探讨了AI对开发者在编程任务中问题解决过程的影响,发现AI在某些情况下帮助解决问题,而在其他情况下阻碍了突破困境。

Comments 12 pages, 2 figures, 5 tables. To appear in the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, UK, 9-12 June 2026; corrected and expanded bibliography entries

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01597 2026-08-12 eess.AS cs.SD 版本更新 50%

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

面向公平的语音技术:语音AI中的偏差与公平性综合综述

Yi-Cheng Lin, Yun-Shao Tsai, Kuan-Yu Chen, Hsiao-Ying Huang, Huang-Cheng Chou, Shrikanth Narayanan, Yu Tsao, Jian-Jiun Ding, Hung-yi Lee

专题命中 评测与基准 :language model(abstract)

AI总结 本综述整合400余项相关研究,构建统一框架,针对语音模态提出7种公平定义,梳理偏差来源并系统化缓解策略,为语音AI的公平性研究提供了全面指引。

Comments 73 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08696 2026-08-12 cs.CV 版本更新 50%

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Prediction

OccAnyScene:面向统一的室内-室外三维占用预测

Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

机构 * SuSTech(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) HITSZ(哈尔滨工业大学深圳校区) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出跨场景三维语义占用预测新任务,构建OccAnyScene框架实现室内外场景统一三维占用预测,在Occ-ScanNet和SurroundOcc-nuScenes数据集上取得最优mIoU结果。

Comments Corrected a typo in the title; manuscript unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23789 2026-08-12 cs.CV 版本更新 50%

MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成

Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang

机构 * South China University of Technology(华南理工大学) Fudan University(复旦大学) Yunnan Normal University(云南师范大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。

Comments 17 pages, 9 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00945 2026-08-12 cs.HC 版本更新 50%

Sighted by Default: Addressing Implicit Vision Assumptions in Real-Time VLM Assistance for BLV Users

默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题

Yi Zhao, Siqi Wang, Qiqun Geng, Erxin Yu, Jing Li

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。

Comments Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 50%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 评测与基准 :LLM(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21051 2026-08-11 cs.SE cs.CR 版本更新 50%

Residual Risk Assessment in Benign Code: How Far Are We? A Multi-Model Semantic and Structural Similarity Approach

良性代码中的残余风险分析:我们距离目标有多远?一种多模型语义和结构相似性方法

Mohammad Farhad, Shuvalaxmi Dass

专题命中 评测与基准 :language model(abstract)

AI总结 本文通过多模型语义和结构相似性分析,探讨了修复后的代码中残余风险的评估问题,提出Residual Risk Scoring框架,发现良性函数与脆弱函数在语义和结构上高度相似,存在潜在残余风险。

Comments 20 pages, 7 figures. Accepted for presentation at the SecAssure 2026 Track @ 31st ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05250 2026-08-11 cs.SE 版本更新 50%

A Benchmarking Framework for Model Datasets

用于模型数据集的基准框架

Philipp-Lorenz Glaser, Lola Burgueño, Dominik Bork

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出了一种用于模型数据集的基准框架,旨在系统评估和比较软件模型数据集的质量、代表性和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 50%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 50%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05836 2026-08-07 astro-ph.CO 版本更新 50%

Diagnostic Consistency Tests of the Concordance Cosmology

一致性检验的协和宇宙学

S. M. Koksbang, A. Heinesen

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出一种模型无关的框架,通过角直径距离和径向膨胀率的导数检验大尺度几何结构,提供对标准宇宙学的严格诊断。

Comments 5 pages, 1 captioned figure. v2: 6 pages, text slightly elaborated and figures updated. No changes to results. Matches version accepted for publication in PRL. Joint submission with arXiv:2604.05822

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02450 2026-08-07 math.CO 版本更新 50%

Lower bounds for multivariate independence polynomials and their generalisations

多重独立多项式的下界及其推广

Joonkyung Lee, Jaehyeon Seo

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了多重独立多项式的下界及其推广,提出并证明了关于图的独立集的不等式,并推测该结果可推广至其他反铁磁模型。

Comments 17 pages. Clarify Section 3 and add a Lean formalisation of Theorem 1.4. See https://github.com/thegreatseo/multivar-indep-formalize for the GitHub repo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15574 2026-08-06 cs.CV 版本更新 50%

MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

MI-CXR:多区间胸部X光片纵向推理基准

Sunghwan Steve Cho, Yunseok Han, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract)

AI总结 MI-CXR基准旨在评估多visit胸部X光片的纵向推理能力,通过五选一问题和三个互补任务家族,揭示现有视觉语言模型在时间维度上的局限性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10783 2026-08-06 cs.CV 版本更新 50%

LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content

LiveXiv —— 基于 arXiv 论文内容的多模态实时基准测试集

Nimrod Shabtay, Felipe Maia Polo, Sivan Doveh, Wei Lin, M. Jehanzeb Mirza, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Assaf Arbelle, Leonid Karlinsky, Raja Giryes

机构 * Faculty of Engineering Tel-Aviv University(特拉维夫大学工程学院) IBM Research(IBM研究院) Department of Statistics, University of Michigan(密歇根大学统计学系) JKU Linz, Austria(林茨大学,奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM(麻省理工学院-IBM)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对多模态模型训练中测试数据污染问题,提出基于 arXiv 论文的 LiveXiv 实时基准,自动生成 VQA 对,用部分模型评估降低成本,验证了其性能差异极小,数据集已在 HuggingFace 公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11983 2026-08-06 quant-ph 版本更新 50%

Circuit Design based on Feature Similarity for Quantum Generative Modeling

基于特征相似度的量子生成建模电路设计

Mathis Makarski, Jumpei Kato, Yuki Sato, Naoki Yamamoto

专题命中 评测与基准 :pretraining(abstract)

AI总结 本研究针对量子生成模型的可训练性问题,提出基于度量的电路扩展启发式方法,在bars and stripes数据集及金融数据上验证其能引入归纳偏置,为问题导向的电路设计提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29368 2026-08-05 cs.CV 版本更新 50%

StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision

StereoVGGT: 一种无需训练的视觉几何变换器用于立体视觉

Ziyang Chen, Yansong Qu, You Shen, Xuan Cheng, Liujuan Cao

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出StereoVGGT,一种专为立体视觉设计的特征骨干网络,通过冻结VGGT并引入无训练特征调整流程,缓解几何退化,提升立体匹配性能,在KITTI基准中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04529 2026-08-04 cs.IR 版本更新 50%

Evaluation and Explainability of Unsupervised Scholarly Collaboration Recommendations

无监督学术合作推荐的评估与可解释性

Md Asaduzzaman Noor, John W. Sheppard, Jason A. Clark

专题命中 评测与基准 :language model(abstract)

AI总结 研究无监督、基于内容的学术合作推荐,比较TF-IDF基线、主题模型和基于嵌入的检索等方法,引入受限设置评估模型,还从两视角考察可解释性,展现不同方法差异及权衡。

Comments 6 pages, 2 figures, Submitted to ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 50%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 50%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 评测与基准 :LLM(abstract)

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏