arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-18 至 2026-03-18 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2512.04588 2026-03-18 cs.IR 75%

UserSimCRS v2: Simulation-Based Evaluation for Conversational Recommender Systems

UserSimCRS v2:基于模拟的对话推荐系统评估

Nolwenn Bernard, Krisztian Balog

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出UserSimCRS v2,改进了对话推荐系统的模拟评估工具,包含增强的议程基用户模拟器、大语言模型模拟器、更广泛的支持CRS和数据集,以及新的LLM作为评判工具的评估功能。

Comments Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18808 2026-03-18 cs.SE 75%

SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement

SR-Eval: 评估在逐步需求细化下的LLM代码生成能力

Zexun Zhan, Shuzheng Gao, Ruida Hu, Cuiyun Gao

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SR-Eval是一个针对迭代代码生成的评估基准,通过多轮交互模拟真实开发流程,评估LLM在逐步需求细化下的表现,发现最佳模型在功能级任务中仅达到22.67%的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16070 2026-03-18 cs.CL cs.AI 73%

SEAHateCheck: Functional Tests for Detecting Hate Speech in Low-Resource Languages of Southeast Asia

SEAHateCheck:用于检测东南亚低资源语言仇恨言论的功能测试

Ri Chi Ng, Aditi Kumaresan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEAHateCheck,首个针对东南亚四国语言的仇恨言论检测基准,通过功能测试框架和本地专家验证,揭示模型在低资源语言中检测的局限性,推动文化敏感的实用工具开发。

Comments TALLIP Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11602 2026-03-18 cs.CL cs.AI 73%

Are LLMs Good Text Diacritizers? An Arabic and Yoruba Case Study

大语言模型是好的文本附加符号化工具吗?阿拉伯语和约鲁巴语的案例研究

Hawau Olamide Toyin, Samar Mohamed Magdy, Hanan Aldarmaki

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在阿拉伯语和约鲁巴语中的文本附加符号化效果,引入了多语言数据集MultiDiac,并评估了12种不同规模的语言模型,发现通用模型在某些情况下优于专用模型,但小型模型易出现幻觉。

Comments accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00430 2026-03-18 cs.CL 70%

Toward Better Temporal Structures for Geopolitical Events Forecasting

迈向更优的地缘政治事件预测时间结构

Kian Ahrabian, Eric Boxer, Jay Pujara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出超关系时间知识泛化超图(HTKGHs)以提升地缘政治事件预测,构建htkgh-polecat数据集并分析LLMs在复杂预测任务中的表现。

Comments 18 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16586 2026-03-18 cs.AI 70%

Runtime Governance for AI Agents: Policies on Paths

AI代理的运行时治理:路径上的政策

Maurits Kaptein, Vassilis-Javed Khan, Andriy Podstavnychy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Kyvvu B.V.(Kyvvu公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过路径作为核心对象,研究AI代理运行时治理,探讨路径依赖政策的框架与实现,分析合规性评估及开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16544 2026-03-18 cs.CL 70%

How often do Answers Change? Estimating Recency Requirements in Question Answering

答案多久会变化?在问答中估计时效性需求

Bhawna Piryani, Zehra Mert, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) MEF University(MEF大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RecencyQA数据集,通过人类评估和实证分析,展示非平稳问题对LLM的挑战随更新频率增加而加剧,为时间推理提供细粒度基准和时效感知问答系统基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16215 2026-03-18 cs.MA cs.AI 70%

CoMAI: A Collaborative Multi-Agent Framework for Robust and Equitable Interview Evaluation

CoMAI:一种用于鲁棒且公平面试评估的协作多智能体框架

Gengxin Sun, Ruihao Yu, Liangyi Yin, Yunqi Yang, Bin Zhang, Zhiwei Xu

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoMAI通过协作多智能体框架实现鲁棒且公平的面试评估,采用模块化任务分解架构,包含问题生成、安全、评分和总结四个智能体,提升评估的准确性和公平性。

Comments Gengxin Sun and Ruihao Yu contributed equally to this research. Bin Zhang and Zhiwei Xu are the corresponding authors. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15976 2026-03-18 cs.AI 70%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR 70%

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07985 2026-03-18 cs.CL 70%

Multilingual, Multimodal Pipeline for Creating Authentic and Structured Fact-Checked Claim Dataset

多语言、多模态流水线用于创建真实且结构化的事实核查数据集

Z. Melce Hüsünbeyi, Virginie Mouilleron, Leonie Uhling, Daniel Foppe, Tatjana Scheffler, Djamé Seddah

机构 * Ruhr-Universität Bochum(博尔塔尔大学波恩)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个多语言、多模态的数据收集与处理流水线,通过整合ClaimReview feeds、抓取完整驳斥文章、标准化异构声明裁定并添加结构化元数据和对齐的视觉内容,构建了法语和德语的事实核查数据集,提升了事实核查的可解释性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 70%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06680 2026-03-18 cs.CL 70%

Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation

引导大语言模型朝向韩语方言:面向忠实方言翻译的迭代精修框架

Keunhyeung Park, Seunguk Yu, Youngbin Kim

机构 * Chung-Ang University, Seoul, Republic of Korea(Chung-Ang大学,首尔,大韩民国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DIA-REFINE框架,通过翻译、验证和反馈的迭代循环提升大语言模型的方言翻译准确性,引入方言保真度评分和目标方言比例指标,实验表明该框架能有效提升方言翻译的忠实度。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21903 2026-03-18 cs.SI cs.CL cs.IR 70%

Who's important? -- SUnSET: Synergistic Understanding of Stakeholder, Events and Time for Timeline Generation

谁更重要?-- SUnSET:面向时间线生成的多方、事件和时间协同理解

Tiviatis Sim, Kaiwen Yang, Shen Xin, Kenji Kawaguchi

机构 * National University of Singapore(国立新加坡大学) A*STAR Institute of High Performance Computing(A*STAR高性能计算研究所) Celia Research Team(Celia研究团队) Norbert Wiener Research Center, Huawei International(诺伯特·维纳研究中心,华为国际)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SUnSET框架,通过引入多方重要性评估和事件关联性度量,提升时间线生成的准确性,实验结果优于现有方法,凸显多方信息的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15916 2026-03-18 cs.LG cs.AI 62%

Auto Researching, not hyperparameter tuning: Convergence Analysis of 10,000 Experiments

自主研究而非超参数调优:10000次实验的收敛分析

Xiaoyi Li

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析10469次实验,发现架构选择对性能影响显著,超参数调整影响较小,展示了LLM在自主设计ML实验中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI 62%

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12832 2026-03-18 cs.CL cs.AI 62%

From Passive to Persuasive: Localized Activation Injection for Empathy and Negotiation

从被动到说服:局部激活注入用于共情与谈判

Niranjan Chebrolu, Kokil Jaidka, Gerard Christopher Yeo

机构 * Centre for Trusted Internet and Community(可信互联网与社区中心) Department of Communications and New Media(通讯与新媒体系)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STAR方法,通过局部激活注入提升共情和谈判能力,实验证明其优于全局激活和指令预训练,表明复杂人际行为在LLM激活空间中以局部线性方向编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06383 2026-03-18 cs.CL cs.AI 62%

Protecting De-identified Documents from Search-based Linkage Attacks

保护去标识化文档免受基于搜索的链接攻击

Pierre Lison, Mark Anderson

机构 * Norwegian Computing Center(挪威计算中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种方法,通过构建倒排索引和LLM重写器,有效防止基于搜索的链接攻击,同时保持文本语义完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01167 2026-03-18 cs.CV cs.CL cs.LG 62%

TempCore: Are Video QA Benchmarks Temporally Grounded? A Frame Selection Sensitivity Analysis and Benchmark

TempCore:视频问答基准测试是否具有时间感知性?一个帧选择敏感性分析与基准测试

Hyunjong Ok, Jaeho Lee

机构 * POSTECH(POSTECH大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过帧选择敏感性分析揭示视频问答基准测试中多数样本对帧选择不敏感,仅少数样本具有时间敏感性,提出TempCore用于评估时间敏感样本。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16839 2026-03-18 cs.AI 61%

Learning to Present: Inverse Specification Rewards for Agentic Slide Generation

学习呈现:用于代理幻灯片生成的逆规范奖励

Karthik Ragunath Ananda Kumar, Subrahmanyam Arunachalam

机构 * Tavus Inc.(Tavus公司) University of Texas at Dallas(德克萨斯大学达拉斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.AI

AI总结 本文提出一个兼容OpenEnv的强化学习环境,通过工具使用训练LLM代理生成专业HTML幻灯片,引入多组件奖励系统,包括结构验证、渲染质量评估、LLM审美评分、内容质量指标和逆规范奖励,实验显示细调模型在质量与工具使用合规性上表现优异。

Comments 12 pages, 11 figures, 13 tables, 26 references. Code: https://github.com/pushing-the-frontier/slide-forge-llm Dataset: https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16483 2026-03-18 cs.CL 57%

On the Emotion Understanding of Synthesized Speech

合成语音情感理解研究

Yuan Ge, Haishu Zhao, Aokai Hao, Junxiang Zhang, Bei Li, Xiaoqian Liu, Chenglong Wang, Jianjin Wang, Bingsen Zhou, Bingyu Liu, Jingbo Zhu, Zhengtao Yu, Tong Xiao

机构 * Northeastern University, China(东北大学) Meituan(美团) NiuTrans Research(NiuTrans研究院) Kunming University of Science and Technology(昆明理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文系统评估了合成语音上情感识别模型的泛化能力,发现现有模型因合成过程中的语音token预测导致表示不匹配,无法有效捕捉情感特征,且生成式语音模型易忽略非语言线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20557 2026-03-18 cs.CL 57%

SiniticMTError: A Machine Translation Dataset with Error Annotations for Sinitic Languages

SiniticMTError:一个带有错误标注的机器翻译数据集,用于斯拉夫语言

Hannah Liu, Junghyun Min, En-Shiun Annie Lee, Ethan Yue Heng Cheung, Shou-Yi Hung, Elsie Chan, Shiyao Qian, Runtong Liang, Kimlan Huynh, Wing Yu Yip, York Hay Ng, TSZ Fung Yau, Ka Ieng Charlotte Lo, You-Wei Wu, Richard Tzong-Han Tsai

机构 * University of Toronto(多伦多大学) Georgetown University(乔治城大学) Ontario Tech University(安大略技术大学) National Central University, Taiwan(台湾国立中央大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文介绍了一个新的细粒度数据集,用于在英语到普通话、粤语和吴语的机器翻译示例中提供错误跨度、错误类型和错误严重性标注,并提供一个基于非平行源的普通话-闽南语组件,支持低资源语言评估和翻译质量估计研究。

Comments LREC 2026 camera-ready. 23 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16538 2026-03-18 cs.CV cs.LG 57%

Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes

利用生成式AI进行街景分析(SAGAI):基于视觉-语言评估和城市场景制图

Joan Perez, Giovanni Fusco

机构 * Urban Geo Analytics, France(法国城市地理分析)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出SAGAI,一种利用开放数据和视觉-语言模型分析街景的模块化流程,通过定制提示生成空间指标,实现城市场景的自动化制图与评估,展示了其在城市研究中的广泛应用潜力。

Comments 25 pages, 6 figures in main paper, 6 figures in appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15847 2026-03-18 cs.CV cs.LG cs.RO 57%

FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding

FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集

Eadom Dessalene, Botao He, Michael Maynord, Yonatan Tussa, Pavan Mantripragada, Yianni Karabati, Nirupam Roy, Yiannis Aloimonos

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI 57%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15672 2026-03-18 cs.AR cs.AI cs.SE 57%

DRCY: Agentic Hardware Design Reviews

DRCY:代理硬件设计审查

Kyle Dumont, Nicholas Herbert, Hayder Tirmazi, Shrikanth Upadhayaya

机构 * AllSpice Inc.(AllSpice公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 DRCY是首个生产级多代理LLM系统,通过自动获取元件数据表并进行引脚分析,提高硬件设计连接审查的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16645 2026-03-18 cs.CV 50%

BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection

BUSSARD:基于归一化流的生物jective通用场景特定异常关系检测

Melissa Schween, Mathis Kruse, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S-汉诺威莱布尼茨大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出BUSSARD模型,通过归一化流学习场景图中对象-关系-对象三元组到基础分布的可逆变换,实现异常关系检测。在SARD数据集上取得优于当前SOTA的AUROC提升,并展示出更强的鲁棒性和通用性。

Comments CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16269 2026-03-18 cs.CV 50%

FG-SGL: Fine-Grained Semantic Guidance Learning via Motion Process Decomposition for Micro-Gesture Recognition

FG-SGL:通过运动过程分解实现微手势识别的细粒度语义引导学习

Jinsheng Wei, Zhaodi Xu, Guanming Lu, Haoyu Chen, Jingjie Yan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) University of Oulu(奥卢大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出FG-SGL框架,通过整合细粒度和类别级语义引导视觉-语言模型感知局部微手势运动,利用细粒度文本数据和多级对比优化策略提升微手势识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13517 2026-03-18 cs.CR 50%

CTI-REALM: Benchmark to Evaluate Agent Performance on Security Detection Rule Generation Capabilities

CTI-REALM:评估安全检测规则生成能力的基准测试

Arjun Chakraborty, Sandra Ho, Adam Cook, Manuel Meléndez

专题命中 评测与基准 :LLM(abstract)

AI总结 CTI-REALM基准测试旨在评估AI代理解读网络威胁情报和生成检测规则的能力,通过模拟真实安全分析师工作流程,评估代理在不同系统和平台上的表现,展示了AI代理在检测工程中的潜力。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06140 2026-03-18 cs.CV 50%

Boosting the Local Invariance for Better Adversarial Transferability

提升局部不变性以增强对抗迁移性

Bohan Liu, Xiaosen Wang

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出LI-Boost方法,通过提升对抗扰动的局部不变性来增强模型间对抗迁移性,实验表明其在多种攻击类型上均有效。

Comments Code is available at https://github.com/Trustworthy-AI-Group/TransferAttack

详情

展开后加载摘要…

URL PDF HTML 收藏