arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 83 篇

2604.03758 2026-04-07 cs.SE cs.AI 90%

AutoReSpec: A Framework for Generating Specification using Large Language Models

AutoReSpec:一种利用大语言模型生成规范的框架

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03742 2026-04-07 cs.AI 89%

Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge

结构化多标准评估大型语言模型:基于模糊层次分析法与DualJudge

Yulong He, Ivan Smirnov, Dmitry Fedrushkov, Sergey Kovalchuk, Ilya Revin

机构 * St. Petersburg State University(圣彼得堡国立大学) ITMO University(ITMO大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于模糊层次分析法的结构化评估方法,通过引入置信度感知的模糊AHP扩展,提升对大型语言模型评估的准确性与稳定性,提出DualJudge框架实现直观与 deliberative评估的互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03361 2026-04-07 cs.LG q-bio.QM 89%

The limits of bio-molecular modeling with large language models : a cross-scale evaluation

大语言模型在生物分子建模中的局限性:跨尺度评估

Yaxin Xu, Yue Zhou, Tianyu Zhao, Fengwei An, Zhixiang Ren

机构 * Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室) Institute of Mechanics, Chinese Academy of Sciences(中国科学院力学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文通过跨尺度生物分子基准测试,揭示了大语言模型在生物分子建模中的性能与机制理解之间的差距,指出链式思维数据对生物任务的有限帮助,混合mamba-注意力架构在长序列中的有效性,以及监督微调对专业化与泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03589 2026-04-07 cs.AI 88%

Entropy and Attention Dynamics in Small Language Models: A Trace-Level Structural Analysis on the TruthfulQA Benchmark

小语言模型中的熵与注意力动态:在TruthfulQA基准上的跟踪级结构分析

Adeyemi Adeseye, Aisvarya Adeseye, Hannu Tenhunen, Jouni Isoaho

机构 * Brilloconnetz Partners avoin yhtiö(Brilloconnetz Partners 公开合伙公司) University of Turku(图尔库大学) Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 研究通过跟踪级分析探讨小语言模型中熵和注意力动态对输出稳定性的影响,揭示不同模型在熵变化和注意力分布上的差异,为设计更可靠的边缘部署模型提供指导。

Comments Accepted to Publish it in 12th Intelligent Systems Conference 2026, 3-4 September 2026 in Amsterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03252 2026-04-07 cs.CY cs.CL 88%

Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations

利用大语言模型评估数字农业工具的包容性:人类与AI评估的比较分析

Githma Pewinya, Carolina Martins, Garcia Mariangel

机构 * International Water Management Institute(国际水资源管理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨大语言模型在快速评估数字农业工具包容性方面的潜力,比较四种模型与专家评估的性能,发现其在某些维度上能接近专家判断,但可靠性因模型和情境而异。

Comments 24 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03259 2026-04-07 cs.CY 88%

From Pre-trained Models to Large Language Models: A Comprehensive Survey of AI-Driven Psychological Computing

从预训练模型到大语言模型:人工智能驱动的心理计算全面综述

Huiyao Chen, Ruimeng Liu, Yan Luo, Jiawen Zhang, Meishan Zhang, Baotian Hu, Min Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了人工智能与心理学交叉领域的发展,系统分类了心理计算任务,探讨了从特征工程到迁移学习的方法演变,揭示了可转移的方法论模式。

Comments 56 pages, Psychological Computing with AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06448 2026-04-07 cs.MA cs.AI cs.CL cs.SI 86%

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

当AI代理在线合谋:社交平台上基于协作LLM代理的金融欺诈风险

Qibing Ren, Zhijie Zheng, Jiaxuan Guo, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型多代理系统中集体金融欺诈的风险,通过MultiAgentFraudBench基准测试分析欺诈行为协作机制及影响因素,提出内容警告、LLM监控和群体韧性提升等缓解策略。

Comments ICLR 2026, Code is available at https://github.com/zheng977/MutiAgent4Fraud

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 85%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03493 2026-04-07 cs.CL 85%

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

文化真实性:比较大语言模型的文化表征与本地人类期望

Erin MacMurray van Liemt, Aida Davani, Sinchana Kumbale, Neha Dixit, Sunipa Dev

机构 * Google Research(谷歌研究院) Google India(谷歌印度)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出人类中心框架评估LLM生成内容与本地期望的一致性,发现部分模型存在以西方为中心的校准,文化距离越远一致性越低,并识别出系统性误差。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03978 2026-04-07 cs.SE cs.PL 85%

COBOLAssist: Analyzing and Fixing Compilation Errors for LLM-Powered COBOL Code Generation

COBOLAssist: 分析和修复由LLM驱动的COBOL代码生成中的编译错误

Anh T. V. Dau, Shin Hwei Tan, Jinqiu Yang, Nghi D. Q. Bui, Anh Tuan Nguyen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了COBOL编译错误的挑战,提出COBOLAssist框架通过迭代修复提升代码正确性,实验表明其显著提高了编译成功率和功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 85%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29403 2026-04-07 cs.CR cs.AI 83%

Security in LLM-as-a-Judge: A Comprehensive SoK

LLM-as-a-Judge 的安全性:全面的系统化知识综述

Aiman Al Masoud, Antony Anju, Marco Arazzi, Mert Cihangiroglu, Vignesh Kumar Kembu, Serena Nicolazzo, Antonino Nocera, Vinod P., Saraga Sakthidharan

机构 * University of Pavia(帕维亚大学) Cochin University of Science and Technology(科钦科技大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文系统分析了LLM-as-a-Judge的安全性问题,提出分类框架,探讨了攻击、防御和应用等方向,揭示了现有框架的漏洞及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI 83%

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22264 2026-04-07 cs.SE cs.AI cs.CL cs.LG 82%

Predicting Intermittent Job Failure Categories for Diagnosis Using Few-Shot Fine-Tuned Language Models

利用少样本微调语言模型预测间歇性作业失败类别以进行诊断

Henri Aïdasso, Francis Bordeleau, Ali Tizghadam

机构 * École de technologie supérieure(高等技术学院) TELUS(TELUS公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FlaXifyer方法,通过预训练语言模型预测间歇性作业失败类别,实现84.3%的宏F1和92.0%的Top-2准确率,同时提出LogSift技术提升日志分析效率。

Comments Accepted at the ACM International Conference on the Foundations of Software Engineering (FSE 2026), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04005 2026-04-07 cs.HC cs.CY 82%

Exploring a Gamified Personality Assessment Method through Interaction with LLM Agents Embodying Different Personalities

通过与具有不同性格的LLM代理互动探索一种游戏化的人格评估方法

Baiqiao Zhang, Xiangxian Li, Chao Zhou, Xinyu Gai, Juan Liu, Xue Yang, Nianlong Li, Shuai Ma, Xiaojuan Ma, Yong-jin Liu, Yulong Bian

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于多性格表示的游戏化人格评估框架,通过互动游戏获取多维人格特征,验证了其在人格评估中的有效性及多性格表示的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13285 2026-04-07 cs.LG cs.AI 81%

Brittlebench: Quantifying LLM robustness via prompt sensitivity

Brittlebench: 通过提示敏感性量化大语言模型的鲁棒性

Angelika Romanou, Mark Ibrahim, Candace Ross, Chantal Shaib, Kerem Oktar, Samuel J. Bell, Anaelia Ovalle, Jesse Dodge, Antoine Bosselut, Koustuv Sinha, Adina Williams

机构 * FAIR at Meta(Meta FAIR) EPFL(瑞士联邦理工学院洛桑) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Brittlebench框架,通过提示变异量化大语言模型的鲁棒性,揭示模型在真实输入下的性能波动,强调对更鲁棒模型和评估的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03962 2026-04-07 cs.CL cs.LG 81%

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

预测,而非反应:基于价值的安全预测用于LLM流式处理

Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi

机构 * SB Intuitions Corp.(SB Intuitions 公司) Sakana AI

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出StreamGuard,通过预测未来潜在风险来实现流式处理中的安全监控,提升了输入和输出的 moderation 性能,同时降低了误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03376 2026-04-07 cs.AI cs.CL 81%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 79%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22913 2026-04-07 cs.CL 79%

Multilingual KokoroChat: A Multi-LLM Ensemble Translation Method for Creating a Multilingual Counseling Dialogue Dataset

多语言KokoroChat:一种多LLM集成翻译方法,用于创建多语言咨询对话数据集

Ryoma Suzuki, Zhiyang Qi, Michimasa Inaba

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出多LLM集成翻译方法,通过翻译日文咨询语料库KokoroChat生成多语言咨询对话数据集,验证了该方法在翻译质量上的优越性。

Comments 12 pages, 8 figures, Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI 79%

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04035 2026-04-07 cs.CR cs.AI 79%

Causality Laundering: Denial-Feedback Leakage in Tool-Calling LLM Agents

因果洗白:工具调用LLM代理中的否认-反馈泄漏

Mohammad Hossein Chinaei

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究提出Agentic Reference Monitor通过因果溯源阻断工具调用中的因果洗白攻击,有效防止数据泄露和因果影响传播。

Comments 24 pages, 1 figure, 2 tables, 1 algorithm, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03395 2026-04-07 cs.CL 79%

Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation

阿拉伯基准可靠吗?QIMMA的高质量LLM评估方法

Leen AlQadi, Ahmed Alzubaidi, Mohammed Alyafeai, Hamza Alobeidli, Maitha Alhammadi, Shaikha Alsuwaidi, Omar Alkaabi, Basma El Amel Boussaha, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 QIMMA通过多模型评估流程解决阿拉伯基准系统性质量问题,构建了包含52000多个样本的多领域多任务评估套件,为阿拉伯自然语言处理评估提供可复现的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01622 2026-04-07 cs.CL 79%

DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluation

DOVE:一个大规模多维预测数据集,用于有意义的LLM评估

Eliya Habba, Ofir Arviv, Itay Itzhak, Yotam Perlitz, Elron Bandel, Leshem Choshen, Michal Shmueli-Scheuer, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) IBM Research AI(IBM研究院人工智能) MIT(麻省理工学院) Technion - Israel Institute of Technology(以色列理工学院) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 DOVE通过大规模多维提示扰动评估LLM对不同维度的敏感性,揭示了提示设计对模型性能的影响,提供高效选择高性能提示的方法及鲁棒评估框架。

Journal ref Findings of ACL 2025, pp. 11744-11763

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15746 2026-04-07 cs.CL cs.AI 79%

LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation

LLMs 自我评判:一种用于人类对齐评估的游戏理论框架

Gao Yang, Yuhang Liu, Siyu Miao, Xinyue Liang, Zhengyang Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于游戏理论的自动相互评估框架,通过LLM自我评估和同伴评审,结合人类投票行为,探索LLM评估的对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06800 2026-04-07 cs.CL cs.AI cs.HC cs.MA 79%

FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline

FURINA:通过可扩展的多智能体协作流水线实现完全可定制的角色扮演基准

Haotian Wu, Shufan Jiang, Chios Chen, Yiyang Feng, Hehai Lin, Heqing Zou, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Stony Brook University(石溪大学) Nanyang Technological University(南洋理工大学) Datawhale Org.(Datawhale 组织) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FURINA-Builder,一种可扩展的多智能体协作流水线,用于构建完全可定制的角色扮演基准。该基准支持多样化的场景和提示格式,通过智能体协作评估任意角色,并发现推理能力提升的同时 hallucinations 增加的新型权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24186 2026-04-07 cs.CL cs.AI 79%

Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks

测量能力,而非表现:跨医学基准的项目意识评估

Zhimeng Luo, Lixin Wu, Adam Frisch, Daqing He

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院) Department of Educational Psychology, University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校教育心理学系) Department of Emergency Medicine, University of Pittsburgh(匹兹堡大学急诊医学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedIRT框架,通过项目反应理论评估LLM在医学领域的实际能力,揭示了不同医学主题的领域异质性,并展示了项目难度分析对不同响应模式的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21972 2026-04-07 cs.LG cs.AI stat.ML 79%

LLMs Judging LLMs: A Simplex Perspective

LLMs评判LLMs:一个简单形视角

Patrick Vossler, Fan Xia, Yifan Mai, Adarsh Subbaswamy, Jean Feng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从几何视角研究LLM评判问题,提出基于概率简单形的理论条件和方法,分析不同评分等级下LLM评判的有效性,并通过实验验证了考虑epistemic不确定性的重要性。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01129 2026-04-07 cs.LG cs.AI 79%

A Survey of Mamba

Mamba的综述

Haohao Qu, Liangbo Ning, Rui An, Wenqi Fan, Tyler Derr, Hui Liu, Xin Xu, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Vanderbilt University(范德堡大学) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了Mamba架构,探讨其在基础模型中的应用,分析其在序列长度上的线性可扩展性,并讨论其在不同领域的应用潜力及未来研究方向。

Comments Accepted by ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04473 2026-04-07 cs.CV 78%

Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks

超越标准基准:对视觉-语言模型在不同任务中对自然语义变化鲁棒性的系统审计

Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen, Jinyin Chen, Isao Echizen

机构 * Zhejiang University of Technology(浙江工业大学) National Institute of Informatics(国立信息学研究所)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文系统评估了视觉-语言模型在自然对抗场景下的鲁棒性,分析了不同模型在零样本图像分类、语义分割和视觉问答中的表现,揭示了鲁棒CLIP模型放大对抗漏洞的问题。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏