arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-30 至 2026-03-30 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2509.00841 2026-03-30 cs.CL 88%

Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations

神经模型与语言模型提示用于开放式对话的多维评估

Michelle Elizabeth, Alicja Kasicka, Natalia Krawczyk, Magalie Ochs, Gwénolé Lecorvé, Justyna Gromada, Lina M. Rojas-Barahona

机构 * Orange Research(Orange研究院) Aix-Marseille University(艾克斯-马赛大学)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出通过对话系统技术挑战赛(DSTC-12 Track 1)开发模型,用于预测对话层面的维度特定评分。采用语言模型提示和编码器分类回归模型,尽管LM提示与人类判断相关性较低,但仍优于基线,回归模型在验证集上表现优异。

Comments This work was granted access to the HPC resources of IDRIS under the allocations AD011015150R1 made by GENCI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26105 2026-03-30 cs.LG 87%

Are LLM-Enhanced Graph Neural Networks Robust against Poisoning Attacks?

基于大语言模型的图神经网络是否对污染攻击具有鲁棒性?

Yuhang Ma, Jie Wang, Zheng Yan

机构 * State Key Laboratory of Integrated Services Networks, School of Cyber Engineering, Xidian University(西安电子科技大学网络与信息安全学院综合业务网理论及关键技术国家重点实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了大语言模型增强的图神经网络在面对污染攻击时的鲁棒性,通过系统评估框架评估了24种模型,分析了影响鲁棒性的关键因素,并提出了新的攻击方法和防御策略。

Comments To appear at 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20660 2026-03-30 cs.LG cs.AI cs.SE 86%

The Dual-State Architecture for Reliable LLM Agents

双状态架构用于可靠的LLM代理

Matthew Thompson

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出双状态动作对DSAP,通过结合随机生成与确定性后置条件验证,提升LLM代理在软件工程中的可靠性,实验表明在1.2-2.1倍基准成本下可靠性提升达66个百分点。

Comments 18 pages, 2 figures, 5 tables. V2 extends and supersedes V1, introducing tri-state guard semantics, a three-level recovery hierarchy, and SWE-Bench boundary analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12522 2026-03-30 cs.CL cs.AI cs.CY cs.HC 86%

LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluation

LLM BiasScope:一种用于比较LLM评估的实时偏见分析平台

Himel Ghosh, Nick Elias Werner

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM BiasScope通过实时偏见分析帮助比较不同LLM模型的输出,支持多供应商模型对比,提供统计、可视化和偏见类型分析。

Comments Accepted at EACL 2026 (24-29 March, Morocco)

Journal ref Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26106 2026-03-30 cs.CL 85%

LLM Benchmark-User Need Misalignment for Climate Change

LLM基准-气候变化中的用户需求错位

Oucheng Liu, Lexing Xie, Jing Jiang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示现有LLM基准与实际用户需求存在显著不匹配,提出主动知识行为框架和主题-意图-形式分类法,为基准设计、RAG系统开发和LLM训练提供指导。

Comments 37 pages (8 main), 31 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 85%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26544 2026-03-30 cs.CL q-bio.QM 84%

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

欧盟时间索引参考数据集的开发:利用大型语言模型评估药监信号检测方法性能

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文开发了欧盟时间索引参考数据集,利用大型语言模型识别药品不良反应,以评估信号检测方法的性能,填补了药监领域的时间信息缺失空白。

Comments 4 Figures and 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20093 2026-03-30 cs.CL cs.AI 81%

Evaluating Neural Language Models as Cognitive Models of Language Acquisition

评估神经语言模型作为语言习得的认知模型

Héctor Javier Vázquez Martínez, Annika Lea Heuser, Charles Yang, Jordan Kodner

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有神经语言模型语法能力评估基准不够严谨,建议使用经过严格评估的语料库以更准确研究语言习得机制。

Comments To appear in the GenBench 2023 workshop proceedings, the first workshop on (benchmarking) generalisation in NLP. GenBench 2023 will be held at EMNLP 2023 on December 6, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26516 2026-03-30 cs.CL cs.AI cs.LG 80%

ALBA: A European Portuguese Benchmark for Evaluating Language and Linguistic Dimensions in Generative LLMs

ALBA:一个用于评估生成大语言模型中语言和语言学维度的欧洲葡萄牙语基准

Inês Vieira, Inês Calvo, Iago Paulo, James Furtado, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

机构 * NOVA University of Lisbon(新里斯本大学) NOVA LINCS(新里斯本大学计算机科学与系统研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ALBA是首个针对欧洲葡萄牙语的语言学评估基准,通过八个维度评估生成模型在语言多样性、文化绑定语义等任务中的表现,揭示了模型在不同语言学维度上的性能差异。

Comments PROPOR 2026 - The 17th International Conference on Computational Processing of Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26611 2026-03-30 cs.LG stat.ME stat.ML 79%

Benchmarking Tabular Foundation Models for Conditional Density Estimation in Regression

对回归中条件密度估计的表格基础模型进行基准测试

Rafael Izbicki, Pedro L. C. Rodrigues

机构 * Department of Statistics, Federal University of São Carlos (UFSCar)(圣卡洛斯联邦大学统计系) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立理工学院、让·库尔坦数学实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估了三种表格基础模型变体在39个真实数据集上的条件密度估计性能,发现基础模型在大多数数据集上表现最佳,但校准在小样本时竞争,大样本时不如任务特定神经基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 79%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 79%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 78%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 评测与基准 :foundation model(title);post-training(abstract)

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25933 2026-03-30 cs.HC 78%

Explore LLM-enabled Tools to Facilitate Imaginal Exposure Exercises for Social Anxiety

探索基于大语言模型的工具以促进社交焦虑的意象暴露练习

Yimeng Wang, Yinzhou Wang, Alicia Hong, Yixuan Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文探讨了基于大语言模型的工具在社交焦虑意象暴露练习中的可行性,通过与心理健康专业人员合作设计工具,并进行用户研究,验证了该工具在生成个性化暴露脚本方面的有效性及适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25802 2026-03-30 cs.CV 78%

LEMON: a foundation model for nuclear morphology in Computational Pathology

LEMON:计算病理学中核形态的基础模型

Loïc Chadoutaud, Alice Blondel, Hana Feki, Jacqueline Fontugne, Emmanuel Barillot, Thomas Walter

机构 * Institut Curie(居里研究所) Mines Paris PSL, Centre for Computational Biology (CBIO)(巴黎高科矿业学院计算生物学中心) INSERM, U1331(法国国家健康与医学研究院U1331) Institut Curie, U1353/UMR9029 IRIS, Equipe IMPACT(居里研究所U1353/UMR9029 IRIS IMPACT团队)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 LEMON通过大规模单细胞图像表示学习,为计算病理学提供新的范式,其在多种预测任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13592 2026-03-30 cs.CL 77%

Don't Stop the Multi-Party! On Generating Synthetic Written Multi-Party Conversations with Constraints

不要停止多方对话!通过约束生成合成的书面多方对话

Nicolò Penzo, Marco Guerini, Bruno Lepri, Goran Glavaš, Sara Tonelli

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨利用指令微调的大语言模型生成合成书面多方对话,通过确定性约束如对话结构和参与者立场,发现逐轮生成比一次性生成更符合约束且语言多样性更高。

Comments Accepted at AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26496 2026-03-30 cs.NI 75%

Innovation Discovery System for Networking Research

网络研究创新发现系统

Mengrui Zhang, Bang Huang, Yunxin Xu, Haiying Huang, Luxi Zhao, Mochun Long, Qingyu Song, Qiao Xiang, Xue Liu, Jiwu Shu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SciNet,通过构建网络科研数据集、模拟人类创新流程和开发评估方法,生成实用且新颖的网络研究想法,优于传统LLM生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26512 2026-03-30 cs.AI 70%

CADSmith: Multi-Agent CAD Generation with Programmatic Geometric Validation

CADSmith: 基于程序化几何验证的多智能体CAD生成

Jesse Barkley, Rumi Loghmani, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 CADSmith通过多智能体管道生成CadQuery代码,并通过双重嵌套修正循环进行迭代优化,结合精确测量和视觉评估提升CAD生成质量。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26156 2026-03-30 cs.CL cs.CY 70%

Clash of the models: Comparing performance of BERT-based variants for generic news frame detection

模型之争:比较基于BERT的变体在通用新闻框架检测中的性能

Vihang Jumle

机构 * University of Bern(伯尔尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了BERT、RoBERTa、DeBERTa、DistilBERT和ALBERT在通用新闻框架检测中的性能,提出了多种经过微调的模型,并构建了一个基于瑞士选举语境的标注数据集以测试框架分析的上下文鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 70%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08316 2026-03-30 cs.SE cs.AI 70%

SWE Context Bench: A Benchmark for Context Learning in Coding

SWE Context Bench: 一个用于编码上下文学习的基准测试

Jared Zhu, Minhao Hu, Junde Wu

机构 * Independent Researcher(独立研究员) University of Oxford(牛津大学) University of Edinburgh(爱丁堡大学) Technical University of Munich(慕尼黑工业大学) MemoraX AI National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SWE-ContextBench基准,用于评估编程代理的上下文重用能力,通过1100个基础任务和376个相关任务,从GitHub问题和拉取请求中挖掘真实依赖关系,评估预测准确度、时间效率和成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21891 2026-03-30 cs.SE cs.CL 70%

AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans

AgentPack:一个由代理和人类共同撰写的代码更改数据集

Yangtian Zi, Zixuan Wu, Aleksander Boruch-Gruszecki, Jonathan Bell, Arjun Guha

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AgentPack数据集,包含180万条由Claude Code、OpenAI Codex和Cursor Agent与人类共同撰写的代码更改,分析其结构特性,并展示基于该数据集微调的模型在代码编辑任务中优于传统人类提交数据集的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02835 2026-03-30 cs.LG cs.IR 70%

Defending Against Knowledge Poisoning Attacks During Retrieval-Augmented Generation

在检索增强生成过程中防御知识污染攻击

Kennedy Edemacu, Vinay M. Shashidhar, Micheal Tuape, Dan Abudu, Beakcheol Jang, Jong Wook Kim

机构 * Department of Computer Science, The City University of New York - College of Staten Island(纽约市立大学史泰登岛学院计算机科学系) Department of Mathematics and Computer Science, Northern Michigan University(北密歇根大学数学与计算机科学系) Department of Software Engineering, Lappeenranta-Lahti University of Technology(拉彭兰塔-拉赫蒂理工大学软件工程系) Energy and Bioproducts Research Institute, Aston University(阿斯顿大学能源与生物产品研究所) Graduate School of Information, Yonsei University(延世大学信息研究生院) Department of Computer Science, Sangmyung University(祥明大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FilterRAG和ML-FilterRAG方法,通过识别对抗性文本与清洁文本的差异特性,有效缓解PoisonedRAG攻击,实验表明其性能接近原始RAG系统。

Comments Preprint for Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25780 2026-03-30 cs.SE cs.LG 70%

A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation

裁判代理缩小了人工智能生成的科学模拟的可靠性差距

Chengshuai Yang

机构 * NextGen PlatformAI C Corp(NextGen PlatformAI C公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出裁判代理自动验证生成的科学模拟代码,将失败率从42%降至1.5%,并在12个领域中实现89%的成功率,同时引入spec.md规范格式。

Comments 36 pages, 5 figures, 22 tables, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25770 2026-03-30 cs.SE cs.AI 70%

ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation

ReCUBE:评估代码生成中仓库级上下文利用

Jiseung Hong, Benjamin G. Ascoli, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReCUBE基准测试评估LLM在代码生成中利用仓库级上下文的有效性,通过重建掩码文件并使用依赖关系和文档作为上下文,发现即使先进模型在完整上下文设置下也仅达到37.57%的通过率,而引入Caller-Centric Exploration工具包可显著提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16629 2026-03-30 cs.CV cs.AI 70%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 67%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26497 2026-03-30 cs.CR cs.SE 67%

Reentrancy Detection in the Age of LLMs

在LLM时代中的重入检测

Dalila Ressi, Alvise Spanò, Matteo Rizzo, Lorenzo Benetollo, Sabina Rossi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过构建两个基准测试,评估了12种形式化方法工具、10种机器学习模型和9种大语言模型在检测Solidity 0.8+中的重入漏洞方面的性能,结果显示大语言模型在重入检测中表现优于传统工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 67%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 67%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏