arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2603.29623 2026-04-01 cs.SE 85%

Enhancing LLM-Based Bug Reproduction for Android Apps via Pre-Assessment of Visual Effects

通过预评估视觉效果增强基于LLM的Android应用Bug重现

Xiangyang Xiao, Huaxun Huang, Rongxin Wu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LTGDroid,通过执行所有可能的UI操作并记录视觉效果,指导LLM选择重现bug的UI操作,提升Android应用bug重现的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29273 2026-04-01 cs.HC 85%

Customer Analysis and Text Generation for Small Retail Stores Using LLM-Generated Marketing Presence

利用大语言模型生成营销存在的小型零售店客户分析与文本生成

Shiori Nakamura, Masato Kikuchi, Tadachika Ozono

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种人机协作系统,通过模拟人物帮助小型零售店创建更高质量的点售材料,实验显示文本质量平均提升2.37分。

Comments The 17th International Conference on Smart Computing and Artificial Intelligence (SCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26898 2026-04-01 cs.CL cs.AI cs.LG 85%

Magic Words or Methodical Work? Challenging Conventional Wisdom in LLM-Based Political Text Annotation

魔术词还是方法论工作?挑战基于大语言模型的政治文本标注中的传统智慧

Lorcan McLaren, James Cross, Zuzanna Krakowska, Robin Rauner, Martijn Schoonvelde

机构 * University College Dublin(都柏林大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过控制实验检验了政治科学文本标注中模型选择、大小、学习方法和提示风格的交互影响,发现方法论主导因素影响显著,传统最佳实践在受控比较中并不稳固。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23067 2026-04-01 cs.CL cs.AI 84%

Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks

语义投票:一种无需自评的高效LLM在不可验证的开放性任务中的自我改进方法

Chunyang Jiang, Yonggang Zhang, Yiyang Cai, Chi-Min Chan, Yulong Liu, Mingming Chen, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需自评的语义投票方法,通过软匹配提升LLM在不可验证任务中的效率与性能,减少计算负担和自评偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05411 2026-04-01 cs.IR cs.AI 83%

A Systematic Framework for Enterprise Knowledge Retrieval: Leveraging LLM-Generated Metadata to Enhance RAG Systems

企业知识检索的系统框架:利用LLM生成的元数据增强RAG系统

Pranav Pushkar Mishra, Kranti Prakash Yeole, Ramyashree Keshavamurthy, Mokshit Bharat Surana, Fatemeh Sarayloo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种系统性的元数据增强框架,利用大语言模型提升RAG系统的文档检索性能,通过实验验证元数据增强对检索精度和排名质量的提升效果。

Comments Accepted to 2026 IEEE Conference on Artificial Intelligence (CAI). 8 pages, 1 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 82%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29878 2026-04-01 cs.IR cs.AI cs.DC 81%

Performance Evaluation of LLMs in Automated RDF Knowledge Graph Generation

对LLMs在自动RDF知识图谱生成中的性能评估

Ioana Ramona Martin, Tudor Cioara, Ionut Anghel, Gabriel Arcas

机构 * Distributed Systems Research Laboratory, Computer Science Department, Technical University of Cluj-Napoca(克卢日-纳波卡技术大学计算机科学系分布式系统研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了多种LLM架构和提示策略在自动RDF提取中的性能,通过控制框架和两个处理半结构化日志数据的管道,分析了Few-Shot学习在生成RDF三元组中的有效性,并揭示了不同LLM架构的局限性。

Comments submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18014 2026-04-01 cs.CL cs.LG 81%

Real-Time Trustworthiness Scoring for LLM Structured Outputs and Data Extraction

面向LLM结构化输出的实时可信度评分及数据提取

Hui Wen Goh, Jonas Mueller

机构 * Cleanlab

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CONSTRUCT,一种实时评估LLM结构化输出可信度的方法,通过评分帮助优先处理人类审核,支持复杂结构化输出,无需标注数据或定制模型部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23364 2026-04-01 cs.LG cs.AI 81%

ZeroFlood: Flood Hazard Mapping from Single-Modality SAR Using Geo-Foundation Models

ZeroFlood:基于单一模态SAR数据的洪水危险映射Geo-基础模型

Hyeongkyun Kim, Orestis Oikonomou

机构 * German Aerospace Center (DLR), Remote Sensing Technology Institute(德国航空航天中心(DLR)遥感技术研究所) ETH Zurich, Seminar for Applied Mathematics(苏黎世联邦理工学院应用数学研讨会) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ZeroFlood框架,利用Geo-Foundation Models对单一模态EO数据进行洪水危险映射,实验表明TerraMind模型在F1-score上达到88.36%,优于监督学习基线。

Comments 16th European Conference on Synthetic Aperture Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 79%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 评测与基准 :language model(title);SFT(abstract);分类 cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27942 2026-04-01 cs.CV cs.AI 79%

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

JaWildText:面向日文场景文本理解的视觉-语言模型基准测试

Koki Maeda, Naoaki Okazaki

机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29467 2026-04-01 cs.CL cs.AI 79%

M-MiniGPT4: Multilingual VLLM Alignment via Translated Data

M-MiniGPT4:通过翻译数据实现多语言VLLM对齐

Seung Hun Han, Youssef Mohamed, Mohamed Elhoseiny

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。

Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17899 2026-04-01 cs.LG cs.AI cs.NE 79%

Automated Algorithm Design for Auto-Tuning Optimizers

为自动调优优化器设计自动化算法

Floris-Jan Willemsen, Niki van Stein, Ben van Werkhoven

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型自动生成适应自动调优问题的优化算法,通过问题描述和搜索空间特征提示模型,生成、测试并迭代改进专用优化器,在六个硬件平台上评估后,展示出30.7%和14.6%的性能提升,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08917 2026-04-01 cs.HC cs.CV 78%

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

由非残障人士训练的模型:评估图像质量如何影响产品描述生成

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper

机构 * University of California, Irvine(加州大学尔湾分校) Northwestern University(西北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。

Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28914 2026-04-01 cs.SE 78%

Towards Supporting Quality Architecture Evaluation with LLM Tools

面向使用LLM工具支持质量架构评估

Rafael Capilla, Jorge Andrés Díaz-Pace, Yamid Ramírez, Jennifer Pérez, Vanessa Rodríguez-Horcajo

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文探讨利用LLM工具自动化架构评估,通过对比学生建议的质量场景与经验架构师及LLM工具的结果,发现LLM在风险分析和权衡分析中表现更优,显著降低评估工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29681 2026-04-01 cs.AI cs.HC 77%

Beyond the Steeper Curve: AI-Mediated Metacognitive Decoupling and the Limits of the Dunning-Kruger Metaphor

超越陡峭曲线:人工智能介导的元认知解耦及杜宁-克鲁格隐喻的局限

Christopher Koch

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究人工智能使用对元认知准确性的影响,提出元认知解耦模型,揭示输出、理解、校准准确性和自我评估能力间的差距,改进对过度自信等现象的解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29608 2026-04-01 cs.CL 77%

Learning Diagnostic Reasoning for Decision Support in Toxicology

学习毒理学诊断推理以支持决策

Nico Oberländer, David Bani-Harouni, Tobias Zellner, Nassir Navab, Florian Eyer, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序研究所) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心(MCML)) Department of Clinical Toxicology and Poison Control Center Munich, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院临床毒理学与毒物控制中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DeToxR,通过强化学习处理毒理学中的多标签预测,结合未结构化和结构化数据提升诊断准确性,优于基线模型和专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29142 2026-04-01 cs.AI cs.HC 77%

REFINE: Real-world Exploration of Interactive Feedback and Student Behaviour

REFINE:现实世界中交互反馈与学生行为的探索

Fares Fawzi, Seyed Parsa Neshaei, Marta Knezevic, Tanya Nazaretsky, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出REFINE系统,通过多智能体反馈机制实现高效互动反馈,提升学生参与度与反馈质量。

Comments Accepted to AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20206 2026-04-01 cs.SE cs.AI cs.CY cs.ET cs.MA 77%

Mitigating "Epistemic Debt" in Generative AI-Scaffolded Novice Programming using Metacognitive Scripts

在生成式AI辅助的初级编程中通过元认知脚本缓解‘知识债务’

Sreecharan Sankaranarayanan

机构 * Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering旗下))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究生成式AI对初级编程学习者的影响,通过实验发现未受约束的AI会导致知识债务积累,提出元认知脚本可有效缓解这一问题,提升代码可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29861 2026-04-01 cs.CL cs.AI 73%

Towards Empowering Consumers through Sentence-level Readability Scoring in German ESG Reports

通过句子级可读性评分赋能消费者在德国ESG报告中

Benjamin Josef Schüßler, Jakob Prange

机构 * University of Augsburg(奥格斯堡大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过扩展德国ESG报告的句子级数据集,评估不同可读性评分方法的准确性,发现微调的Transformer模型在预测人类可读性时误差最小。

Comments accepted to NLP4Ecology workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06837 2026-04-01 cs.MA cs.AI cs.GT 70%

AI-Generated Compromises for Coalition Formation

为联盟形成生成的AI妥协方案

Eyal Briman, Ehud Shapiro, Nimrod Talmon

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于AI生成妥协方案的联盟形成方法,结合有限理性与不确定性,利用自然语言处理技术在文本语义空间中设计算法,以促进大规模民主文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29396 2026-04-01 cs.CL 70%

Is my model perplexed for the right reason? Contrasting LLMs' Benchmark Behavior with Token-Level Perplexity

我的模型是因正确的原因而困惑吗?将LLM的基准行为与词级困惑度进行对比

Zoë Prins, Samuele Punzo, Frank Wildenburg, Giovanni Cinà, Sandro Pezzelle

机构 * College of Informatics, University of Amsterdam(阿姆斯特丹大学信息学学院) Department of Medical Informatics, Amsterdam University Medical Center(阿姆斯特丹大学医学中心医学信息学系) ILLC, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于词级困惑度的解释框架,通过对比最小句子对的困惑度分布,揭示模型在语言相关线索上的行为机制,发现重要词不完全解释困惑度变化,表明模型依赖其他启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28998 2026-04-01 cs.CR cs.AI 70%

Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems

多智能体AI系统安全操作能力评估基准的设计原则

Yicheng Cai, Mitchell John DeStefano, Guodong Dong, Pulkit Handa, Peng Liu, Tejas Singhal, Peiyu Tseng, Winston Jen White

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Cyber Security Laboratory(网络安全实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SOC-bench基准设计原则,用于评估多任务蓝队AI系统的能力,聚焦大规模勒索软件攻击事件响应中的五个蓝队任务。

Comments 29 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13570 2026-04-01 cs.LG cs.CR 70%

Privacy-Preserving Machine Learning for IoT: A Cross-Paradigm Survey and Future Roadmap

物联网中的隐私保护机器学习:跨范式综述与未来路线图

Zakia Zaman, Praveen Gauravaram, Mahbub Hassan, Sanjay Jha, Wen Hu

机构 * School of CSE, University of NSW(新南威尔士大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了物联网中隐私保护机器学习的跨范式方法,分析了隐私保障、计算复杂度、异构设备参与下的可扩展性及威胁抵御能力,并探讨了无线物联网环境中的部署限制与开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29855 2026-04-01 cs.GR 67%

PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

PosterReward: 解锁高质量图形设计生成的准确评估

Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 67%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23095 2026-04-01 cs.HC cs.CY 67%

Exploring Sidewalk Sheds in New York City through Chatbot Surveys and Human Computer Interaction

通过聊天机器人调查和人机交互探索纽约市人行道遮蔽物

Junyi Li, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过聊天机器人调查和人机交互研究纽约市人行道遮蔽物对行人可见性和通行的影响,利用AI模型分析遮蔽物设计特征,提供实证数据支持改进遮蔽物规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01228 2026-04-01 cs.CV 67%

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

面向政策适应的图像防护:基准与方法

Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tencent(腾讯) Peking University(北京大学)

专题命中 评测与基准 :language model(abstract);SFT(abstract)

AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29140 2026-04-01 cs.SE cs.AI cs.CL cs.FL 62%

Designing FSMs Specifications from Requirements with GPT 4.0

基于GPT 4.0的需求设计有限状态机规范

Omer Nguena Timo, Paul-Alexis Rodriguez, Florent Avellaneda

机构 * Université du Québec en Outaouais(魁北克大学乌塔韦校区) Université Paris-Saclay(巴黎-萨克雷大学) Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的有限状态机设计框架,通过专家中心方法修复LLM生成的FSM,并通过实验分析LLM在MDE中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏