arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-12 至 2026-05-12 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 仓库级理解 9 篇

2605.08448 2026-05-12 cs.AI cs.CL 62%

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

基于大语言模型的半监督方法用于社交媒体危机数据分类

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea

机构 * Independent Researcher(独立研究者)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型引导的半监督学习在社交媒体危机数据分类中的应用,比较了VerifyMatch和LLM引导的协同训练方法,发现LLM引导的协同训练在低资源环境下表现优异,同时验证了知识迁移的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03761 2026-05-12 cs.CR cs.AI 57%

You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models

你已被LaTeXpOsEd:利用大语言模型对预印本档案中的信息泄露进行系统分析

Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi

机构 * Eötvös Loránd University(埃奥瓦大学) University of Oslo(奥斯陆大学) Sztaki Technology Innovation Institute(技术创新研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文通过分析10万份arXiv提交的1.2TB源数据,揭示了预印本档案中存在大量敏感信息泄露问题,提出LaTeXpOsEd框架结合模式匹配、逻辑过滤和大语言模型检测隐藏披露,揭露了PII泄露、GPS标记文件等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 57%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08435 2026-05-12 cs.SE 57%

A Dataset of Agentic AI Coding Tool Configurations

一种代理AI编码工具配置数据集

Matthias Galster, Seyedmoein Mohsenimofidi, Levi Böhme, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出一个包含40585个开源仓库的AI编码工具配置数据集,涵盖5种工具和8种配置机制,用于研究上下文工程、AI工具采用模式和人机协作。

Comments 9 pages, 8 figures, 2 tables, Proceedings of the 3rd ACM/IEEE International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10881 2026-05-12 astro-ph.HE astro-ph.GA 50%

Characterizing Pulsar Distances Using HI Kinematics

利用HI动力学特征表征脉冲星距离

S. Romero-Ruiz, S. K. Ocker

专题命中 仓库级理解 :repository(abstract)

AI总结 本文基于HI径向速度数据,利用先进银河系旋转曲线计算66个脉冲星的动能距离,结果与已有视差测量一致,且与NE2025电子密度模型一致。

Comments 4 pages, 1 figure, published in RNAAS; dataset available at https://doi.org/10.5281/zenodo.19775798; code at https://github.com/stella-ocker/psr-HI-kinematics

Journal ref Steven Romero-Ruiz and Stella Koch Ocker 2026 Res. Notes AAS 10 109

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10423 2026-05-12 astro-ph.IM astro-ph.HE 50%

SAPLE: Swift Analysis Pipeline for Lightcurve Extraction

SAPLE:快速光度曲线提取分析流水线

Lea Marcotulli, Núria Torres-Albà

专题命中 仓库级理解 :repository(abstract)

AI总结 SAPLE是一款用于提取Swift-UVOT和Swift-XRT数据及光谱信息的半自动化流水线,提供吸收校正后的特定通量,填补了社区现有工具的空白。

Comments 9 pages, 4 Figures, 2 Tables; prepared for submission to the Open Journal of Astrophysics. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09594 2026-05-12 cs.CR 50%

Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills

相信我,导入这个:通过恶意代理技能进行依赖引导攻击

Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu

专题命中 仓库级理解 :coding agent(abstract)

AI总结 研究提出依赖引导攻击,通过恶意技能引导编码代理生成恶意包,无需修改模型或数据,展示出软件供应链中的新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08092 2026-05-12 cs.CY 50%

Million Tutoring Moves (MTM): An Open Multimodal Dataset for the Science of Tutoring

百万辅导动作(MTM):一个开放的多模态数据集用于辅导科学

René Kizilcec, Kirk Vanacore, Zhuqian Zhou, Doug Pietrzak, Jorge Dias, Haocheng Zhang, Bakhtawar Ahtisham, Joshua Marland, Rachel Slama, Justin Reich, Kenneth Koedinger

专题命中 仓库级理解 :repository(abstract)

AI总结 本文介绍MTM数据集,旨在通过大规模、可重用的多模态交互数据推动辅导科学。MTM v1包含4654份数学辅导记录,为后续更广泛的数据集奠定基础,支持研究教学过程、改进辅导实践及开发基于真实教育交互的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24934 2026-05-12 cs.RO cs.SY eess.SY 50%

TEACar: An Open-Source Autonomous Driving Platform

TEACar:一个开源的自动驾驶平台

Zhongzheng Zhang, Maxwell Ruyle, Andrew Kappes, Tyler Ruble, William Shaoul, Dana Moreno, Jack Penn, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出TEACar,一个模块化、低成本的自动驾驶测试平台,通过四层结构分离感知、计算、执行和电源子系统,提升结构刚性并简化重构。

详情

展开后加载摘要…

URL PDF HTML 收藏