arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2604.12064 2026-04-15 cs.CR cs.SE 57%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07061 2026-04-14 cs.AI 57%

Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning

LLMs能否感知情绪?通过提示、检索和课程学习进行情绪识别

Xinran Li, Yu Liu, Jiaqi Qiao, Xiujuan Xu

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出PRC-Emo框架,结合提示工程、示范检索和课程学习,探索LLM在对话中感知情绪的能力,实验表明在IEMOCAP和MELD数据集上达到新的SOTA性能。

Comments Accepted at AAAI 2026

Journal ref Proc. AAAI Conf. on Artificial Intelligence, Vol. 40, No. 38, pp. 31778-31786 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08851 2026-04-13 cs.CL 57%

Cross-Lingual Attention Distillation with Personality-Informed Generative Augmentation for Multilingual Personality Recognition

跨语言注意力蒸馏与基于个性引导的生成增强用于多语言个性识别

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Noriyuki Kawarazaki, Kosuke Takano

机构 * Universiti Tunku Abdul Rahman(拉曼大学) Kanagawa Institute of Technology(神奈川工科大学) Université Sorbonne Paris Nord(索邦巴黎北大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出ADAM方法,通过跨语言注意力蒸馏和基于个性引导的生成增强,提升多语言个性识别性能,实验表明CLAD在多种语言和个性特征上均优于标准BCE模型。

Comments IEEE Transactions on Cognitive and Developmental Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08947 2026-04-13 cs.AI 57%

AlphaCast: A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting

AlphaCast:一种用于交互式时间序列预测的人类智慧-大语言模型智能协同推理框架

Xiaohan Zhang, Tian Gao, Mingyue Cheng, Bokai Pan, Ze Guo, Yaguo Liu, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 AlphaCast提出一种交互驱动的代理推理框架,利用无训练大语言模型实现准确的时间序列预测,通过多阶段工作流整合上下文准备、基于推理的生成和反思评估,将预测转化为多轮自主交互过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19316 2026-04-10 cs.SE 57%

Modeling Sampling Workflows for Code Repositories

对代码仓库的采样工作流建模

Romain Lefeuvre, Maïwenn Le Goasteller, Jessie Galasso, Benoit Combemale, Quentin Perez, Houari Sahraoui

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出一种领域特定语言,用于描述复杂采样策略,以提高采样方法的可表示性和可推理性,通过统计指标验证了其在代码仓库采样中的有效性。

Journal ref MSR '26 - 23rd International Conference on Mining Software Repositories, Apr 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 57%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05168 2026-04-08 cs.AI 57%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07388 2026-04-08 cs.CL 57%

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23047 2026-04-07 cs.SE 57%

CL4SE: Benchmarking Context Learning on Software Engineering

CL4SE:软件工程中基于上下文学习的基准测试

Haichuan Hu, Quanjun Zhang, Ye Shang, Guoqing Xie, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出CL4SE基准测试,系统分类四种软件工程特定上下文类型,通过高质量数据集和五种主流LLM评估,展示上下文学习在代码生成、审查等任务中的性能提升。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 57%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02520 2026-04-06 physics.data-an cs.LG 57%

Neural posterior estimation for scalable and accurate inverse parameter inference in Li-ion batteries

用于锂离子电池可扩展和准确逆参数推断的神经后验估计

Malik Hassanaly, Corey R. Randall, Peter J. Weddle, Paul J. Gasper, Conlain Kelly, Tanvir R. Tanim, Kandler Smith

机构 * Computational Science Center, National Laboratory of the Rockies(落基山国家实验室计算科学中心) Energy Conversion and Storage Systems Center, National Laboratory of the Rockies(落基山国家实验室能量转换与存储系统中心) Energy Storage Research and Analysis Department, Idaho National Laboratory(爱达荷国家实验室储能研究与分析部)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出神经后验估计方法,用于高效估计锂离子电池参数,尽管在高维情况下计算成本较高,但能提供更准确的参数校准,并在电压预测中存在误差,同时具有更高的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01588 2026-04-03 cs.AI 57%

NED-Tree: Bridging the Semantic Gap with Nonlinear Element Decomposition Tree for LLM Nonlinear Optimization Modeling

NED-Tree: 通过非线性元素分解树弥合语义鸿沟以实现LLM非线性优化建模

Zhijing Hu, Yufan Deng, Haoyang Liu, Changjun Fan

机构 * College of System Engineering, National University of Defense Technology(国防科技大学系统工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出NED-Tree框架,通过句级提取策略和递归树结构解决LLM在非线性优化建模中的语义鸿沟问题,实验显示其在10个基准测试中达到72.51%的平均准确率。

Comments 17 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 57%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00079 2026-04-02 cs.CR cs.SE 57%

When Labels Are Scarce: A Systematic Mapping of Label-Efficient Code Vulnerability Detection

当标签稀缺时:一种系统性地映射标签高效代码漏洞检测方法

Noor Khalal, Chakib Fettal, Lazhar Labiod, Mohamed Nadif

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 本文系统性地映射了减少对人工标签依赖的代码漏洞检测方法,综合了五种范式家族及其机制,并提出了设计图和约束优先决策指南以指导实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26971 2026-03-31 stat.AP cs.LG 57%

Graph Attention Network-Based Detection of Autism Spectrum Disorder

基于图注意力网络的自闭症谱系障碍检测

Abigail Kelly, Ramchandra Rimal, Arpan Sainju

机构 * Middle Tennessee State University(中田纳西州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出一种基于图注意力网络的检测方法,利用fMRI数据构建功能连接矩阵,通过注意力机制识别关键连接模式,提升诊断准确性,实验结果显示在测试数据上达到88.79%的平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24359 2026-03-26 cs.SE cs.HC 57%

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估

Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24051 2026-03-26 cs.CL 57%

FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval

FinToolSyn: 一种用于金融工具使用对话数据的前向合成框架,具有动态工具检索

Caishuang Huang, Yang Qiao, Rongyu Zhang, Junjie Ye, Pu Lu, Wenxi Wu, Meng Zhou, Xiku Du, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) FiT, Tencent(腾讯FiT) Zhejiang University(浙江大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出FinToolSyn框架,通过动态工具检索生成高质量金融对话数据,构建43,066个工具库并合成148k对话实例,提升金融场景下的工具调用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20352 2026-03-24 cs.LG 57%

The Multiverse of Time Series Machine Learning: an Archive for Multivariate Time Series Classification

时间序列机器学习的多元宇宙:一个用于多变量时间序列分类的档案

Matthew Middlehurst, Aiden Rushbrooke, Ali Ismail-Fawaz, Maxime Devanne, Germain Forestier, Angus Dempster, Geoffrey I. Webb, Christopher Holder, Anthony Bagnall

机构 * University of Bradford(布拉德福德大学) University of East Anglia(东安格利亚大学) Université de Haute-Alsace(阿尔萨斯大学) Monash University(莫纳什大学) University of Southampton(南安普顿大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文扩展了UEA档案,增加至133个分类问题,并发布预处理数据集,更名为Multiverse档案以反映多样性。提供指导和基准评估,建立未来研究的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18173 2026-03-20 cs.CL 57%

GRAFITE: Generative Regression Analysis Framework for Issue Tracking and Evaluation

GRAFITE:用于问题跟踪和评估的生成回归分析框架

Ja Young Lee, Mírian Silva, Mohamed Nasr, Shonda Witherspoon, Enzo Bozzani, Veronique Demers, Radha Ratnaparkhi, Hui Wu, Sara Rosenthal

机构 * IBM Research - AI(IBM人工智能研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 GRAFITE通过持续评估平台追踪和评估模型问题,利用LLM作为裁判进行质量测试,支持多模型对比和回归检测。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-03-19 cs.AI 57%

AI Scientist via Synthetic Task Scaling

通过合成任务扩展实现AI科学家

Ziyang Cai, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11808 2026-03-18 cs.AI 57%

Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction

通过大规模开源代理仓库挖掘实现技能自动化获取:一种多代理过程知识提取框架

Shuzhen Bi, Mengsong Wu, Hao Hao, Keqian Li, Wentao Liu, Siyu Song, Hongbo Zhao, Aimin Zhou

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种多代理过程知识提取框架,通过挖掘开源仓库获取高质量代理技能,结合安全治理和评估指标实现可扩展的知识获取,提升知识转移效率40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 57%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 57%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07405 2026-03-10 cs.CL cs.CY 57%

SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations

SPOT:一个标注的法语语料库和基准,用于检测在线对话中的关键干预

Manon Berriche, Célia Nouri, Chloée Clavel, Jean-Philippe Cointet

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 SPOT通过标注法语语料库和基准,检测在线对话中的关键干预,验证了监督学习在非英语社交媒体任务中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10416 2026-03-10 cs.CV cs.AI 57%

Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction

超越端点:面向向量化的非公路网络提取的路径中心推理

Wenfei Guan, Jilin Mei, Tong Shen, Xumin Wu, Shuo Wang, Chen Min, Yu Hu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出MaGRoad,一种基于路径中心的非公路道路网络提取方法,通过构建大规模数据集和改进模型结构,在野外环境中实现了更鲁棒的道路提取。

Comments This revision improves clarity and consistency throughout the paper. We refine terminology to more precisely describe the vertex extraction optimization, add motivational context to the edge feature encoding section, and clarify the overall inference pipeline. We also add an Acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG 57%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07091 2026-03-10 cs.SE 57%

Exploring the Reasoning Depth of Small Language Models in Software Architecture: A Multidimensional Evaluation Framework Towards Software Engineering 2.0

探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架

Ha Vo, Nhut Tran, Khang Vo, Phat T. Tran-Truong, Son Ha

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。

Comments Accepted at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10452 2026-03-09 cs.SE 57%

UniCoR: Modality Collaboration for Robust Cross-Language Hybrid Code Retrieval

UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索

Yang Yang, Li Kuang, Jiakun Liu, Zhongxin Liu, Yingjie Xia, David Lo

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏