QRAFTI: An Agentic Framework for Empirical Research in Quantitative Finance
QRAFTI:量化金融领域实证研究的代理框架
专题命中 代码生成 :code generation(abstract)
AI总结 QRAFTI框架通过整合面板数据研究工具与MCP服务器,支持对大规模金融面板数据进行因子研究,可复现已有因子、测试新信号并生成标准化报告。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
QRAFTI:量化金融领域实证研究的代理框架
专题命中 代码生成 :code generation(abstract)
AI总结 QRAFTI框架通过整合面板数据研究工具与MCP服务器,支持对大规模金融面板数据进行因子研究,可复现已有因子、测试新信号并生成标准化报告。
VerilogCL:一种用于鲁棒LLM基于Verilog生成的对比学习框架
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出VerilogCL框架,通过对比学习和主动错误筛查提升Verilog代码生成的鲁棒性,实验表明其在编译成功率和功能正确性上优于现有基线。
云原生与分布式系统用于高效可扩展的大语言模型——研究议程
专题命中 代码生成 :code generation(abstract)
AI总结 本文探讨云平台和分布式系统在支持大语言模型的可扩展性、效率和优化中的作用,分析部署复杂性及新兴趋势,提出未来研究方向。
Comments 45 pages, 5 figures
AgentClick: 一个基于技能的人机协作审查层用于终端AI代理
专题命中 代码生成 :code generation(abstract)
AI总结 AgentClick通过浏览器界面提供结构化交互,降低非专家用户与AI代理协作的门槛,提升效率和质量。
Comments Accepted to ACM CAIS 2026 System Demonstrations. Conference paper
GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。
Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge
CADMAS-CTX: 多智能体委托中的上下文能力校准
机构 * Beijing JIAOTONG University(北京交通大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出CADMAS-CTX框架,通过上下文条件后验概率实现多智能体委托中的能力校准,结合不确定性惩罚提升鲁棒性,实验表明其在GAIA和SWE-bench基准上显著优于静态方法。
HiveMind: 为并发LLM代理工作负载提供操作系统启发的调度
机构 * Sperix Labs(Sperix实验室) ; VIA Cybersecurity Lab(VIA网络安全实验室) ; KNUST(科罗纳大学) ; Quantum and Assistive Technologies Lab(量子与辅助技术实验室)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 HiveMind通过引入五个操作系统启发的调度原语,解决并发LLM代理在共享API端点时的资源竞争问题,显著降低失败率并减少浪费计算。
Workstream: 一个面向AI增强工程流程的本地优先开发者指挥中心
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 Workstream通过整合多个工具的数据,提供AI读熟度评分和审查智能分析,提升开发者工作效率和响应速度。
Comments 6 pages, 3 figures, 5 tables. Open source: https://github.com/happybhati/workstream
当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离
机构 * Sperix Labs(Sperix实验室) ; VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) ; GCTU, Ghana(加纳格茨大学) ; NCA, Ghana(加纳国家计算机学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。
分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在
机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。
Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category
普罗米修斯计划:通过反向工程可执行规范弥合代理程序修复中的意图差距
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 程序修复 :program repair(title,abstract);code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文提出普罗米修斯框架,通过规范推断而非代码生成解决代理程序修复中的意图差距问题,实现了93.97%的正确补丁率和74.4%的救援率。
DynaFix:基于执行级动态信息的迭代自动程序修复
机构 * Chongqing University(重庆大学)
专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI
AI总结 DynaFix通过迭代利用运行时动态信息改进程序修复,利用变量状态、控制流路径和调用栈等结构化提示引导LLM生成候选补丁,有效提升修复效率和准确性。
Comments 30 pages, 11 figures, preprint version
Clover:一种基于随机树-of-thoughts的神经符号代理体系用于验证RTL修复
机构 * Peking University(北京大学)
专题命中 程序修复 :program repair(abstract);coding agent(abstract);分类 cs.AI
AI总结 Clover通过结构化搜索代码操作解决RTL修复问题,结合LLM和符号求解器动态调度任务,实现高可靠性修复,修复率高达96.8%。
关于使用提交信息进行纠正性软件维护:一项系统映射研究
专题命中 程序修复 :program repair(abstract);repository(abstract);分类 cs.SE
AI总结 本文通过系统映射研究97篇2004至2025年发表的文献,探讨提交信息在纠正性维护中的应用,发现提交信息在 bug 分析和修复识别中作用显著,但其他领域如自动程序修复研究较少。
Comments Preprint. Accepted for publication at EASE 2026 (Track: Research Papers)
循环中的偏见:用于软件工程的LLM作为评判者的审计
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。
ContractEval:一个用于评估代码生成中合同满足断言的基准测试
机构 * Yonsei University(延世大学) ; University of Seoul(首尔大学)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 ContractEval通过显式陈述合同,评估生成代码是否满足合同要求,揭示当前LLM在合同满足上的不足。
Comments 18 pages, 10 figures, 11 tables
VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Alberta(阿尔伯塔大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI、cs.PL
AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。
ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Amazon AGI(亚马逊人工智慧实验室) ; NAVER Cloud(NAVER云)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。
大语言模型如何理解执行语义的鲁棒性?
机构 * University College London(伦敦大学学院)
专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究通过代码输出预测任务评估大语言模型对代码理解的鲁棒性,发现开源模型在代码变换和输入扰动下表现稳定,而前沿模型GPT-5.2表现出显著的脆弱性,且异常处理能力不足。
WebCompass:迈向多模态网络编码评估的代码语言模型
机构 * Nanjing University(南京大学) ; Kuaishou Technology(快手科技)
专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。
在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试
机构 * The University of Hong Kong, Hong Kong SAR(香港大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; University of Cambridge, United Kingdom(剑桥大学) ; Zhejiang Normal University, China(浙江师范大学) ; The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) ; The University of Queensland(昆士兰大学) ; The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。
Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026
Journal ref Journal of Chemical Theory and Computation 2026
从图表到代码:一个多模态模型的分层基准
机构 * CSU-JPG, Central South University(中南大学CSU-JPG) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。
Comments This work has been accepted by ACL 2026 Main
基于注意力机制的ResUNet用于自动胎儿头部分割
机构 * School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(计算机工程学院,KIIT大学,比哈尔邦,印度)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出Attention-ResUNet,通过残差学习与多尺度注意力机制提升胎儿头部分割精度,实验表明其在HC18数据集上Dice得分达99.30%,优于其他基线模型。
Comments Accepted and Presented at ANTIC 2025, IIITM Gwalior (5th International Conference on Advanced Network Technologies and Intelligent Computing) on 23rd December 2025. Presented with the best paper award in Image Processing Track
Alexandria:一个多领域方言阿拉伯语机器翻译数据集,用于文化包容和语言多样性的LLM
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; Canada Research Chair in NLP and ML(自然语言处理和机器学习研究主席) ; Mohammed VI Polytechnic University(穆莱·阿卜杜勒阿齐兹国王理工学院) ; Birzeit University(比尔泽特大学) ; Western Michigan University(西部密歇根大学) ; Tuwaiq Academy(图瓦伊克学院) ; King Khalid University(国王卡利德大学) ; American University of Beirut(贝鲁特美国大学) ; Ibb University(伊卜大学) ; University of Hail(海勒大学) ; University of Technology and Applied Sciences(技术与应用科学大学) ; Arab Open University(阿拉伯开放大学) ; Minia University(米尼亚大学) ; Nantes University(南特大学) ; Prince Sultan University(沙特王子大学) ; Umm Al-Qura University(乌姆·阿勒·卡拉大学) ; University of Nouakchott(努尔人大学) ; Fatabyyano(法塔比亚诺) ; Independent Researcher(独立研究者) ; Hadhramout University(哈德拉姆大学) ; Cairo University(开罗大学) ; Misurata University(米斯拉塔大学) ; Al-Balqa Applied University(巴勒斯坦应用大学) ; University of Khartoum(喀土穆大学) ; Sultan Qaboos Higher Centre for Culture and Science(穆罕默德·本·拉希德·阿勒马克图姆文化与科学高级中心) ; Arab Center for Research and Policy Studies(阿拉伯研究中心) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Institut Supérieur du Numérique(数字高级学院)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 Alexandria数据集通过多领域方言阿拉伯语对话数据,提升LLM在不同阿拉伯方言中的翻译能力,揭示现有模型在方言翻译中的挑战。
Comments Accepted to ACL 2026 Main; Project resources will be available here: https://github.com/UBC-NLP/Alexandria
HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试
机构 * Artyom Sorokin(AXXX) ; Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ; Higher School of Economics(高等经济学院) ; Kurchatov Institute(库尔斯克研究所) ; Independent Researcher(独立研究者)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。
Comments Code is available at https://github.com/stefanrer/HeroBench
迈向通过动态更新AI文档提高AI模型重用性
机构 * Hugging Face ; AI consortium
专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出通过动态更新AI文档模板,缩短AI模型卡片更新滞后时间,提升AI模型重用性。
Comments 28 pages, 16 figures, 9 tables
光适应视诱发电位和震荡电位(LEOPs)数据集用于自闭症谱系障碍和通常发育个体
机构 * Flinders University, College of Nursing and Health Sciences, Caring Futures Institute(弗林德斯大学,护理与健康科学学院,关怀未来研究所) ; The Tony Kriss Visual Electrophysiology Unit, Clinical and Academic Department of Ophthalmology, Great Ormond Street Hospital for Children NHS Trust(托尼·克里思视觉电生理单位,眼科临床与学术部门,儿童医院国家健康信托基金会) ; UCL Great Ormond Street Institute of Child Health, University College London(伦敦大学学院Great Ormond Street儿童健康研究所) ; Behavioural and Brain Sciences Unit, Population Policy and Practice Programme, UCL Great Ormond Street Institute of Child Health, University College London(行为与脑科学单位,人口政策与实践计划,伦敦大学学院Great Ormond Street儿童健康研究所) ; Visiomed.AI, Moscow, Russia(Visiomed.AI,莫斯科,俄罗斯)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG
AI总结 该数据集包含用于自闭症谱系障碍和通常发育个体的光适应视诱发电位和震荡电位波形,用于研究神经发育特征。
LLMs能否超越经典超参数优化算法?对autoresearch的研究
机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) ; University of Freiburg(弗赖堡大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Prior Labs(Prior实验室)
专题命中 仓库级理解 :repository(abstract);分类 cs.LG
AI总结 本文通过autoresearch平台比较经典HPO算法与LLM方法在优化小型语言模型超参数时的表现,发现经典方法在避免内存故障方面更优,而LLM在代码编辑能力上有所提升,但未完全超越经典方法,提出Centaur混合方法结合经典算法和LLM优势,取得最佳效果。
去噪与对齐:基于扩散的前景知识提示用于开放词汇时序动作检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China ; Institute of Information Engineering, Chinese Academy of Sciences Beijing China ; Hangzhou Dianzi University Hangzhou China ; Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Beijing China ; Engineering, Zhejiang University Hangzhou China ; Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China ; Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense ; Institute of Information Engineering, Chinese Academy of Sciences ; Hangzhou Dianzi University ; Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense ; Engineering, Zhejiang University ; Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense
专题命中 仓库级理解 :repository(abstract)
AI总结 本文提出DFAlign框架,通过扩散去噪生成前景知识,解决开放词汇时序动作检测中语义不平衡问题,提升动作相关片段的判别性。
Comments Accepted by SIGIR 2026
近正交数组:三种搜索方法
专题命中 仓库级理解 :repository(abstract)
AI总结 本文通过整数规划、局部搜索元启发式和代数方法三种方式寻找近正交数组,并展示了其在非正交性度量上的改进。
Comments 56 pages, 4 figures