C++ Templates as Partial Evaluation
专题命中 代码评测 :code generation(abstract);分类 cs.PL
Comments 13 pages
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码评测 :code generation(abstract);分类 cs.PL
Comments 13 pages
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 代码评测 :分类 cs.SE、cs.CL、cs.AI;repository(comments)
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
现代智能系统中的自我改进:一项综述
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; University of Alberta(阿尔伯塔大学) ; The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。
Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents
组件消融用于高效混合语言模型架构:性能、鲁棒性和压缩影响
机构 * Doctoral Program in Computer Science, University of Valencia(瓦伦西亚大学计算机科学博士项目)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 本文通过组件消融研究混合语言模型,发现注意力机制与替代序列处理路径对性能有显著影响,揭示了模型鲁棒性与压缩优化的关键因素。
Comments 25 pages, 7 figures, 6 tables; revised title, abstract, figures, and data/code repository URL
涌现性失调中的人格模型崩溃
机构 * TELUS Digital Research Hub(TELUS数字研究中心) ; Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) ; Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) ; University of São Paulo(圣保罗大学)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 提出人格模型崩溃假说,通过道德易感性(S)和道德稳健性(R)两个指标,证明在有害数据上微调大语言模型会导致模型模拟、区分和维持一致角色的内部能力恶化,从而引发涌现性失调。
Comments 23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL
在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分
机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) ; Oslo Metropolitan University(奥斯陆 Metropolitan 大学) ; University of Oslo(奥斯陆大学) ; Simula Research Laboratory(Simula 研究实验室) ; Norwegian Directorate of Health(挪威健康 Directorate)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。
Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit
通用端到端工具使用强化学习与合成CodeGym
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。
Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym
大模型能帮你清理数据吗?基于大模型的应用级数据准备综述
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xiaohongshu Inc.(小红书公司) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。
Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm
机构 * University of Chile(智利大学) ; CENIA ; Faculty of mathematics UC(数学学院 UC) ; IMC UC
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
Comments 32 pages, 12 figures, repository available
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
Comments To appear in NeurIPS 2025. Welcome your submission to challenge our leaderboard at: https://code4db.github.io/parrot-bench/. Also visit our code repository at: https://github.com/weAIDB/PARROT
机构 * Computer Engineering Department, Sharif University of Technology(谢里夫理工大学计算机工程系) ; Iran University of Science and Technology(伊朗科学技术大学) ; Qatar Computing Research Institute(卡塔尔计算研究院)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
Comments 50 main pages, 30 pages appendix, 21 figures, 8 tables, GitHub Repository: https://github.com/llm-lab-org/Generative-AI-for-Character-Animation-Survey
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
Comments Journal of Open Source Software; LangFair repository: https://github.com/cvs-health/langfair
Journal ref Journal of Open Source Software, 10(105), 7570 (2025)
专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)
Comments Final manuscript published in Language Development Research under CC BY-NC-SA 4.0. Pre-print redistributed through arXiv with permission. Replaces corrupted PsyArXiv pre-print repository at https://psyarxiv.com/37zna
Journal ref Language Development Research, 1(1), 123-191 (2021)
几何湍流:用于股权协方差动态的测地回归危机指标——来自非洲市场的证据
专题命中 代码评测 :repository(abstract)
AI总结 该研究提出一种基于对称正定锥测地回归的几何湍流指标,可准确识别市场压力事件,其预测性能优于传统欧氏回归,对应的去风险策略能降低最大回撤。
Comments 22 pages, 8 figures
CNOT与Clifford电路的启发式及最优综合
专题命中 代码评测 :repository(abstract)
AI总结 本研究针对CNOT与Clifford电路,提出最优、A*及贪心三类综合算法,可最小化两量子比特门数量或电路深度,经基准测试性能优于现有方法,相关算法已在GitHub仓库开源。
Comments Accepted in Quantum, 6 Aug 2026
Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准
专题命中 代码评测 :code generation(abstract)
AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。
Comments 9 pages, 6 figures, work in progress
AMELI: 镧系离子的角矩阵元
专题命中 代码评测 :repository(abstract)
AI总结 提出基于Slater行列式基和Racah分类的通用框架,计算f^N组态中任意球张量算符的角矩阵元,并构建开源数据库AMELI,以精确算术消除浮点误差,替代传统半经验计算表格。
Comments v2: Abstract, introduction and conclusion rewritten to clarify the novelty and intention of this work. Added Wybourne crystal field Hamiltonians in Section IV G. Improved phase synchronization in Section V B. New Section IX "Application Examples" v3: Minor errors and typographic flaws corrected
Journal ref J. Chem. Phys. 165, 064308 (2026)
VIGIL:应对图像再上下文化中的幻觉检测
机构 * Wroclaw University of Science and Technology(沃拉茨拉夫大学科学与技术学院)
专题命中 代码评测 :repository(abstract)
AI总结 VIGIL通过细粒度分类填补多模态模型图像再上下文化中幻觉检测的空白,提出多阶段检测流程并公开资源促进透明度。
Comments 19 pages, 8 figures, 7 tables. Code and data are available at: https://github.com/mlubneuskaya/vigil and https://huggingface.co/datasets/joannaww/VIGIL
从研究问题到列:感知操作化的数据发现
专题命中 代码评测 :repository(abstract)
AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。
Comments 6 pages, 2 figures
VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线
机构 * University of Moratuwa(莫拉图瓦大学)
专题命中 代码评测 :repository(abstract)
AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。
Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg
JUNO OMILREC顶点与能量重建的八倍等效保持加速
专题命中 代码评测 :coding agent(abstract)
AI总结 本研究针对JUNO的OMILREC重建算法,通过分阶段等效保持优化实现了最高8.6倍的单线程加速,保持物理输出一致,为大型探测器似然重建加速提供了可转移模板。
Comments 7 pages, 1 figure
在不信任服务器的情况下实施密码学分布式版本控制系统访问控制
专题命中 代码评测 :repository(abstract)
AI总结 针对现有分布式VCS访问控制需中央服务器参与、写权限细粒度控制缺失的问题,提出基于ABE和ABS的DVAC方案,借助以太坊智能合约实现无中央服务器的文件粒度读写访问控制,原型开销较小且可与Git集成。
Comments Accepted manuscript. 15 pages, 7 figures. Published in Journal of Information Security and Applications, Vol. 93 (2025), Article 104103
Journal ref Journal of Information Security and Applications, 93 (2025), 104103
WaspMOT:赤眼蜂长期多目标跟踪基准
机构 * Inria(法国国家信息与自动化技术研究院) ; INRAE Institut Sophia Agrobiotech(法国国家农业生物技术研究院) ; Université Côte d'Azur(蔚蓝海岸大学) ; Indian Institute of Technology Delhi(德里印度理工学院) ; Institute of Plant Protection, Chinese Academy of Agricultural Sciences(中国农业科学院植物保护研究所)
专题命中 代码评测 :repository(abstract)
AI总结 研究针对多目标跟踪在长期身份保持评估不足的问题,引入WaspMOT基准,通过对赤眼蜂长时间跟踪构建数据集,评估五种检测跟踪方法,发现都有轨迹碎片化问题,简单拼接基线可提升性能,揭示了现有方法局限。
Journal ref AVSS 2026
Nautilus:从一个提示到即插即用的机器人学习
机构 * TU Darmstadt(图宾根大学) ; KIT(卡尔斯鲁厄理工学院) ; FZI(弗劳恩霍夫研究所) ; Robotics Institute Germany(德国机器人研究所) ; Honda Research Institute Europe(本田欧洲研究院)
专题命中 代码评测 :coding agent(abstract)
AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。
绝不向漏洞妥协:人工智能治理综合调查
专题命中 代码评测 :repository(abstract)
AI总结 针对人工智能发展带来的技术漏洞及社会风险,提出整合技术与社会维度的框架,围绕三个支柱构建,通过系统回顾识别核心挑战,给出综合研究议程,为开发可靠且符合伦理的人工智能系统提供指导。
Comments 26 pages, 3 figures, accepted by SCIS2026
一般静态时空中光的半解析轨迹分析
专题命中 代码评测 :code model(abstract)
AI总结 提出一个统一的半解析框架,通过同伦摄动法、变分迭代法和脉冲近似法研究一般静态球对称时空中的零测地线和弱场光偏折,并应用于标量毛Reissner-Nordström黑洞,比较三种方法的精度和收敛性。
Comments 23 pages
Journal ref Nucl. Phys. B 1029, 117557 (2026)
SPECS:特定进化电路合成
专题命中 代码评测 :repository(abstract)
AI总结 提出用于自动模拟电路合成的SPECS遗传算法,借鉴NEAT原理,重新制定基因组表示并调整遗传算子,纳入布线约束和物种形成,在计算电路合成任务中,其解决方案质量和可靠性优于基准方法。
智能体技能安全:威胁模型、攻击、防御与评估
专题命中 代码评测 :repository(abstract)
AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。
全景场景分析:从畸变感知工程到球面原生基础建模的综述
机构 * University of Liverpool(利物浦大学) ; Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 代码评测 :repository(abstract)
AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。
零设置量子电路模拟器的基准测试
专题命中 代码评测 :repository(abstract)
AI总结 该研究对GPU加速的MPS和PPS量子模拟方法进行基准测试,比较多个工具,发现MPS中GPU运行时随键维度次二次缩放,PPS中GPU在特定基准测试下加速显著且能达高精度,还提供模拟器特征描述及代码配置仓库。
Comments 12 pages, 12 figures