Self-Evolving Coding Agents
自进化编码智能体
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
自进化编码智能体
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
利用推断的变形关系评估UI组件测试套件中的行为验证
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。
用于空间可重构天线的人工智能:可移动、流体及捏合天线系统
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本综述针对可移动、流体、捏合三类空间可重构天线系统,梳理了深度学习等各类AI技术的应用,探讨了相关开放挑战与未来方向。
Comments 30 pages, 7 figures, submitted to IEEE COMST
MIEScore:面向多源图像编辑的人类对齐评估方法
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。
将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。
多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。
InteracVid:基于直播聊天视频构建真实交互式视听响应数据集
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。
CodeStylist:面向早期本科编程学习者的课程感知代码风格反馈支持工具
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究开发了支持课程特定标准的CodeStylist工具,用于为早期本科编程学习者提供本地化代码风格反馈,专家评审显示其有应用前景但存在信任度不足等问题,需优化工具设计。
Comments 9 pages, 1 table, 1 figure, accepted for publication at Frontiers in Education 2026
结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。
Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653
困惑度能否作为代码可理解性的认知信号?
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。
有状态协作智能体防御大型语言模型抵御演进式多轮攻击
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。
SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。
Comments Accepted by KDD 2026. 12 pages, 6 figures
FESOM2-JAX v1.0:适配GPU的海冰-海洋模型FESOM2的可微镜像版本
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 FESOM2-JAX v1.0是FESOM2基于JAX的可微GPU版本,与原Fortran版本结果一致,具备端到端可微性,是首个CMIP级非结构化网格可微全球海冰-海洋模型。
CWEEP:用于CWE早期预防的词法静态分析框架
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 CWEEP是一种用于RTL安全弱点检测的静态分析框架,无需详细安全规范即可在RTL开发早期使用,能定位漏洞并提供修复建议,在3874个有漏洞模块数据集上的正确警告率达60.8%,远优于同类工具。
Comments 12 pages, 9 figures
多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。
Comments 10 pages, 4 figures, conference
用于小样本遥感场景分类的局部一致直推式信息最大化
机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)
专题命中 评测与基准 :language model(abstract);foundation model(abstract)
AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。
Comments Accepted at ECCVW2026
使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。
Comments 17 pages, 9 figures, 4 tables, submitted to a conference
AI 奉承与决策
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究通过1500名参与者的30项决策实验,发现奉承式AI建议平均使选择去极化,虽奉承程度会削弱该效应,且市场力量不会引发更大极化效应,缓解了相关担忧。
安全漏洞报告自动识别技术的对比分析
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文对比分析了逻辑回归、SetFit等多种安全漏洞报告自动识别技术,发现SetFit整体性能最优,GPT-5.2表现较差,迁移学习对不同数据量项目的性能影响存在差异。
LoMeVQA:纵向医学视觉问答综合基准
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。
Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
基于人工智能的评分系统低估了语言薄弱学生在物理解释中的概念理解能力
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究发现,所有AI评分方法均存在低估语言薄弱学生物理解释中概念理解的语言偏见,类似物理教师的相关偏见,多语言学习者受影响最大。
Comments Shared lead authorship
当知识发生变化时:面向RAG系统的变异体态测试
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。
Comments ASE 2026
跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度
专题命中 评测与基准 :LLM(abstract);prompting(abstract)
AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。
ChatGPT评估已发表期刊文章质量(从PDF、标题或摘要)是否与个人评审员一样可靠?
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究比较ChatGPT-5.4与个人评审员对期刊文章质量评分,用专家评分作参照,涉及从标题/摘要及PDF输入的评分。结果显示与专家评分相关性大多为正,ChatGPT-5.4对PDF评估更详但评分预测未改善,其深入评论有误导性。
SONG:用于基准测试社会导航的逼真3D高斯模拟平台
机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究针对社会导航模拟平台不足的问题,介绍了基于3D高斯点云渲染的SONG平台,利用其进行场景和化身表示等,还策划了SONG-Bench及评估套件,通过评估发现相关问题,证明微调数据可提高现实环境成功率,为研究提供测试平台。
HiEviDR-Bench:深度研究中分层证据聚合的基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。
Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io
CHaystack:中文文档检索与视觉问答基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。
CORE:一种用于电子商务搜索的统一级联序数相关性估计框架
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对电商搜索中排名相关性问题,提出统一级联二元分类框架,将相关性估计转为顺序决策过程。框架适用于大语言模型和在线BERT模型,经实验验证能显著提升相关性性能,降低在线坏例率,表明分层建模对相关性估计有效。
Comments 11 pages, 5 figures
欺诈性人工智能生成的回复对软件工程调查的影响
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究软件工程调查中欺诈性或人工智能辅助回复对结果有效性的影响,通过对四个数据集二次分析,用人工识别、自动检测等方法,发现人工智能辅助参与因分析类型不同影响有别,强调多种验证程序结合的重要性。