ArchiveGPT: A human-centered evaluation of using a vision language model for image cataloguing
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
Comments 56 pages, 7 figures
Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
Comments 56 pages, 7 figures
Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)
VIVID:面向越南NLP中比喻语言差距的文化基准测试集
专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.LG
AI总结 研究团队构建了首个越南文化比喻语言基准VIVID,评估发现越南专用NLP模型远弱于多语言系统,顶尖模型得分不足满分50%,少样本提示未必提升性能,VIVID为相关研究提供关键工具。
Comments LREC 2026
Prithvi-Precip:将卫星观测数据整合进大气AI基础模型用于降水预报
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本研究基于Prithvi-WxC基础模型开发Prithvi-Precip,通过采用卫星降水训练目标、直接同化卫星观测数据及自回归滚动训练,大幅提升了中期降水预报精度,优于Goddard地球观测系统。
RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院)
专题命中 评测与基准 :language model(title,abstract)
AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。
HumanCLAW:视觉-语言模型能否通过实体身体执行动作
机构 * Meta ; Nanyang Technological University(南洋理工大学) ; University of Washington(华盛顿大学) ; Brown University(布朗大学) ; Northwestern University(西北大学)
专题命中 评测与基准 :language model(title,abstract)
AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。
Comments Project page: https://human-claw.github.io/
阿拉伯语伊斯兰问答中幻觉检测与可信答案恢复
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究针对阿拉伯语伊斯兰问答场景,基于微调后的google/gemma-4-12B-it模型构建系统,实现了幻觉检测与可信答案选择的两步任务,在公开数据集上取得了优异性能。
UrbanAgent:面向跨系统城市任务的工具增强型智能体
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。
安全优先的Text-to-Terraform评估:针对安全基础设施即代码生成的大语言模型(LLMs)与小型语言模型(SLMs)基准测试
专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI
AI总结 该研究针对7款LLMs与SLMs开展Terraform生成基准测试,发现IaC的语法有效性与安全合规性正交,仅靠提示工程不足,自动化多工具扫描是必要补充。
Comments 10 pages, 1 figure, and 9 tables. The benchmark artifacts and CI/CD pipeline are publicly available at https://gitlab.com/repo-anon-iac/repo-anon-9ac. Accepted for publication at SBSeg 2026
指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。
Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction
AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导
专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)
AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。
Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures
ChartAnno:评估多模态大语言模型的图表标注生成能力
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。
CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。
用于检测和去毒化韩语毒性内容的混淆规则
机构 * Yonsei University(延世大学)
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出KOTOX数据集,通过定义基于语言学的韩语混淆规则和变换框架,支持对混淆毒性文本的去混淆与去毒化,首次同时实现韩语混淆毒性检测与净化。
Comments 28 pages, 12 figures, 26 tables
通过多级标注者建模提高评估的可重复性
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Google Research(谷歌研究)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。
不要走线:边界引导用于过滤生成
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。
Comments Accepted at ICML 2026
世界杯竞技场:前沿大语言模型在实时赛事上的前瞻性、无泄露评估
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究构建世界杯竞技场基准,在2026世界杯期间让6个前沿LLMs实时预测,发现其平均准确率63.9%,无明显差异,将相关数据和代码作为基准发布。
Comments Project page: https://co-minder.github.io/worldcup2026
通过对比激活加法实现Qwen3的跨期偏好调控
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。
像素上的模式:测量多模态代码生成中的模式完成偏差
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。
Comments 41st IEEE/ACM International Conference on Automated Software Engineering
LiveEvalBench:面向网页生成的开放世界评估
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察
用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。
Comments Submitted to EMNLP 2026
MMLongBench-Doc-V2:MMLongBench-Doc的修正标注、语义感知修订版
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对MMLongBench-Doc基准的标注错误等问题,推出MMLongBench-Doc-V2,修正106个标注、调整评估方式,移除错误文件名和重复问题,形成不可与V1分数对比的新基准。
VeriTrace:类人时间探索完成智能体动作空间
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 VeriTrace是一种多智能体系统,通过赋予Inspector智能体完整调试动作空间实现类人时间探索,在VerilogEval-V2基准测试上首次达到100% Pass@1,准确率较最强复现基线提升5.1%。
Comments ICLAD 2026, Long Oral
ISEE:数据库字段的交互式语义丰富
机构 * Purdue University(普渡大学) ; Adobe(奥多比公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。
基准测试无法衡量的:论自主智能体弃权能力的评估
机构 * Brown University(布朗大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。
Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper
SPEAR: 代码增强的智能体提示优化
机构 * LinkedIn Corporation(领英公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。
Comments 19 pages, 3 figures, EMNLP 2026 submission
超越模拟:20000次真实对话揭示心理健康AI安全
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。
Comments 43 pages, 8 figures
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
Journal ref Nat Commun 17, 6391 (2026)
隐藏状态中隐藏的状态:大型语言模型的隐藏状态中出现隐式离散状态表示
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究探索LLMs的符号计算能力,发现其隐藏状态中存在隐式离散状态表示(IDSRs),最强模型可直接计算最多15个加数的求和,但当前开源模型的IDSRs存在损耗会导致输出错误。
Comments 12 pages, 12 figures. Revised manuscript with public code and reproducibility artifacts; clarified the evaluation protocol; corrected figure labels and chance baselines, the attention-bridge description, cross-references, and probe notation. No new experiments
我们一定漏掉了这条注释:检测和修复 Linux 内核注释中的过时函数引用
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 针对 Linux 内核注释中因函数变更导致的过时引用问题,提出三阶段方法 ReCite 检测并修复此类引用,在 v6.18-rc1 上检测到 869 个过时引用,其修复建议准确率高,提交的 75 个补丁中有 50 个被接受。
Comments Accepted at ASE 2026
自进化编码智能体
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。