AutoTrainess: Teaching Language Models to Improve Language Models Autonomously
AutoTrainess: 教语言模型自主改进语言模型
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AutoTrainess: 教语言模型自主改进语言模型
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。
HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论
机构 * LRE ; EPITA ; EPITECH ; Bpifrance ; CJM
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。
Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain
一种语义层中介的智能体,用于异构企业数据库的自然语言到SQL转换
机构 * DAQUV Corp.(DAQUV公司) ; Chungbuk National University(忠北大学) ; BigDataLabs, Co., Ltd.(BigDataLabs有限公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出一种通过语义层中介的NL2SQL智能体,利用语义模型查询(SMQ)解耦语义与物理SQL,在Spider2-snow基准上达到94.15%执行准确率,排名第三。
Comments Submitted to FITAT 2026 for peer review
法律中的多智能体审议研究
机构 * Bernoulli Institute of Mathematics, Computer Science and Artificial Intelligence, University of Groningen(格罗宁根大学伯努利数学、计算机科学与人工智能研究所) ; Department of Legal Theory, Jagiellonian University(雅盖隆大学法律理论系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究基于大语言模型的多智能体审议方法在法律推理任务中的应用,提出两种受法庭程序和论证启发的框架,实验表明其与基线模型性能相当但答案差异显著,尤其擅长需要多角度批判性思维的问题。
Comments This manuscript has been accepted for presentation at the AIDA2J Workshop during the 21st International Conference of AI & Law in Singapore, June 8 2026
OpenRCA 2.0:从结果标签到因果过程监督
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。
Comments work in progress
RigorBench: 自主AI编码代理中工程过程纪律的基准测试
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。
Comments 9 pages, 7 tables, 1 figure
智能体原生免疫系统:架构、分类与工程
机构 * Novo Ordo for AI
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。
面向编码大语言模型中隐式软件世界模型的评估
机构 * JetBrains Research(JetBrains研究)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文通过预测执行资源(峰值内存、墙钟时间、分析器输出)扩展软件世界模型评估,发现前沿模型表现有限,表明对软件执行理解不足。
Comments Accepted to DL4Code workshop at ICML 2026
MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; Khalifa University(哈利法大学) ; New York University(纽约大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。
Agent-as-a-Router: 面向编码任务的智能体模型路由
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; University of California, Berkeley(加州大学伯克利分校) ; The Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。
Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates
人工智能指数报告2026
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本报告追踪AI在推理、安全及现实任务执行方面的测试进展,分析治理框架、评估方法与技术发展之间的差距,并新增AI在科学与医学领域的独立章节。
以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类
机构 * University of Groningen(格罗宁根大学) ; University Politehnica of Bucharest(布加勒斯特理工大学) ; NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。
HarmVideoBench:大型多模态模型中有害视频理解的基准测试
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; South China Normal University(华南师范大学) ; ByteDance Inc(字节跳动公司) ; University of Zaragoza(阿拉维达大学) ; CosmosMind ; Wuhan University(武汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Southeast University(东南大学) ; Tencent(腾讯公司) ; Nankai University(南开大学) ; Supermicro Computer Inc(Supermicro计算机公司) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。
置信度感知的工具编排用于鲁棒视频理解
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。
Comments Project page: https://rova-v2.github.io/
能力前沿:基准测试遗漏了82%的模型性能
机构 * Martian ; University of Oxford(牛津大学) ; ThoughtWorks
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。
感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。
Comments 10 pages
大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。
Comments 34 pages, 4 tables, 3 Annexes
WatchAct: 行为引导的机器人操作基准
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。
从自我未来学习:面向扩散LLM的在线自蒸馏
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑工业大学) ; Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; ELLIS Institute Tubingen(ELLIS蒂宾根研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tubingen AI Center(蒂宾根人工智能中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。
Comments Preprint
HG-Bench: 自动作业批改中多页手写答案区域定位的基准
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对自动作业批改中多页手写答案区域定位的缺失评估,提出HG-Bench基准,包含500个带层级标注的样本,并设计页面感知评估协议,揭示现有模型在步骤级定位上的能力差距。
LibEvoBench:探测代码生成模型中的时间知识分层
机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) ; JetBrains Research, Amsterdam, Netherlands(JetBrains研究)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。
Comments Accepted at the DL4Code workshop at ICML 2026
面向金融欺诈检测的多流时序融合
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 提出多流欺诈Transformer(MSFT),通过独立编码交易、登录、风险等多事件流并融合表示,在千万用户数据集上AUROC达0.996,优于单流Transformer和XGBoost。
Comments 10 pages, 5 figures, 6 tables
SciRisk-Bench:面向AI4Science安全的风险维度感知基准
机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) ; School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) ; Zhongguancun Academy, China(中关村学院,中国) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) ; Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) ; School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。
多轮LLM对话中NFR评估的准确性与满意度
机构 * University of Maine(缅因大学) ; University of Notre Dame(圣母大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。
Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)
SHERLOC: 代码修复智能体的结构化诊断定位
机构 * NVIDIA(英伟达) ; Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) ; TU Darmstadt(达姆施塔特工业大学) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。
EG-VQA: 基于接地时间证据的可验证视频问答基准
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Shenzhen University(深圳大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。
PETRA: 将网络文本转化为石油工程领域适应的数据集
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; Inception AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 针对石油工程检索中领域标签稀缺的问题,提出PETRA数据集和流程,通过噪声网络数据构建领域语料和合成监督信号,显著提升检索与重排序性能。
T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。
Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium
VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集
机构 * Hanoi University of Science and Technology(河内科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。
Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026
SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。