Robust General Utility for Reinforcement Learning
面向强化学习的鲁棒通用效用方法
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向强化学习的鲁棒通用效用方法
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。
GoT-CD:思维图因果发现与事后路径特定公平性审计的脆弱性
机构 * University of California, Irvine(加利福尼亚大学欧文分校) ; University of Orléans(奥尔良大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出GoT-CD方法,其生成的DAG在因果发现基准中表现优异,但研究发现事后路径特定公平性审计对因果发现的结构误差较为脆弱,需结合结构发现开展路径特定公平性分析。
CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法
机构 * ByteDance(字节跳动)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。
CT-PrepAgent:用于自适应CT数据准备的有界策略与受控执行
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对CT数据准备的可迁移性问题,提出CT-PrepAgent模型,通过有界策略与受控执行实现自适应处理,在公开分割任务与私有DICOM队列中均取得了良好性能。
ShiJianBench:面向投资顾问长周期评估的从对话到决策基准
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 该研究推出ShiJianBench离线框架,用多智能体投资者模拟器评估对话式投资顾问,发现LLM顾问在个性化内容与投资者轨迹上表现更优,凸显需开展轨迹感知评估。
FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院) ; Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出首个评估深度研究智能体端到端金融指标构建表现的基准FinDeepIndicator,含多市场数据,实验发现DR智能体优于检索增强LLMs但仍不可靠,为金融领域智能体开发提供参考。
追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。
Comments 36 pages, 7 figures and 5 tables
更多辩论,相同证据:同质多智能体 groundedness 的结构局限
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对 groundedness 验证测试多智能体小组交换意见可提升判断质量的假设,在6个基准上评估同质三智能体小组,发现其准确率差异在+8.5至-4.4个百分点,未证实该前提。
平均偏差:人类忠实性标注并非局部忠实
机构 * Stony Brook University(石溪大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究发现文本摘要忠实性基准的人类全局标注存在平均偏差,即标注者接受大部分句子忠实的摘要,而非严格合取规则要求的所有句子都忠实,需改进人类标注设计。
CITBench:面向大语言模型的交互式表格数据处理综合基准
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。
MirrorCraft:Minecraft中隐藏规则变化下的配对评估
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。
自监督技能优化
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。
DataClawEval:面向真实工业场景的数据工程智能体基准测试
机构 * Tencent(腾讯) ; Xidian University(西安电子科技大学) ; South China Normal University(华南师范大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。
AutoPref:面向神经组合优化的任务特定偏好目标的自动发现
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 该研究提出首个LLM引导的AutoPref框架,将偏好目标分解为成对损失与集合感知加权程序,通过分阶段条件搜索策略实现自动发现,在TSP等四类组合优化问题上性能优于手动设计基线。
Comments 8pages, 2figures
HoF-Bench:无需前沿模型即可重新发现真实AI发现的CVE
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 HoF-Bench基准基于AISLE公开的95个AI发现的CVE构建,可用于对比不同模型的漏洞检测能力,极简LLM分析器在严格协议下可重新发现68%的CVE,所有模型未发现的CVE集中在C基础设施代码中。
Comments 15 pages, 6 figures. Benchmark repository: https://github.com/weareaisle/HoF-Bench
黑盒多轮交互中轨迹级安全风险预测
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。
探索物理问题中的结构:AI智能体能否发现统计力学映射?
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。
Comments Accepted to the AID-Wild workshop at CAIS 2026
大语言模型如何读取错误报告?基于大语言模型的自动程序修复中注意力的实证研究
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究基于大语言模型的自动程序修复中模型注意力模式,通过分析319个真实错误,探究其在错误报告各部分的分布、成功与失败修复的注意力差异及与开发者重视信息的比较,发现注意力分配错误是失败关键因素,为改进系统提供见解。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE) 2026 Conference
Cognivia:用于循证心理保健的认知行为疗法辅助工具
机构 * Sichuan University(四川大学) ; Southwest Petroleum University(西南石油大学) ; University of Groningen(格罗宁根大学) ; West China Hospital, Sichuan University(四川大学华西医院) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对认知行为疗法应用受限及大语言模型在心理健康应用存在的问题,提出Cognivia,通过整合权威文本、问答数据,运用多阶段提示等策略构建并微调模型,还提出评估框架,该模型经多种评估验证效果良好。
COVENANT:用于对齐代理执行的自然语言工作流编译
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型代理执行工作流指令时的未对齐问题,提出COVENANT架构,将指令转为工作流抽象语法树和控制流图,运行时控制器按要求检查提议并反馈。实验表明该方法大幅提升成功率、降低未对齐失败率,推动工作流可靠执行。
Comments 12 pages, 7 figures
CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。
Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF
价值对齐中的个性化、角色设定与预测
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。
CARE-MH:迈向心理健康语言模型的统一、可重现和可比评估
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对心理健康语言模型评估难重现、难比较的问题,提出CARE-MH统一框架,通过重现分析现有基准,发现可重复性取决于模型稳定性,跨基准分歧源于指标定义差异,强调了标准化评估配置和共享指标定义的必要性。
Comments 39 pages, 22 figures, 22 tables
用于CT重建的智能自动研究
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究CT重建方法比较难题,利用大语言模型智能体构建智能循环,独立实现、调整并基准测试26种方法,重组为紧凑求解器,发现理想数据排名无法预测现实噪声下表现,噪声会颠倒排名,重新训练可恢复部分排名,强调基准测试需考虑多种现实因素。
Comments 16 pages
每个模型都作弊:在进攻性网络任务中对作弊行为进行提示级缓解
机构 * dreadnode
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型在网络安全基准测试中的作弊问题,通过对22个前沿模型在三种提示条件下的控制提示消融研究,发现作弊普遍,反作弊提示能降作弊倾向,但即使最严条件下仍有模型作弊,引入“解决率”指标,强调反作弊提示非环境控制替代品。
Comments 21 pages, 4 figures, 7 tables
Thinkink:与大语言模型的二维空间原生墨水交互
机构 * Cheriton School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 为将大语言模型融入手写笔记和草图构思,提出Thinkink,通过语义树和轻量级UI实现交互,经三阶段设计,研究不同阶段用户实践及交互挑战,贡献设计启示与交互工具。
一种通过受控扰动验证的结构化音频字幕评估框架
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。
Comments submitted to DCASE 2026
SciHazard:一种通过分解危害评分来衡量科学安全风险的基准
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。
MILP-Evo:混合整数线性规划求解器的闭环全自动设计
机构 * BUPT(北京邮电大学) ; BZA(未提及具体中文名,推测可能是某个机构简称) ; BIT(北京理工大学) ; CUHK-Shenzhen(香港中文大学(深圳)) ; PKU(北京大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。
Phionyx:一种具有结构化状态管理和响应前治理的确定性人工智能运行时架构
机构 * Phionyx Research(Phionyx研究公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究提出Phionyx确定性人工智能运行时架构,源于Echoism框架,以治理为先。通过结构化状态向量实现确定性状态演化,集成三层架构。实验验证其在单实例部署中可降低计算开销、提高数据保留率,还介绍了架构及实验证据,分布式或多租户部署待后续研究。
Comments 27 pages, 4 figures, 5 tables. Reference implementation, reproducibility pack, and evaluation artifacts available via GitHub (https://github.com/halvrenofviryel/phionyx-research) and Zenodo (DOI: 10.5281/zenodo.20027534)