An Analysis of Dataset Overlap on Winograd-Style Tasks
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 pages with references, accepted at COLING 2020
Journal ref Coling2020
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 pages with references, accepted at COLING 2020
Journal ref Coling2020
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 1 figure, 4 tables. For associated code, see https://github.com/gargrohin/Counterfactuals-NLP. Accepted at Proceedings of 14th International Workshop on Semantic Evaluation (SemEval-2020)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 51 pages
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2019
粒度差距:Gemini 模型中谄媚行为的多维纵向审计
机构 * Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI
AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。
Comments v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables. Itemized changelog and code: https://github.com/pskeough/The-Granularity-Gap
多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。
Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval
M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan(复旦大学未来信息技术学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI
AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。
Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning
更小的模型,更聪明的奖励:一种双面方法来处理和结果奖励
机构 * University of California, Irvine(加州大学尔湾分校) ; SAP Lab(SAP实验室) ; Stanford Human-Centered AI Institution(斯坦福人本AI机构)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 本文提出了一种双面方法,利用小型语言模型生成高质量代码,通过融合过程和结果奖励,提升了代码生成的搜索能力。
Comments Accepted and presented at NeurIPS 2025 Workshop: Foundations of Reasoning in Language Models
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.LG
Comments Accepted to the 4th workshop on mathematical reasoning and AI at NeurIPS 2024
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.LG
Comments To appear at CVPR 2024 Multimodal Algorithmic Reasoning (MAR) Workshop. 10 pages, 5 figures
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG;reasoning(comments)
Comments ICML 2019 Workshop on Learning and Reasoning with Graph-Structured Data. The data set is accessible from https://github.com/IBM/IPC-graph-data
Riemann-Bench: 面向登月级数学的基准测试
机构 * Surge AI
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI;logical reasoning(comments)
AI总结 提出Riemann-Bench基准,由专家设计研究级数学问题,评估AI系统超越奥数水平的推理能力,结果显示前沿模型得分低于10%。
Comments Accepted to Logical Reasoning of Large Language Models, ICLR 2026
TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击
机构 * University of Electronic Science and Technology of China(电子科技大学) ; East China Normal University(华东师范大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。
Comments 8 pages,4 figures
PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配
机构 * Carnegie Mellon University(卡内基梅隆大学) ; RadixArk ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。
Qworld: 为LLMs设计的问题特定评估标准
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) ; Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) ; Harvard Data Science Initiative(哈佛大学数据科学计划)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。
MemFuse:基于碎片化观测的多源记忆融合
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有记忆系统多聚焦单源文本、无法处理碎片化信息的问题,提出多源记忆融合基准MemFuseBench与结构化记忆系统MemFuse,实验显示MemFuse在跨源证据融合任务上表现最优。
Comments 30 pages, 4 figures, 4 tables
SESSE:草图、扩展、排序、总结、评估——通过结构化分解的大模型作为评判者的评估
机构 * Apple(苹果公司)
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对大模型作为评判者评估无法分离质量维度等问题,提出无需训练的SESSE框架,在RewardBench上实现与基线近乎相当的性能,且可提供可解释的审计跟踪。
DeepTCM1.0:基于通用大语言模型的用于解析中药复方机制的多专家智能体
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建基于DeepSeek V3.2的多专家智能体框架DeepTCM1.0,以桂枝汤为案例,结合中医理论与现代科学解析中药复方机制,通过多维度评估验证框架性能。
何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循
机构 * University of Tübingen(蒂宾根大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。
Comments Accepted at COLM 2026
TokEval:一个分词器评估套件
机构 * EPFL(洛桑联邦理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。
Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals
可解释的人类,陌生的大语言模型:对评估响应中潜在结构的专家分析
机构 * Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究结合探索性因子分析与学科专家盲审,发现6个LLMs的评估响应潜在因子与人类认知结构的可解释性存在显著差异,多数LLM因子无法被人类专家解读,揭示其机制与人类推理不同。
Comments Accepted for publication at AIME 2026
大语言模型能否以具有法律意义的方式进行推理?针对欧洲人权法院案件的小规模研究
机构 * University of Copenhagen(哥本哈根大学) ; Faculty of Law, University of Copenhagen(哥本哈根大学法学院) ; Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究以欧洲人权法院案件为测试平台,评估OpenAI GPT 5.4的法律推理表现,发现其推理质量不足、LLM评估不可替代人工,且专家提示未提升预测准确率。
Comments 24 pages, 4 figures, 4 tables, Submitted to AI4LAW Workshop at ICML 2026
将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。
基于时间序列的LLM作为裁判
机构 * BITS Pilani(比拉理工学院皮拉尼校区) ; KIIT(KIIT大学) ; Birla AI Labs(比拉人工智能实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了在无参考情况下,利用大语言模型作为生成和评估时间序列解释的工具,通过构造合成基准测试,评估模型在生成解释、相对排序、独立评分和多异常检测任务中的表现,发现评估任务比生成任务更稳定。
Comments Accepted at ICML FMSD
评估工具对人类和大语言模型(LLMs)是否测量相同的内容?潜在结构分析
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过探索性因子分析等方法,发现高中化学和大学入学考试定量推理部分的评估,对人类与六个多模态LLMs测量的潜在结构存在系统性差异,质疑了此类评估用于推断AI能力的效度。
Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统
机构 * Handoff AI Research(汉德夫人工智能研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。
Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai
RamseyGadgets:面向大语言模型(LLMs)的图构造数据集
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出新型图构造数据集RamseyGadgets,评估5个开源LLMs在其70个拉姆齐良图问题上的表现,发现LLMs在困难问题上准确率仅37.70%,Gemma-4-31B性能最优,还可用于确定提升LLMs表现的提示类型。
通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰
机构 * Peking University(北京大学) ; Weixin Al, Tencent Inc(腾讯公司微信智能)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。