Assertion Detection Large Language Model In-context Learning LoRA Fine-tuning
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(abstract);planning(abstract);分类 cs.CL
Comments In EACL 2024
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments Project: https://open-compass.github.io/T-Eval
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Technical report. 13 pages. Demo: https://speechtranslation.github.io/llm-st/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted by NeurIPS 2023 Track on Datasets and Benchmarks
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments Work in progress
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.LG
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments 6 pages, 4 figures. The video and code of LoHoRavens are available at https://cisnlp.github.io/lohoravens-webpage/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Findings of EMNLP 2023
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted by NeurIPS2023. The code and data are available at https://github.com/Leezekun/Directional-Stimulus-Prompting
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments EMNLP 2023 findings (short paper). Code: https://github.com/d223302/A-Closer-Look-To-LLM-Evaluation/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 10 pages, 3 figures
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments To appear in the Proceedings of the 14th International Conference on Computational Creativity (ICCC)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments ACL 2022
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI;planning(comments)
Comments Published in the XLLM-Reason-Plan Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025
Journal ref Proceedings of the XLLM-Reason-Plan Workshop, Conference on Language Modeling (COLM) 2025
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI;planning(comments)
Comments Accepted by ICLR 2025 Workshop on Reasoning and Planning for LLMs, 25 pages, 13 tables
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI;planning(comments)
Comments Accepted at the ICLR 2025 Workshop on Reasoning and Planning for Large Language Models
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
面向单步逆合成的化学合理性感知大语言模型训练
机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) ; Insilico Medicine Canada Inc.(英矽智能加拿大公司) ; Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)
专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。
EVADE:带弃权机制的证据验证智能诊断方法
机构 * Monash University(莫纳什大学) ; Murdoch University(默多克大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。
超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Large Language Model Department, Tencent(腾讯大语言模型部) ; University of Electronic Science and Technology of China(电子科技大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhongguancun Academy(中关村学院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。
Comments 8 tables and 6figures
基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估
机构 * Wuhan University(武汉大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract)
AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: http://mobilemem.openkg.cn/