Neural Reasoning About Agents' Goals, Preferences, and Actions
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
Comments The 38th Annual AAAI Conference on Artificial Intelligence (AAAI-24)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
Comments The 38th Annual AAAI Conference on Artificial Intelligence (AAAI-24)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
Comments Accepted to the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
Comments Accepted to Findings of EMNLP 2023
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
Comments 17 pages, 3 Figures
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
Comments In Findings of EACL 2023
$π^2$:结构起源的推理数据提升大语言模型的长上下文推理能力
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出$π^2$方法,通过结构化数据生成高质量推理数据,提升大语言模型的长上下文推理能力,在四个基准测试中取得显著改进。
Comments Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
通过物联网数据预处理实现边缘AI的云端级精度
机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) ; Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) ; Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) ; Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。
使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广
机构 * University at Buffalo(布法罗大学) ; Northeastern University(东北大学) ; Clemson University(克莱姆森大学) ; The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。
Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024
REAL: 面向LLM评判的回归感知强化学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; The University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。
Comments Accepted to ICML 2026. The first two authors contributed equally
机构 * FAIR at Meta(Meta 的 FAIR)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
Comments ICML 2025
面向大语言模型复杂图推理的统一多维度基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。
Comments Under review
OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。
TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。
Comments 24 pages, 9 figures, 24 tables
长度惩罚使思维链更难被监测
专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现长度惩罚强化学习会缩短思维链推理,隐藏驱动模型答案的因素。通过训练不同目标链长度的Qwen3模型并评估,表明压缩虽能减少推理令牌、保留准确率,但降低了可监测性,揭示了压缩与可监测性的前沿关系。
开放式问答中推理的无参考评估
机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) ; Temple University(天普大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。
DREA:用于仓库级漏洞检测的解耦推理与探索代理
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。
Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables
SingGuard-NSFA:通过生成式推理和实时分类实现的可扩展智能体人工智能护栏
机构 * Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对智能体人工智能系统操作威胁,提出NSFA分类法构建基准套件,开发双模式方法,发布四个不同参数模型,在基准测试和跨源评估中表现出色,证明方法可扩展性与通用性。
当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。
TerraLogic:地球观测中分层地理空间推理的基准
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Technical University of Munich(慕尼黑工业大学)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract)
AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。
Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic
大语言模型在经济因果推理中的意识形态偏见
机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) ; College of Business, KAIST(韩国科学技术院商学院) ; School of Computing, KAIST(韩国科学技术院计算机学院) ; Division of Social Science, HKUST(香港科技大学社会科学系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。
Comments Accepted at COLM 2026
因果DS:数据科学智能体中的因果推理基准测试
机构 * Department of Statistics University of Michigan(统计学系密歇根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。
Comments 55 pages, 10 figures
通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; University of Sydney(悉尼大学) ; Nanjing University(南京大学) ; University of Oxford(牛津大学) ; The University of Science and Technology of China(中国科学技术大学) ; Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。
追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示
机构 * Columbia University(哥伦比亚大学)
专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。
SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架
机构 * University of Science and Technology of China(中国科学技术大学) ; King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Vast Intelligence Lab(旷视智能实验室)
专题命中 推理评测 :reasoning(title,abstract);verifier(abstract)
AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。
Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard
MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) ; Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。
表示至关重要:LLM 漏洞推理中程序表示的实证研究
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 通过 RepBench 基准比较原始源码与基于静态分析的程序表示,发现 AST+PDG 组合准确率达 83.2%,远超原始源码的 53.5%,表明精心选择的结构化表示能提供更优的准确率-开销权衡。
Comments 34 pages, 4 figures
TopBench:表格问答中隐式预测推理的基准
机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) ; National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。