Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems
主权代理循环:在现实系统中解耦AI推理与执行
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。
Comments 15 pages, 2 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
主权代理循环:在现实系统中解耦AI推理与执行
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。
Comments 15 pages, 2 figures
临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱
机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) ; Universitätsmedizin Göttingen(哥廷根大学医学中心)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。
Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included
从全文文献构建基于证据的知识库以支持疾病特定的生物医学推理
机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) ; Institute of Medicinal Biotechnology, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院药物生物技术研究所) ; Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology(浙江省生物医学智能计算技术重点实验室)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本文提出EvidenceNet,一个基于全文文献构建的疾病特定知识库,通过大语言模型提取实验支持的结构化证据记录,用于生物医学推理任务。
Comments 30 pages, 5 figures, 12 tables
机构AI中的受控推理
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本文提出Cognitive Core,通过九种类型认知原语和四层治理模型,解决机构决策中需要的AI架构问题,实现高准确率和零静默错误,引入治理性作为评估标准。
端到端对话机器人评估与自适应推理和不确定性过滤
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。
评估参数化逻辑问题上推理模型的鲁棒性
机构 * CRIL UMR 8188, Univ Artois, CNRS, France(CRIL UMR 8188,阿维尼翁大学,法国国家科学研究中心)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本文提出了一种针对2-SAT的诊断基准,用于评估推理模型在参数化逻辑问题上的鲁棒性,通过隔离不同能力与失败模式,揭示模型在结构干预下的性能变化。
TRACER:轨迹风险聚合用于代理推理中的关键事件
机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; AI Labs at Capital One(Capital One 人工智能实验室)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 TRACER通过轨迹级不确定性度量提升复杂对话工具使用中的不确定性检测精度。
AVERE: 通过偏好优化提升音频视觉情感推理
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。
Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io
DETOUR:双智能体搜索与推理的交互基准
机构 * Patronus AI ; DAP Lab(DAP实验室) ; Columbia University(哥伦比亚大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。
Helios:一种面向智能能源知识推理与应用的基础语言模型
机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) ; Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) ; Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。
自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架
机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。
Comments accepted to TACL 2026 (presented at EACL 2026)
作为LLM社会推理的镜像:人格提示
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。
Comments 9 Pages, EACL main
RiskCueBench: 视频语言模型中早期风险信号的前瞻性推理基准测试
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 RiskCueBench通过标注早期风险信号片段,评估视频语言模型在预测未来风险事件中的能力,揭示了现有系统在解读动态情境方面的不足。
Comments *updated author email in this version
多智能体协作奖励设计以增强强化学习中的推理
机构 * Gradient ; Waseda University(早稻田大学) ; Columbia University(哥伦比亚大学) ; Hong Kong Polytechnic University(香港理工大学) ; Rice University(莱斯大学)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。
MASFIN:一种用于分解金融推理和预测的多智能体系统
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 MASFIN通过整合LLMs与结构化财务指标和非结构化新闻,提出了一种模块化的多智能体系统,以提高金融预测的透明性和可重复性,实现优于基准的短期投资回报。
Comments Accepted to the NeurIPS 2025 Workshop on Generative AI in Finance
Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 推理评测 :reasoning(title);分类 cs.LG
AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。
FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐
机构 * vivo AI Lab(vivo人工智能实验室) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。
基于视觉语言模型的双阶段链式思考内容感知广告布局生成
机构 * Institute of Science Tokyo(东京科学研究所) ; HAKUHODO Technologies Inc.(HAKUHODO技术公司)
专题命中 推理评测 :chain-of-thought(title);分类 cs.AI
AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。
混合知识辩论:一种用于不完整知识图谱问答的鲁棒多智能体推理框架
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本文提出DoM框架,通过多智能体辩论机制整合结构化和非结构化知识,解决不完整知识图谱问答中的知识互补性问题,并引入新数据集提升基准挑战性。
重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统
机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。
Comments 8 pages, 2 figures
机构 * Department of Informatics, Athens University of Economics and Business(信息学院,雅典经济与商业大学) ; Archimedes, Athena Research Center(阿提卡研究中心-阿基米德) ; Athena Research Center(阿提卡研究中心) ; University of Sheffield(谢菲尔德大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments 19 pages, 17 figures, accepted in EMNLP 2025
机构 * Peking University(北京大学) ; RWTH Aachen University(亚琛工业大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Wuhan University(武汉大学) ; Thales Group(泰雷兹集团) ; Chinese Medical Information and Big Data Association(中国医学信息与大数据协会)
专题命中 推理评测 :reasoning(title);分类 cs.AI
Comments This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE
机构 * Department of Information Science, Cornell University(康奈尔大学信息科学系) ; Apple(苹果公司) ; Cornell Tech(康奈尔科技)
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments EMNLP Findings 2025, 12 pages, 11 tables, 3 figures
机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) ; Microsoft(微软公司)
专题命中 推理评测 :reasoning(title);分类 cs.LG
Comments EMNLP'25 Findings
机构 * Institute of Cyberspace Security, Zhejiang University of Technology A STAR Amazon Binjiang Institute of Artificial Intelligence, Zhejiang University of Technology
专题命中 推理评测 :reasoning(title);分类 cs.CL
机构 * Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Fuzhou University(福州市大学) ; Imperial College London(伦敦帝国学院)
专题命中 推理评测 :reasoning(title);分类 cs.AI
机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) ; School of Computer Science, Peking University(北京大学计算机学院) ; HKUST(香港科技大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Washington(华盛顿大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments ACL 2025 Main Conference
机构 * Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments Accepted by ACL 2025 Main. Project page: https://zifuwan.github.io/InstructPart/
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA Research(NVIDIA研究) ; Northwestern University(西北大学)
专题命中 推理评测 :reasoning(title);分类 cs.AI
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments 24 pages, 9 figures, 13 tables