Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted by ICRA 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted by ICRA 2024
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments 15 pages, 5 figures, 5 tables
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 9 pages
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments AAAI 2024 - Camera Ready
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments NeurIPS 2023
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments 18 pages, 3 figures
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted to Findings of ACL 2023
Journal ref Findings of ACL 2023, pp. 13152-13168
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments ACL-23 Camera Ready. Code and model input/output are available at https://github.com/sunlab-osu/Understanding-CoT
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments ICLR 2023
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments EMNLP 2022
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments NeurIPS 2022
处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。
Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project Webpage and Code: https://composable-models.github.io/llm_debate/
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);pretraining(abstract);language agent(abstract);分类 cs.CL、cs.AI
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade
说服悖论:当LLM解释未能提升人机团队表现时
机构 * Bar-Ilan University(巴伊兰大学) ; University of Virginia(弗吉尼亚大学) ; Department of Psychology, Ariel University(阿里尔大学心理学系)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 研究揭示LLM解释在提升人机团队表现上的矛盾效果,通过三组实验发现解释增加信心但未必提升准确性,且可能抑制错误恢复能力,强调需转向校准依赖与有效错误恢复的设计。
大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力
机构 * University of Chicago(芝加哥大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。
Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025
大型语言模型行为演化的映射与测量
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。
KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。
GradCuit:信用分配梯度流实现鲁棒且可解释的测试时潜在推理
机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; School of Artificial Intelligence for Science, Peking University(北京大学科学人工智能学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 GradCuit在测试时插入可优化潜在状态,实现序列级信用分配,在多基准上准确率优于同类方法,且鲁棒性、可解释性更强,为LLM测试时推理扩展提供新方向。
PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力
机构 * Korea University(高丽大学)
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%
为何会痛苦:识别情感支持对话中消极想法的驱动因素
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。
从经验中学习有状态的预测知识
机构 * University College London(伦敦大学学院) ; National University of Singapore(新加坡国立大学) ; Chinese Academy of Sciences(中国科学院) ; Brown University(布朗大学) ; University of Bristol(布里斯托尔大学) ; University of Edinburgh(爱丁堡大学) ; Zhongguancun Academy(中关村科学院) ; The Yangtze River Delta(长三角)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对LLM智能体现有轨迹级反思学习的缺陷,提出SKL方法,通过两种算法训练智能体学习有状态预测知识,在多任务上性能优于现有范式。
面向多模态情感分析的语义对齐结构抽象
机构 * Huazhong Agricultural University(华中农业大学) ; Hubei University(湖北大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。
Comments Accepted by MM 2026
稳定价值冲突解决的几何视角
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。
Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics
GFlowRL:将分布匹配强化学习扩展到大型语言模型
机构 * Microsoft Research(微软研究院)
专题命中 推理与问题求解 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.LG
AI总结 研究旨在将GFlowNet风格的RL扩展到大型语言模型,提出GFlowRL算法,去除辅助分区网络,用批内蒙特卡罗估计替代学习的分区函数,并通过两个稳定器实现奖励分布匹配,在多个基准测试中表现出色,能稳定扩展到不同架构。
Comments 31 pages, 8 figures, 17 tables
MolReFlect:迈向分子与文本之间细粒度对齐的研究
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出MolReFlect框架,通过教师-学生机制实现分子与文本的细粒度对齐,提升LLM对分子的理解与可解释性,实验显示其在分子-文本翻译任务中达到最优性能。
Comments Accepted by TKDE, To appear. Codes are available at: https://github.com/phenixace/MolReFlect
人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。
Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution