Are Large-Language Models Graph Algorithmic Reasoners?
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments 9 pages, 13 Figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments 9 pages, 13 Figures
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);small language model(abstract);preference optimization(abstract)
专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted by EMNLP 2024 Findings
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Journal ref Proceedings of the 41 st International Conference on Machine Learning, Vienna, Austria. PMLR 235, 2024
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments ACL 2024
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Journal ref KBC-LM workshop@ ISWC 2023
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 10 pages
Journal ref IEEE Robotics and Automation Letters 9.5 (2024) 4083-4090
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments Accepted to appear at AAAI 2024
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);language agent(abstract)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments EMNLP Main 2023 (Outstanding Paper Award)
Journal ref Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 5153-5176, Singapore. Association for Computational Linguistics
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments The first three authors contributed equally. Our code and data are publicly available at http://reasonwithpal.com/
TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包
机构 * The Chinese University of Hong Kong(香港中文大学) ; Macao Polytechnic University(澳门理工大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL
AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。
Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning
你的评价复制你:基于大语言模型的代理作为联合分析的客户数字双胞胎
机构 * Department of Data Science(数据科学系) ; Seoul National University of Science and Technology(首尔科学技术大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型构建的客户数字双胞胎进行联合分析,通过聚合用户评论历史和检索增强生成技术,实现了高效准确的偏好预测,验证了其在市场研究中的可行性。
Comments 12 pages, 3 figures + This abstract introduces an LLM-based Customer Digital Twin framework that replaces human respondents in conjoint analysis with RAG-enhanced customer agents, validated at 87.73% accuracy on Reddit user data, and positions the contribution as a scalable alternative to traditional preference elicitation methods
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments ICLR 2025. Project: https://github.com/YangLing0818/SuperCorrect-llm
通过自我场景增强在多模态大语言模型中强化自我中心空间感知
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。
Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph
MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。
CoViLLM:一种利用大语言模型的自适应人机协作装配框架
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。
Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026
TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。
Comments Project Page: https://whynotgit2025.github.io/TennisVAR/
基于智能体的多视角聚合测试断言生成
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。
可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。
任何房屋任何任务:为抽象人类任务的可扩展长周期规划
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。
Smart-TCP:基于智能体AI的自主自适应TCP协议
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。
Comments Submitted for possible journal publication
感知基准:评估多模态大语言模型中的原子视觉感知
机构 * Moonshot AI(登月人工智能)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。