arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2603.24204 2026-03-26 cs.IR 75%

SumRank: Aligning Summarization Models for Long-Document Listwise Reranking

SumRank:对长文档列表级重排序进行总结化对齐

Jincheng Feng, Wenhan Liu, Zhicheng Dou

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出SumRank模型,通过压缩长文档为简洁的排序对齐摘要,提升列表级重排序的效率与效果,实验显示其在多个基准数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19345 2026-03-26 cs.LG cs.AI 73%

Smooth Gate Functions for Soft Advantage Policy Optimization

用于软优势策略优化的平滑门函数

Egor Denisov, Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Institute for Artificial Intelligence, Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学人工智能研究所) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过平滑门函数提升策略优化稳定性和模型性能,分析了不同门函数在数学推理任务中的实验结果,为大语言模型训练提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 73%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24372 2026-03-26 cs.CL 57%

Improving Lean4 Autoformalization via Cycle Consistency Fine-tuning

通过循环一致性微调改进Lean4自动形式化

Arsen Shebzukhov

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文通过循环一致性奖励改进Lean4自动形式化,RL在未见数据和PutnamBench上表现优于SFT,且对交叉熵损失影响小。

Comments 10 pages, 10 figures, pages 10-27 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24560 2026-03-26 cs.SE 50%

Boosting LLMs for Mutation Generation

提升LLM用于变异生成

Bo Wang, Ming Deng, Mingda Chen, Chengran Yang, Youfang Lin, Mark Harman, Mike Papadakis, Jie M. Zhang

专题命中 指令微调 :LLM(abstract)

AI总结 本文提出SMART方法,通过整合检索增强生成、代码片段分割和监督微调,提升变异生成的有效性和效率,实验显示其在变异有效性、非重复率和可编译率等方面均有显著提升。

Comments to be published in the collection of FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24383 2026-03-26 cs.CV 50%

ViHOI: Human-Object Interaction Synthesis with Visual Priors

ViHOI:基于视觉先验的人-物交互合成

Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 指令微调 :language model(abstract)

AI总结 ViHOI通过从2D图像中提取丰富的交互先验,利用扩散模型提升生成质量,实现人-物交互的高质量合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20012 2026-03-26 cs.CV 50%

Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features

基于扩散模型的化妆转移与面部区域感知化妆特征

Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song

机构 * Queen Mary University of London(伦敦女王学院) Huawei London Research Center(华为伦敦研发中心)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出FRAM方法,通过微调化妆CLIP和区域感知化妆注入,提升扩散模型在面部区域特定化妆转移中的可控性与效果。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2603.01853 2026-03-26 cs.CL 81%

Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering

让代理搜索:在时间问题回答中自主探索胜过固定工作流

Xufei Lv, Jiahui Yang, Haoyuan Sun, Xialin Su, Zhiliang Tian, Yifu Gao, Linbo Qiao, Houde Liu

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AT2QA代理,通过自主探索和动态自我纠正提升时间知识图谱问题回答性能,实验表明其在三个基准测试中超越现有最佳基线。

Comments Revised version with three added authors and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 79%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23550 2026-03-26 cs.LG 74%

Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction

隐式回合式策略优化用于主动用户-大语言模型交互

Haoyu Wang, Yuxin Chen, Liang Luo, Buyun Zhang, Ellie Dingqiao Wen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI

专题命中 后训练与偏好优化 :LLM(title);分类 cs.LG

AI总结 本文提出隐式回合式策略优化方法,通过隐式过程奖励模型从稀疏结果信号中提取细粒度回合级奖励,提升多轮协作任务的训练稳定性与收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24093 2026-03-26 cs.LG cs.AI 73%

Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization

迈向有效的经验学习:利用与内化双指导

Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) IQuest Research(IQuest研究) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGO框架,通过外部和内部经验指导强化学习,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24034 2026-03-26 cs.CL cs.AI 73%

From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs

从 oracle 到噪声上下文:缓解语音大语言模型中的上下文暴露偏差

Xiaoyong Guo, Nanjie Li, Zijie Zeng, Kai Wang, Hao Huang, Haihua Xu, Wei Shi

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Urumqi, China(丝绸之路多语种认知计算联合国际研究实验室,乌鲁木齐,中国) Timekettle

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出统一训练框架,通过教师错误知识、上下文dropout和直接偏好优化提升语音大语言模型在真实历史下的鲁棒性,实验表明在预测历史解码中性能提升,且在无关上下文攻击下表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19311 2026-03-26 cs.CL 70%

PrefPO: Pairwise Preference Prompt Optimization

PrefPO:基于配对偏好的提示优化

Rahul Singhal, Pradyumna Tambwekar, Karime Maamari

机构 * Distyl AI

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL

AI总结 PrefPO通过强化学习反馈机制优化提示,无需标注数据即可提升模型性能,在多个基准测试中表现优异,同时改善提示质量并减少提示黑客问题。

Comments Code and data available at https://github.com/DistylAI/prefpo and https://huggingface.co/datasets/rahul-singhal/IFEval-Hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24580 2026-03-26 cs.CL cs.AI cs.CY cs.IR cs.LG 67%

Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA

检索改进并不保证更好的答案:RAG在人工智能政策问答中的研究

Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur, Daniel Stuart Schiff, Tunazzina Islam

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Political Science, Purdue University(政治学系,普渡大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了RAG在人工智能治理中的应用,发现领域特定微调虽提升检索指标,但未必改善问答性能,尤其在相关文档缺失时可能导致更自信的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 67%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 7 篇

2603.23910 2026-03-26 cs.AI 85%

AnalogAgent: Self-Improving Analog Circuit Design Automation with LLM Agents

AnalogAgent: 基于LLM代理的自改进模拟电路设计自动化

Zhixuan Bao, Zhuoyi Lin, Jiageng Wang, Jinhai Hu, Yuan Gao, Yaoxin Wu, Xiaoli Li, Xun Xu

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research(信息通信研究所) Institute of Microelectronics(微电子研究所) Eindhoven University of Technology(埃因霍温理工大学) Singapore University of Technology(新加坡科技学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AnalogAgent,通过集成多代理系统与自演化记忆,实现模拟电路设计自动化,无需额外反馈,在多个基准测试中取得高通过率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21576 2026-03-26 physics.optics cs.AI cs.AR cs.CL cs.LG 82%

PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection

PRISM:通过O(1)光子块选择突破长上下文LLM推理的O(n)内存瓶颈

Hyoseok Park, Yeonsang Park

机构 * Department of Physics, Chungnam National University(Chungnam National University 物理系)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PRISM通过光子广播与加权范式,实现长上下文LLM推理中O(n)内存带宽的突破,采用O(1)光子块选择方法,显著提升效率与能效比。

Comments 28 pages, 27 figures, 15 tables, including supplementary material. Code available at https://github.com/hyoseokp/PRISM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 77%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24221 2026-03-26 cs.RO cs.AI 70%

Environment-Grounded Multi-Agent Workflow for Autonomous Penetration Testing

基于环境的多智能体工作流用于自主渗透测试

Michael Somma, Markus Großpointner, Paul Zabalegui, Eppu Heilimo, Branka Stojanović

机构 * JOANNEUM RESEARCH Forschungsgesellschaft mbH, DIGITAL – Institute for Digital Technologies(JOANNEUM RESEARCH 研究所,DIGITAL – 数字技术研究所) TU Graz, Institute for Technical Informatics(格拉茨技术大学,技术信息研究所) Jamk University of Applied Sciences, Institute of Information Technology(贾马克应用科学大学,信息技术研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于环境的多智能体架构,用于机器人环境中的自动化渗透测试,通过动态构建共享图状记忆实现系统状态的结构化自动化,并在ROS/ROS2场景中验证了其高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 62%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09604 2026-03-26 cs.LG cs.AI cs.CR 62%

Mitigating Many-Shot Jailbreaking

缓解多示例劫持

Christopher M. Ackerman, Nina Panickssery

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过微调和输入净化缓解多示例劫持攻击的有效性,发现组合方法显著降低攻击效果,同时保持模型在正常上下文学习中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL 62%

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 22 篇

2603.23067 2026-03-26 cs.CV 89%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16917 2026-03-26 cs.AI cs.CL cs.LG 88%

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

生成对抗推理器:通过对抗性强化学习增强大语言模型推理

Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出生成对抗推理器,通过对抗性强化学习联合训练LLM推理器和判别器,提升推理质量与准确性。

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24382 2026-03-26 cs.LG cs.AI cs.CE 86%

MolEvolve: LLM-Guided Evolutionary Search for Interpretable Molecular Optimization

MolEvolve: 基于大语言模型的可解释分子优化进化搜索

Xiangsen Chen, Ruilong Wu, Yanyan Lan, Ting Ma, Yang Liu

机构 * Hong Kong University of Science(香港科技大学) Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MolEvolve通过大语言模型引导进化搜索,实现可解释的分子优化,优于传统方法在属性预测和分子优化任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04607 2026-03-26 cs.OS cs.AI cs.LG 86%

From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents

从命令式到声明式:面向提升计算机使用代理的LLM友好操作系统接口

Yuan Wang, Mingyu Li, Haibo Chen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Declarative Model Interface (DMI),通过将传统GUI转化为三种声明式原语,提升LLM驱动的计算机使用代理的任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23909 2026-03-26 cs.AI 85%

DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extraction

DUPLEX:基于LLM驱动信息提取的代理双系统规划

Keru Hua, Ding Wang, Yaoying Gu, Xiaoguang Ma

机构 * Midea Corporate Research Center(美的集团研发中心) Midea Group(美的集团) Northeastern University(东北大学) Engineering Department(工程部)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DUPLEX通过限制LLM进行结构化语义 grounding,结合符号规划器实现可靠规划,优于现有端到端和混合LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24030 2026-03-26 cs.CV cs.MM 85%

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24065 2026-03-26 cs.AI 81%

Enhanced Mycelium of Thought (EMoT): A Bio-Inspired Hierarchical Reasoning Architecture with Strategic Dormancy and Mnemonic Encoding

增强思维菌丝(EMoT):一种受生物启发的分层推理架构,具有战略休眠和记忆编码

Florian Odi Stummer

机构 * Institute of General Medicine(医学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 EMoT是一种受生物启发的分层推理架构,通过四层结构(微、中、宏、元)实现战略休眠与激活,结合记忆宫殿和五种记忆编码方式,提升多领域复杂问题解决能力,但存在样本量小、计算成本高等限制。

Comments 32 pages, 6 figures, 15 tables; includes ablation studies and reasoning trace visualisation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15259 2026-03-26 cs.AI 77%

SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs

SAG-Agent:通过动态知识图谱实现策略游戏中长周期推理

Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)前沿人工智能研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAG-Agent通过构建持久化的状态-动作图,解决无API环境下自主代理的效率瓶颈,提升探索效率和战略深度。

详情

展开后加载摘要…

URL PDF HTML 收藏