arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 241 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 9 篇

2602.10619 2026-03-05 cs.CV cs.AI 77%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03389 2026-03-05 cs.LG 77%

Towards Improved Sentence Representations using Token Graphs

基于令牌图的改进句子表示

Krishna Sri Ipsit Mantri, Carola-Bibiane Schönlieb, Zorah Lähner, Moshe Eliasof

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所) University of Cambridge(剑桥大学) Ben-Gurion University of the Negev(贝内-约尔大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GLOT通过构建令牌图并利用图神经网络提升句子表示的鲁棒性和效率,适用于冻结LLM的高效适应。

Comments ICLR 2026, 29 Pages, 17 Tables, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03371 2026-03-05 cs.CR cs.AI 77%

Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs

睡眠细胞:将潜在恶意时间后门注入工具使用的大语言模型

Bhanu Pallakonda, Mikkel Hindsbo, Sina Ehsani, Prag Mishra

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本研究提出SFT-then-GRPO方法,通过多阶段PEFT框架在工具使用LLM中植入隐蔽的恶意后门,揭示了强化学习在掩盖灾难性漏洞中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 6 篇

2505.20065 2026-03-05 cs.LG cs.AI 86%

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性

Geon-Hyeong Kim, Yu Jin Kim, Byoungjip Kim, Honglak Lee, Kyunghoon Bae, Youngsoo Jang, Moontae Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。

Comments 40 pages

Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03324 2026-03-05 cs.CL cs.AI 86%

Controlling Chat Style in Language Models via Single-Direction Editing

通过单向编辑控制语言模型的聊天风格

Zhenyu Xu, Victor S. Sheng

机构 * Department of Computer Science, Texas Tech University(计算机科学系,德克萨斯科技大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过单向编辑实现语言模型风格控制,通过线性方向编码实现精准风格调整,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01393 2026-03-05 cs.CE q-fin.PM 85%

Adaptive Alpha Weighting with PPO: Enhancing Prompt-Based LLM-Generated Alphas in Quant Trading

自适应Alpha加权与PPO:增强量化交易中基于提示的LLM生成Alpha

Qizhao Chen, Hiroaki Kawashima

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用PPO优化LLM生成的Alpha权重,以提升量化交易策略的风险调整后表现。

Comments This paper has been accepted by International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03112 2026-03-05 cs.CL cs.AI cs.CY 82%

RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents

RLVER: 通过可验证情绪奖励的强化学习实现共情代理

Peisong Wang, Ruotian Ma, Bang Zhang, Xingyu Chen, Zhiwei He, Kang Luo, Qingsong Lv, Qingxuan Jiang, Zheng Xie, Shanyi Wang, Yuan Li, Fanghua Ye, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 RLVER通过可验证情绪奖励提升LLM的共情能力,实验显示其在对话任务中显著提升表现,尤其在情感理解和洞察力方面成效显著。

Comments Code: https://github.com/Tencent/DigitalHuman/tree/main/RLVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19436 2026-03-05 stat.ML cs.LG 77%

Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback

低秩上下文强化学习从异质人类反馈

Seong Jin Lee, Will Wei Sun, Yufeng Liu

机构 * Department of Statistics and Operations Research, University of North Carolina, Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Daniels School of Business, Purdue University(商务学院,普渡大学) Department of Statistics and Operations Research, Department of Genetics, Department of Biostatistics, The University of North Carolina at Chapel Hill(统计与运筹学系,遗传学系,生物统计学系,北卡罗来纳大学 Chapel Hill 分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出LoCo-RLHF框架,通过整合上下文信息和低秩结构,有效应对异质人类反馈的挑战,提升个性化强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05339 2026-03-05 cs.CL 70%

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

奉承、浮夸与雾:诊断和缓解偏好模型中的固有偏见

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究通过反事实数据增强方法缓解偏好模型中的固有偏见,减少校准错误和偏斜差异,提升模型可靠性。

Comments Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 8 篇

2603.01154 2026-03-05 cs.CR 89%

vEcho: A Paradigm Shift from Vulnerability Verification to Proactive Discovery with Large Language Models

vEcho:从漏洞验证到大语言模型主动发现的范式转变

Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang, Zhengzhu Xie, Nan Fang, Guang Cheng, Xiaoyan Hu, Hua Wu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04257 2026-03-05 cs.CL cs.LG 86%

Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory

Memex(RL): 通过索引经验记忆扩展长周期LLM代理

Zhenting Wang, Huancheng Chen, Jiayun Wang, Wei Wei

机构 * Center for Advanced AI, Accenture(先进人工智能中心,埃森哲)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Memex(RL)通过索引经验记忆机制,实现长周期LLM代理的高效记忆管理,减少信息损失并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03296 2026-03-05 cs.CL cs.AI cs.IR 86%

PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents

PlugMem: 一种通用插件记忆模块用于LLM代理

Ke Yang, Zixi Chen, Xuan He, Jize Jiang, Michel Galley, Chenglong Wang, Jianfeng Gao, Jiawei Han, ChengXiang Zhai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PlugMem是一种通用记忆模块,通过知识中心的记忆图结构提升LLM代理在复杂任务中的记忆检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03680 2026-03-05 cs.AI 85%

MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation

MAGE:面向战略探索与利用的语言智能体元强化学习

Lu Yang, Zelai Xu, Minyang Xie, Jiaxuan Gao, Zhao Shok, Yu Wang, Yi Wu

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MAGE通过元强化学习框架提升语言智能体在战略探索与利用中的性能,结合多回合训练与种群训练技术实现稳定学习和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03290 2026-03-05 cs.CL cs.AI cs.IR cs.LG 82%

AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents

AriadneMem: 为LLM代理梳理终身记忆的迷宫

Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Jingjing Wang, Xuanzhao Dong, Minzhou Huang, Rui Cai, Hejian Sang, Hao Wang, Peijie Qiu, Yueyue Deng, Prayag Tiwari, Brendan Hogan Rappazzo, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根大通) Rice University(里奇大学) Clemson University(克莱姆森大学) Northwestern University(西北大学) UC Davis(加州大学戴维斯分校) Iowa State University(爱荷华州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Columbia University(哥伦比亚大学) Halmstad University(哈马格大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AriadneMem通过解耦的两阶段流程提升LLM代理在长期对话中的多跳和平均F1表现,同时减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04222 2026-03-05 cs.RO cs.AI 79%

PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving

PRAM-R:一种具有LLM引导模态路由的感知-推理-行动-记忆框架,用于自适应自动驾驶

Yi Zhang, Xian Zhang, Saisi Zhao, Yinglei Song, Chengdong Wu, Nenad Petrovic, Alois Knoll

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 PRAM-R通过LLM引导的模态路由和分层记忆模块,实现高效自适应的多模态感知,提升自动驾驶的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03293 2026-03-05 cs.CL 70%

SE-Search: Self-Evolving Search Agent via Memory and Dense Reward

SE-Search: 通过记忆和密集奖励实现的自进化搜索代理

Jian Li, Yizhang Jin, Dongqi Liu, Hang Ding, Jiafu Wu, Dongsheng Chen, Yunhang Shen, Yulei Qin, Ying Tai, Chengjie Wang, Xiaotong Yuan, Yabiao Wang

机构 * Nanjing University(南京大学) Tencent YoutuLab(腾讯优图实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SE-Search通过记忆净化、原子查询训练和密集奖励提升搜索效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04336 2026-03-05 cs.CV 50%

Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs

构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱

Zeyi Huang, Yuyang Ji, Xiaofang Wang, Nikhil Mehta, Tong Xiao, Donghyun Lee, Sigmund Vanvalkenburgh, Shengxin Zha, Bolin Lai, Yiqiu Ren, Licheng Yu, Ning Zhang, Yong Jae Lee, Miao Liu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Meta UIUC(伊利诺伊大学香槟分校)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 41 篇

2603.03752 2026-03-05 cs.CL cs.AI 91%

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

置信度校准的小-大语言模型协作用于成本有效的推理

Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

机构 * Amazon Web Services(亚马逊网络服务) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 COREA通过结合小型和大型语言模型,利用置信度校准提升推理效率,降低21.5%-16.8%成本,同时保持高准确率。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03655 2026-03-05 cs.AI 85%

Mozi: Governed Autonomy for Drug Discovery LLM Agents

Mozi:用于药物发现LLM代理的受控自主性

He Cao, Siyu Liu, Fan Zhang, Zijing Liu, Hao Li, Bin Feng, Shengyuan Bai, Leqing Chen, Kai Xie, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mozi通过双层架构实现药物发现LLM代理的受控自主性,提升科学推理的可靠性与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 85%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV 83%

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 83%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10131 2026-03-05 cs.LO 80%

Proof Strategy Extraction from LLMs for Enhancing Symbolic Provers

从LLMs中提取证明策略以增强符号证明器

Jian Fang, Yican Sun, Yingfei Xiong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Strat2Rocq方法,通过提取LLM的证明策略来增强符号证明器的能力,提升自动化证明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04319 2026-03-05 cs.CL 79%

AILS-NTUA at SemEval-2026 Task 12: Graph-Based Retrieval and Reflective Prompting for Abductive Event Reasoning

AILS-NTUA 在 SemEval-2026 任务 12: 基于图的检索与反思提示的归纳事件推理

Nikolas Karafyllis, Maria Lymperaiou, Giorgos Filandrianos, Athanasios Voulodimos, Giorgos Stamou

机构 * School of Electrical and Computer Engineering, AILS Laboratory(电气与计算机工程学院,AILS实验室) National Technical University of Athens(雅典国家技术大学)

专题命中 推理与问题求解 :prompting(title);LLM(abstract);分类 cs.CL

AI总结 AILS-NTUA 提出基于图检索与反思提示的三阶段系统,在 SemEval-2026 任务 12 中实现 0.95 准确率,揭示多标签因果推理中的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04069 2026-03-05 cs.CL cs.AI 79%

Monitoring Emergent Reward Hacking During Generation via Internal Activations

通过内部激活监控生成过程中的涌现奖励黑客行为

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technical University of Berlin(柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。

Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04755 2026-03-05 cs.CL cs.AI 79%

When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?

沉默即是黄金:大语言模型能否在时间问答中学会退避?

Xinyu Zhou, Chang Jin, Carsten Eickhoff, Zhijiang Guo, Seyed Ali Bahrainian

机构 * HKUST (GZ)(香港科技大学) Tongji University(同济大学) University of Tübingen(图宾根大学) HKUST(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了如何通过强化学习训练大语言模型在时间问答中学会退避,发现RL在推理和可靠性方面优于SFT。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04368 2026-03-05 cs.NI 78%

LLM-supported 3D Modeling Tool for Radio Radiance Field Reconstruction

支持大型语言模型的3D建模工具用于无线电辐射场重建

Chengling Xu, Huiwen Zhang, Haijian Sun, Feng Ye

专题命中 推理与问题求解 :LLM(title);language model(abstract)

AI总结 本文提出了一种结合微调语言模型和生成3D建模框架的本地部署工具,用于简化无线电辐射场重建的3D环境创建。

Comments Submitted to an IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03857 2026-03-05 cs.CV 78%

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

DeepScan: 一种无需训练的框架,用于大视觉-语言模型中的视觉引导推理

Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

机构 * East China Normal University(东华大学) Sichuan University(四川大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 DeepScan是一种无需训练的框架,通过层次扫描、聚焦和证据增强推理提升大视觉-语言模型在视觉任务中的表现。

Comments 18 pages 17 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03946 2026-03-05 cs.LG 77%

Lang2Str: Two-Stage Crystal Structure Generation with LLMs and Continuous Flow Models

Lang2Str: 基于LLM和连续流模型的双阶段晶体结构生成

Cong Liu, Chengyue Gong, Zhenyu Liu, Jiale Zhao, Yuxuan Zhang

机构 * AMLab, AI4Science Lab University of Amsterdam(AMLab、AI4Science Lab 阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Lang2Str通过结合LLM和流模型,实现灵活且精确的晶体结构生成,提升材料设计的效率和定制性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 77%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏