arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 11 篇

2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交 82%

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18199 2026-07-21 cs.CL cs.LG 新提交 81%

PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择

Hang Zhang, Warren J. Gross

机构 * McGill University(麦吉尔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究如何从语言建模到推理进行任务和预算感知的数据选择,提出PPL-Factory框架,结合任务感知困惑度得分与数据预算感知标准,实验表明该框架在GSM8K等任务上仅用少量训练集就能超越其他方法,有效提升微调效率。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 70%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 67%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16255 2026-07-21 cs.LG cs.AI cs.CL 新提交 67%

Feature Generation Using LLMs: An Evolutionary Algorithm Approach

使用大语言模型进行特征生成:一种进化算法方法

Aria Nourbakhsh, Benoît Alcaraz, Christoph Schommer

机构 * University of Luxembourg(卢森堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。

Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 57%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16704 2026-07-21 cs.CL 新提交 57%

Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation

尽管语言模型在努力时会出错:用于自我纠正科学生成的共形预测

Mingqiao Mo, Yunlong Tan, Hao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型生成技术内容常违反科学原理的问题,提出图结构共形预测框架SFC,将科学推理分解为单元,考虑逻辑依赖,通过实时验证和动态分支纠错,在多基准测试中表现出色,提升准确率、有效性并减少定律违反。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16209 2026-07-21 cs.AI 新提交 57%

Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning

Shapley上下文剪枝:一种用于上下文重排和剪枝的合作博弈视角

Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对检索增强生成系统上下文重排和剪枝缺乏可解释统一框架的问题,提出Shapley上下文剪枝框架,用合作博弈视角归因重要性,采用深度集架构和蒙特卡罗采样,经多实验验证,模型在下游问答性能上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16206 2026-07-21 cs.AI 新提交 57%

PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架

Yujie Shen, Haowen Chen

机构 * School of Mathematics, Hunan University(湖南大学数学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交 57%

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2607.17352 2026-07-21 cs.AI cs.LG quant-ph 新提交 84%

Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution

基于验证器的基准协同进化的自修改精益证明智能体

Yuqing Li, Zeguan Wu, Yu Gan, Junyu Liu

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 代码与定理证明 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究设计有效精益证明智能体的挑战,提出自进化精益证明智能体,其工作区可变,与基准协同进化,通过特定更新机制保持分数可比,经实验验证该方法能有效改善精益证明工作流程。

Comments 22 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17780 2026-07-21 cs.PL cs.AI cs.LG cs.MA 新提交 62%

ETAS: An Effect-Typed Language for Agent Systems

ETAS:一种用于智能体系统的效果类型化语言

Huiri Tan, Yikun Wang, Puyang Zhang, Shangyu Li, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 57%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17823 2026-07-21 cs.LG 新提交 57%

Theoretical Foundations of $\max$@$k$ Reinforcement Learning

$\max$@$k$强化学习的理论基础

Riccardo Poiani, Martino Bernasconi, Andrea Celli

机构 * Bocconi University(博科尼大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16499 2026-07-21 cs.LO cs.SE 新提交 50%

Show Me The Money: An Exercise in Proof-Driven Software Understanding

给我看钱:一个关于证明驱动软件理解的实践

Joseph Tafese, Karthik Nukala, Hassen Saïdi, Natarajan Shankar, Arie Gurfinkel, Giuliano Losa

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究对成熟工业C++代码库进行证明驱动软件理解,结合大语言模型、PVS和SeaHorn,对恒星区块链SDEX订单簿核心算法形式化分析,发现文档不一致,生成便于检查代码更改的工件,展示了定理证明与模型检查组合为遗留系统提供保证的途径。

Comments CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2607.16727 2026-07-21 cs.AI cs.CV 新提交 83%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-07-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 新提交 83%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17047 2026-07-21 cs.LG cs.AI cs.LO 新提交 81%

Solver-Hard Is Not Model-Hard: A Hardness-Controlled Diagnostic for LLM Constraint Reasoning

求解器困难并非模型困难:一种用于大语言模型约束推理的硬度控制诊断方法

Lucky Verma

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型约束推理,在接近匹配子句密度时测试实例级转移,比较不同公式和锚点,发现求解器与模型硬度差异,以及模型对证明保留重新标记敏感,还研究了完成令牌花费与代理的关系。

Comments 13 pages, 2 figures, 5 tables. Code and aggregate reproduction data: https://github.com/lucky-verma/solver-hard-is-not-model-hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17240 2026-07-21 cs.AI 新提交 79%

Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost

受限路径推理:衡量已提交阶段何时值得付出成本

Honglin Li

机构 * ShanghaiTech University(上海科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究LLM推理管道中已提交阶段何时值得付出成本,提出受限路径推理(CPR)方法,通过源感知路径假设与阶段级核算结合,在多个实验设置下验证,可测量相关指标,为LLM推理提供新的衡量与验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16738 2026-07-21 cs.AI 新提交 74%

Supporting Autonomous Process Execution within a Multi-Perspective Constraint Frame via Numeric Planning

通过数值规划在多视角约束框架内支持自主流程执行

Paul Wittlinger, Giacomo Acitelli, Anti Alman, Fabrizio Maria Maggi, Andrea Marrella

专题命中 逻辑推理 :planning(title);分类 cs.AI

AI总结 研究在人工智能增强业务流程管理系统中,通过引入新工具,用多视角约束增强流程框架,为部分流程执行推荐最优延续,经实证评估该技术具可扩展性和有效性,能支持自主及约束感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17849 2026-07-21 cs.HC cs.CL cs.CV 新提交 70%

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

AlphaOracle:通过受人工工作流程启发的深度学习进行甲骨文破译

Yuliang Liu, Haisu Guan, Pengjie Wang, Xinyu Wang, Jinpeng Wan, Kaile Zhang, Handong Zheng, Xingchen Liu, Zhebin Kuang, Huanxin Yang, Bang Li, Yongge Liu, Lianwen Jin, Xiang Bai

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Electronic Information Engineering, South China University of Technology(华南理工大学电子信息学院) Key Laboratory of Oracle Bone Inscriptions Information Processing, Anyang Normal University(安阳师范学院甲骨文信息处理重点实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 针对约3000个未破译甲骨文字符的问题,提出受人工工作流程启发的AlphaOracle框架,经多阶段管道进行甲骨文破译,与专家解读高度一致,还能减少分析时间,为甲骨文及其他未破译文字研究提供参考。

Comments Accepted by The Innovation 2026

Journal ref The Innovation 7(11), 101462, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16266 2026-07-21 cs.LO cs.AI cs.LG cs.MA cs.PL 新提交 62%

Composable Verification Pipelines for Multi-Agent Systems

多智能体系统的可组合验证管道

Julian Alfredo Mendez, Andreas Brännström

机构 * Ume University, Sweden(乌梅大学,瑞典)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统的验证问题,基于Tiles和Soda构建模块化框架,通过可执行验证管道操作动作语言语义,以类型化函数管道表示验证过程,含可执行规范层,有开源实现及示例说明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16262 2026-07-21 cs.LG cs.AI 新提交 62%

Autonomous mechanistic discovery of colorectal cancer vulnerabilities via multi-scale AI swarms

通过多尺度人工智能群体自主进行结直肠癌脆弱性的机制发现

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang, Simon McDade

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决自动化科学发现中语言模型与生物物理的认知差距。通过多尺度自主发现引擎Octopus,结合大语言模型群体和算法物理引擎,针对结直肠癌转录组进行无监督扫描,发现IGF2是5-氟尿嘧啶耐药脆弱性,建立了可验证的生物医学发现范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16212 2026-07-21 cs.AI 新提交 57%

Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers

符号增强弥补神经事实核查器中规范等价盲点

Genpei Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 研究大语言模型总结科学文本时数字和单位幻觉问题,提出将错误检测重定义为类型验证,引入分类法和基准。用符号增强训练框架,提升规范等价鲁棒性,提高准确率,还明确了符号特征及银标签在特定情况下的作用,确定训练时增强是关键集成点。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17053 2026-07-21 cs.SE cs.AR 新提交 50%

MechMem-RTL: Reusing Verified Mechanism Memories for LLM-Based RTL Repair

MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器

Mingyu Cheng, Junjie Gao, Jinhua Cui, Kuncai Zhong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。

Comments 7 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17174 2026-07-21 quant-ph math.LO 新提交 50%

QBism Logic

QB主义逻辑

Kenji Tokuo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究基于QB主义对量子理论的解释进行逻辑形式化,通过引入相关语言和证明定理,将无动态算子片段转化为一阶公式,归约有效性,还表明有限维量子理论可通过SIC等实现框架并满足相关条件。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 28 篇

2607.17038 2026-07-21 cs.AI 新提交 83%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 规划推理 :self-correction(title);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16421 2026-07-21 cs.AI 新提交 83%

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

何时进行规划:学习在反应式控制和审慎规划之间进行选择

Adam Labiosa, Josiah P. Hanna

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究智能体如何学习元推理能力,引入基于反应式策略不确定性得分分配计算的强化学习方法训练元推理策略,通过实证研究表明该设计能让元推理策略学会何时采用反应式策略,何时进行决策时规划,且能随反应式策略改进转向完全反应式控制。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏