arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2604.12373 2026-04-28 cs.CL 87%

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04695 2026-04-28 cs.LG 87%

TRINITY: An Evolved LLM Coordinator

TRINITY:一个进化的人工智能语言模型协调器

Jinglue Xu, Qi Sun, Peter Schwendeman, Stefan Nielsen, Edoardo Cetin, Yujin Tang

机构 * Sakana AI University of Michigan(密歇根大学) Institute of Science Tokyo(东京科学研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 TRINITY通过轻量级协调器高效分配角色,提升多轮查询处理能力,在多个任务中超越单一模型和现有方法,实现卓越性能。

Comments To appear at the 14th International Conference on Learning Representation (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 87%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23194 2026-04-28 cs.AI 87%

From Coarse to Fine: Self-Adaptive Hierarchical Planning for LLM Agents

从粗到细:为LLM代理设计的自适应分层规划

Haoran Tan, Zeyu Zhang, Chen Ma, Tianze Liu, Quanyu Dai, Xu Chen

机构 * Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Gaoling School of Artificial, Renmin University of China(人大北京校区人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AdaPlan-H,一种自适应分层规划机制,通过逐步细化策略提升复杂任务执行效率,减少过度规划,提供灵活高效的多步骤决策方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21321 2026-04-28 cs.AI 87%

LLM-Assisted Op-Amp Behavioral-Level Design via Agentic Human-Mimicking Reasoning

通过代理人类模拟推理的LLM辅助运算放大器行为级设计

Zihao Chen, Ziyi Sun, Jiayin Wang, Ji Zhuang, Jinyi Shen, Xiaoyue Ke, Li Shang, Xuan Zeng, Fan Yang

机构 * State Key Laboratory of Integrated Chips and Systems(集成芯片与系统国家重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出White-Op框架,利用大语言模型代理的类人推理能力,实现运算放大器行为级参数设计,通过符号推理与数值求解分离方法,结合模拟验证和迭代优化,提升设计可解释性与电路功能保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 87%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04058 2026-04-28 q-bio.GN 87%

RareCollab: an LLM-powered framework for multimodal reasoning in Mendelian disease diagnosis

RareCollab: 一种基于大语言模型的多模态推理框架,用于孟德尔疾病诊断

Guantong Qi, Jiasheng Wang, Mei Ling Chong, Zahid Shaik, Shenglan Li, Shinya Yamamoto, Maura R. Z. Ruzhnikov, Devon E. Bonner, Jennefer N. Carter, Kevin S. Smith, Matthew T. Wheeler, Stephen B. Montgomery, Jonathan A. Bernstein, Sasidhar Pasupuleti, Undiagnosed Diseases Network, Pengfei Liu, Hu Chen, Zhandong Liu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RareCollab通过整合基因组、表型和转录组证据,提升孟德尔疾病诊断的多模态推理能力,其在890名患者中实现了对94%诊断基因的高优先级识别,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15993 2026-04-28 cs.CL 86%

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

解释自然语言中的谜题解决方案:对6x6数独的探索性研究

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估了五种LLM在解决和解释6x6数独中的表现,发现尽管部分模型能解决谜题,但无法提供反映战略推理或直观问题解决的解释,凸显了LLM在人机协作决策中需解决的关键挑战。

Comments Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR 86%

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract)

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09944 2026-04-28 cs.DB 86%

PLOP: Cost-Based Placement of Semantic Operators in Hybrid Query Plans

PLOP:基于成本的语义运算符在混合查询计划中的放置

Qiuyang Mang, Yufan Xiang, Hangrui Zhou, Runyuan He, Jiaxiang Yu, Hanchen Li, Aditya Parameswaran, Alvin Cheung

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 PLOP通过等价保留的重写将混合语义-关系查询规划简化为语义过滤器放置,通过动态规划模型平衡LLM和关系成本,实现1.5倍速度提升和4.29倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 85%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23877 2026-04-28 cs.CL 84%

Knowledge Vector of Logical Reasoning in Large Language Models

大语言模型中逻辑推理的知识向量

Zixuan Wang, Yuanyuan Lei

机构 * Department of Computer & Information Science and Engineering(计算机与信息科学与工程系)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 本文研究了大语言模型中演绎、归纳和溯因推理的知识表示,发现其在线性空间中可独立表示,提出互补子空间约束框架以增强其互补性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00084 2026-04-28 cs.LG cs.AI cs.CL 83%

Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs

学习以细化:LLMs中并行推理的自我细化

Qibin Wang, Pu Zhao, Shaohan Huang, Fangkai Yang, Lu Wang, Furu Wei, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Generative Self-Refinement方法,通过并行生成候选答案并细化最终答案,提升LLM推理性能,实验显示其在多个数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23970 2026-04-28 cs.AI cs.CV cs.HC cs.MA 83%

LLM-Guided Agentic Floor Plan Parsing for Accessible Indoor Navigation of Blind and Low-Vision People

基于大语言模型的代理楼层计划解析用于视障和低视力人士的无障碍室内导航

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种基于代理的框架,将单张楼层平面图转换为结构化的知识库,生成安全的无障碍导航指令。系统通过多代理模块生成空间知识图谱,并通过路径规划器生成导航指令,实验结果显示在真实场景和基准数据集上均优于单次调用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07410 2026-04-28 cs.RO cs.AI 83%

Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks

利用语言模型作为闭环高层规划器用于机器人应用:简要概述与基准测试

Hao Wang, Sathwik Karnik, Bea Lim, Somil Bansal

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(南加州大学明希德电气与计算机工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系) Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究了语言模型在机器人闭环高层规划中的应用,探讨了控制时间跨度和预热启动对性能的影响,并通过实验提供改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 83%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 82%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13117 2026-04-28 cs.LG cs.AI cs.CL 82%

On the Reasoning Abilities of Masked Diffusion Language Models

关于掩码扩散语言模型的推理能力

Anej Svete, Ashish Sabharwal

机构 * ETH Zürich(苏黎世联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了掩码扩散模型在推理任务中的能力,通过与链式思维和填充循环变压器框架对比,证明了其在有限精度对数宽度下与多项式填充PLTs等效,并展示了其在解决特定问题时的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10516 2026-04-28 cs.CL 81%

Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning

通过代码依赖关系进行结构化知识检索以实现多步数据推理

Xinyi Huang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SGKR框架,通过函数调用依赖关系构建图结构,提升多步数据推理任务中知识检索的准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23523 2026-04-28 cs.SE cs.AI 81%

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

基于语言闭环的安全操作规则语法约束细化:可能发生的问题

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan

机构 * University of Michigan--Dearborn(密歇根大学迪尔伯恩分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合反事实推理与语法约束循环的框架,用于安全操作规则的细化,通过自主驾驶控制系统案例展示其在解决不一致规则中的有效性,并强调语法约束与语义验证的重要性。

Comments 6 pages, 1 figure, 2 tables. Accepted at SEAMS 2026

Journal ref Proc. 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems (SEAMS 2026), ACM, 2026, 6 pages

详情
URL PDF HTML 收藏
2604.24550 2026-04-28 cs.SE 80%

Mono2Sls: Automated Monolith-to-Serverless Migration via Multi-Stage Pipeline with Static Analysis

Mono2Sls:通过多阶段流水线进行自动单体到无服务器迁移

Xingyan Chen, Yuxin Su, Zishan Su, Yang Yu, Zibin Zheng

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文提出Mono2Sls,一种自动化将单体Web后端转换为AWS SAM应用的流水线,通过静态分析和四个LLM代理实现高正确率迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24464 2026-04-28 cs.DC 80%

Incisor: Ex Ante Cloud Instance Selection for HPC Jobs

Incisor:面向HPC作业的前期云实例选择

Michael A. Laurenzano, Shihan Cheng, David A. B. Hyde

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 Incisor通过结合程序分析工具和LLM引导推理,自动选择适合HPC作业的云实例,提升作业运行效率和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 79%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24443 2026-04-28 cs.AI 79%

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记

Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Rice University(里奇大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。

Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04733 2026-04-28 cs.CV cs.AI 79%

Discovering Failure Modes in Vision-Language Models using RL

通过强化学习发现视觉-语言模型的失败模式

Kanishk Jain, Qian Yang, Shravan Nayak, Parisa Kordjamshidi, Nishanth Anand, Aishwarya Agrawal

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Michigan State University(密歇根州立大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出基于强化学习的框架,自动发现视觉-语言模型在特定数据分布上的失败模式,通过生成问题来识别模型在细粒度视觉细节和技能组合上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13262 2026-04-28 cs.AI cs.CL 79%

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

CURE-MED:基于课程的强化学习用于多语言医学推理

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(中东技术研究所)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CURE-MED框架,通过课程引导的强化学习提升多语言医学推理的逻辑正确性和语言稳定性,实验表明在13种语言上均优于基线模型,实现了高一致性与高正确率。

Comments Accepted at ACL 2026, main conference, oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19652 2026-04-28 cs.CV 78%

Self-Rewarding Vision-Language Model via Reasoning Decomposition

通过推理分解实现自奖励视觉-语言模型

Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Maryland(马里兰大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Vision SR1,通过分解视觉与语言推理,提升视觉推理能力,减少视觉幻觉和语言捷径依赖,效率优于需外部视觉奖励模型的方法。

Comments 16 pages, two figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24536 2026-04-28 cs.CL 77%

Generating Place-Based Compromises Between Two Points of View

在两种观点之间生成基于地点的妥协

Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate Sieck, Charlene C. Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Toyota Research Institute(丰田研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出通过外部共情相似性生成基于地点的妥协方法,提升妥协的可接受性,并通过人偏好对齐训练更高效的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15390 2026-04-28 cs.SE cs.AI 77%

Analyzing Chain of Thought (CoT) Approaches in Control Flow Code Deobfuscation Tasks

分析控制流代码去混淆任务中的链式思维(CoT)方法

Seyedreza Mohseni, Sarvesh Baskar, Edward Raff, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨了基于链式思维提示的代码去混淆方法,评估了五种先进大语言模型,发现CoT提示显著提高了去混淆质量,GPT5在控制流图重建和语义保留方面表现最佳,平均提升约16%和20.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18563 2026-04-28 cs.AI cs.MA econ.TH 77%

Reasonably reasoning AI agents can avoid game-theoretic failures in zero-shot, provably

合理推理的AI代理可以在零样本情况下避免博弈论失败并得到证明

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文研究了AI代理在重复博弈中的稳定性,证明了基于贝叶斯后验采样的代理能趋近纳什均衡,且在未知收益情况下仍保持收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏