arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5898 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 888 篇

2510.16380 2026-06-12 cs.CL cs.AI cs.CY cs.HC cs.LG 版本更新 82%

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

MoReBench:评估语言模型中的程序性和多元道德推理,超越结果

Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine

机构 * University of Washington(华盛顿大学) New York University(纽约大学) Scale AI Harvard University(哈佛大学) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Center for AI Safety(人工智能安全中心) Stanford University(斯坦福大学) MIT(麻省理工学院) University of Oxford(牛津大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。

Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 82%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 82%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 推理与问题求解 :LLM(title,comments);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-20 cs.CV cs.CL 版本更新 81%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16149 2026-08-20 cs.AI 版本更新 81%

Teaching agentic AI to learn expert reasoning for rare disease diagnosis

LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体

Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh F. Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心) University of South Florida(南佛罗里达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。

Comments Updated abalation experiments and layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-19 cs.CL 版本更新 81%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 81%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24465 2026-08-18 cs.CL 版本更新 81%

MechMath: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving

Mechanic:基于遗憾的正式分解工作流用于自动定理证明

Ruichen Qiu, Yichuan Cao, Junqi Liu, Dakai Guo, Xiao-Shan Gao, Lihong Zhi, Ruyong Feng

机构 * Academy of Mathematics and Systems Science, CAS(数学与系统科学研究院,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) School of Mathematical Science, UCAS(数学科学学院,中国科学院大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mechanic通过基于遗憾的正式分解策略提升自动定理证明效率,有效解决传统方法在处理失败尝试时的效率与上下文过长问题。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09706 2026-08-17 cs.CE cs.LG 版本更新 81%

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

基于无验证器共识选择的CAD生成测试时缩放

Aaron Haag, Altay Kacan, Bertram Fuchs, Oliver Lohse

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 81%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 81%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 81%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17593 2026-08-11 cs.CL 版本更新 81%

From Chains to DAGs: Probing the Graph Structure of Reasoning in LLMs

从链到DAG:探测语言模型推理中的图结构

Tianjun Zhong, Linyang He, Ziyang Li, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨语言模型内部推理是否以有向无环图形式存在,通过设计探针验证DAG结构在各层的出现,并发现中间层具有最强的结构恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27544 2026-08-11 cs.AI cs.FL 版本更新 81%

TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation

TempoBench:评估大语言模型中的时间因果推理

Nikolaus Holzer, William Fishell, Baishakhi Ray, Mark Santolucito

机构 * Columbia University(哥伦比亚大学) Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 81%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 81%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21124 2026-08-07 cs.SD cs.AI eess.AS 版本更新 81%

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解

Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

机构 * Google DeepMind(谷歌DeepMind) Media Lab, MIT(媒体实验室,麻省理工学院) Google AR(谷歌AR)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03589 2026-08-06 cs.DB cs.LG 版本更新 81%

stratum: A System Infrastructure for Massive Agent-Centric ML Workloads

stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施

Arnab Phani, Elias Strauss, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。

Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub

Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 81%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 81%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 81%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 81%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18624 2026-07-17 cs.RO cs.AI cs.CV 版本更新 81%

REST: Receding Horizon Explorative Steiner Tree for Zero-Shot Object-Goal Navigation

REST:基于零样本目标导航的视界探索Steiner树

Shuqi Xiao, Maani Ghaffari, Chengzhong Xu, Hui Kong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。

Comments Accepted to IROS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12548 2026-07-17 cs.LG 版本更新 81%

Human-In-The-Loop Machine Learning for Safe and Ethical Autonomous Vehicles: Principles, Challenges, and Opportunities

用于安全且符合道德的自动驾驶车辆的人在回路机器学习:原理、挑战与机遇

Yousef Emami, Mohammadhossein Homaei, Miguel Gutiérrez Gaitán, Luis Almeida, Kai Li, Hui Huang, Zhu Han

机构 * IEEE

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对自动驾驶车辆面临的挑战,对人在回路机器学习进行教程式综述,涵盖课程学习、人在回路强化学习、人在回路大语言模型、主动学习等方法及道德原则,以推动安全且符合道德的自动驾驶发展。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23440 2026-07-10 cs.CL cs.IR 版本更新 81%

Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

截断步骤级采样与过程奖励用于检索增强推理

Chris Samarinas, Haw-Shiuan Chang, Hamed Zamani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11404 2026-07-07 cs.AI 版本更新 81%

Attributing Emergence in Million-Agent Systems

对百万智能体系统涌现的归因

Ling Tang, Jilin Mei, Qian Chen, Qihan Ren, Linfeng Zhang, Quanshi Zhang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种归因方法,用于在百万级智能体系统中归因宏观现象,该方法在速度和理论基础上均优于现有方法,并证明了全规模归因对非线性宏观指标的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 81%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17864 2026-07-07 cs.LG 版本更新 81%

Equivalence of Context and Parameter Updates in Modern Transformer Blocks

现代Transformer模块中上下文与参数更新的等价性

Adrian Goldwaser, Michael Munn, Javier Gonzalvo, Benoit Dherin

机构 * University of Cambridge, UK(英国剑桥大学) Google Research(谷歌研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将基础理论扩展到现代大语言模型多样架构,先为Gemma风格模块给出解析解,后推广结果并引入框架,证明特定条件下MLP模块可实现完美隐式权重补丁,有助于理解模型转换提示为有效权重的方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20692 2026-07-07 cs.SE cs.AI cs.FL 版本更新 81%

Neurosymbolic Characterization for Reliable Access Control Policy Analysis

探索大型语言模型用于访问控制策略合成与摘要

Adarsh Vatsa, Bethel Hall, William Eiers

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM在访问控制策略自动生成中的有效性,发现非推理LLM仅45.8%生成等价策略,推理LLM达93.7%,并提出基于语义的请求摘要方法辅助策略分析。

Comments Accepted to ISSRE 2026. Major revision and retitling of arXiv:2510.20692v1. Refocuses the paper on reliable neurosymbolic access-control policy analysis; updates the PolicySummarizer method, multi-cloud evaluation, and user-study results. 13 pages, 6 figures. Corrected arXiv title metadata to match the accepted ISSRE version. No substantive content changes from the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17965 2026-07-03 cs.SE cs.AI 版本更新 81%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏