arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 154 篇

2605.09008 2026-05-12 cs.LG cs.CL 90%

Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models

相对动能效用用于推理感知的结构剪枝在大语言模型中

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文提出相对动能效用框架,通过连续动能积分提升结构剪枝效果,实验证明在高稀疏度下提升模型性能,尤其在GSM8K数据集上表现优异。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04289 2026-05-12 cs.LG q-bio.NC 89%

Relational reasoning and inductive bias in transformers and large language models

变换器中的关系推理与归纳偏置

Jesse Geerts, Andrew Liu, Stephanie Chan, Claudia Clopath, Kimberly Stachenfeld

机构 * Imperial College London(帝国理工学院伦敦分校) Google(谷歌) DeepMind(深度Mind) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了变换器和大语言模型在关系推理中的表现,比较了基于权重学习和上下文学习的机制,发现基于权重学习的模型能进行传递推理,而基于上下文学习的模型则依赖训练数据进行传递推理,预训练可使上下文学习模型更接近权重学习模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 89%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22508 2026-05-12 cs.AI 89%

Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering

元认知行为调节用于多跳问答的大型语言模型

Ik-hwan Kim, Hyeongrok Han, Mingi Jung, Sangwon Yu, Jinseok Hong, Sang Hun Kim, Yoonyoung Choi, Sungroh Yoon

机构 * Dept. of ECE Seoul Nat’l Univ.(首尔国立大学电子工程系) AI Center Samsung Elec. Korea(三星电子韩国人工智能中心) AIIS, ASRI, INMC, ISRC, Interdisc. Prog. in AI Seoul Nat’l Univ.(首尔国立大学人工智能研究所、高级研究机构、人工智能中心、国际研究所以及人工智能跨学科研究计划)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出元认知行为调节(MBT)框架,通过五阶段结构提升多跳问答任务的准确性和效率,减少冗余并保持推理轨迹稳定。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 89%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 89%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08592 2026-05-12 cs.CL cs.AI cs.LG 89%

Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models

多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院) University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学) University of California, Davis, California, USA(加州大学戴维斯分校)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了测试时缩放(TTS)中多样性降低导致安全风险增加的问题,提出RefDiv协议用于检测TTS管道中的漏洞,并发现现有安全防护措施对此类风险效果有限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10901 2026-05-12 cs.LG 89%

Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

超越红队测试:LLM防护分类器的正式保证

Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi

机构 * Delft University of Technology(代尔夫特理工大学) University of Birmingham(伯明翰大学) Zeroth Research(Zeroth研究)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 本文提出通过将验证空间从离散输入空间转移到分类器预激活空间,定义有害区域为包含已知有害提示表示的凸形区域,从而为LLM防护分类器提供正式保证,揭示了不同模型在安全性和鲁棒性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07027 2026-05-12 cs.AI cs.CL cs.LG cs.NE physics.chem-ph 88%

LLM-Augmented Chemical Synthesis and Design Decision Programs

基于大语言模型的化学合成与设计决策程序

Haorui Wang, Jeff Guo, Lingkai Kong, Rampi Ramprasad, Philippe Schwaller, Yuanqi Du, Chao Zhang

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) Harvard University(哈佛大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 88%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09739 2026-05-12 cs.CL cs.AI 88%

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

沉默投票:通过聚合语义邻域提高零样本LLM可靠性

Sanket Badhe, Priyanka Tiwari, Deep Shah

机构 * Google(谷歌)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Semantic Softmax方法,通过聚合目标标签的语义邻域得分,解决零样本分类中的Renormalization Bias问题,提升模型校准性和准确性。

Comments Accepted at GEM Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11578 2026-05-12 cs.AI 87%

Efficient LLM Collaboration via Planning

通过规划实现高效的LLM协作

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04415 2026-05-12 cs.CL cs.CV 87%

Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training

双调优:面向多模态大语言模型训练的推理效能驱动的数据筛选

Ruobing Zheng, Tianqi Li, Jianing Li, Qingpei Guo, Yi Yuan, Jingdong Chen

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出双调优框架,通过评估训练数据对推理训练的收益及推理训练的效能,指导多模态大语言模型的数据筛选与训练策略匹配。

Comments Project Page: https://digital-avatar.github.io/ai/ThinkingBoundary/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-05-12 cs.CL cs.AI 87%

DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 87%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 87%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10247 2026-05-12 cs.LG 86%

Teaching LLMs to See Graphs: Unifying Text and Structural Reasoning

教LLM看见图:统一文本与结构推理

Dario Vajda

机构 * Faculty of Computer and Information Science University of Ljubljana(计算机与信息科学系卢布尔雅纳大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GTLM,一种能原生处理图拓扑的新型架构,通过注入图感知注意力偏置,有效消除语义瓶颈,提升图结构数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 86%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA 86%

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09494 2026-05-12 cs.RO cs.AI 86%

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16310 2026-05-12 cs.SE cs.AI 86%

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

通过大语言模型进行安全代码审查的洞察:能力、障碍及影响因素

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computing Technologies, RMIT University, Australia(皇家墨尔本理工学院计算技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨大语言模型在安全代码审查中的潜力,比较了七种LLM与静态分析工具的性能,发现LLM在检测安全缺陷方面表现优异,且特定提示策略对性能有显著影响。

Comments 30 pages, 13 images, 10 tables, Manuscript revision submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09490 2026-05-12 cs.CL cs.AR cs.LG 86%

Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

并非所有思考都需要HBM:面向LLM推理的语义感知内存层次结构

Aojie Yuan, Tianqi Shen, Dajun Zhang

机构 * University of Southern California(南加州大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种语义感知内存层次结构,通过累积注意力评分将token分为四个层级,减少HBM占用并提升推理准确性,实验表明仅3%的淘汰率可保持91%的GSM8K准确率。

Comments Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 86%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 86%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15787 2026-05-12 cs.AI cs.CL cs.LG 86%

SLR: Automated Synthesis for Scalable Logical Reasoning

SLR:可扩展逻辑推理中的自动化合成

Lukas Helff, Ahmad Omar, Felix Friedrich, Antonia Wüst, Hikaru Shindo, Rupert Mitchell, Tim Woydt, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting

机构 * TU Darmstadt(图宾根大学) DFKI(德意志联邦防务学院) Meta FAIR CERTAIN, Germany(德国CERTAIN) Lab1141 MPI-Inf(马克斯·普朗克研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLR通过可扩展逻辑推理系统自动化生成指令提示、验证程序和潜在真实规则,创建SLR-Bench基准测试,展示LLM在逻辑推理中的表现及课程学习提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09304 2026-05-12 cs.SE cs.HC 86%

Generating Complex Code Analyzers from Natural Language Questions

从自然语言问题生成复杂代码分析器

Amirmohammad Nazari, Sadra Sabouri, Wang Bill Zhu, Robin Jia, Souti Chattopadhyay, Mukund Raghothaman

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Merlin系统,通过整合LLM与CodeQL,解决复杂代码分析问题,提升代码问题解答的准确性和效率。

Comments 12 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10218 2026-05-12 cs.CL 85%

Relative Score Policy Optimization for Diffusion Language Models

相对分数策略优化用于扩散语言模型

Zichao Yu, Shengze Xu, Bingqing Jiang, Wenyi Zhang, Difan Zou

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09929 2026-05-12 cs.LG cs.SE 85%

TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications

TeleResilienceBench: 评估大语言模型在电信领域推理中的韧性

Pranshav Gajjar, Emmanuel Ojo, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University(NextG无线实验室,北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TeleResilienceBench,通过七个电信子领域评估大语言模型在继承不完整推理并纠正错误时的韧性,发现模型在恢复能力上表现有限,且规模扩大并不必然提升韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09618 2026-05-12 cs.CL cs.CY 85%

Statistical Scouting Finds Debate-Safe but Not Debate-Useful Cases: A Matched-Ceiling Study of Open-Weight LLM Reasoning Protocols

统计 scouting 找到辩论安全但不实用的案例:开放权重 LLM 推理协议的匹配天花板研究

Julia Hu, Alfred Shen, Kumar Lakshmipathi

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 研究探讨在生成 token 数限制下,不同推理协议的路由头寸及恢复潜力,发现辩论安全性和实用性不一致,需更复杂的信号来优化。

Comments 14 pages, 5 figures. Technical report / preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10848 2026-05-12 cs.IR cs.AI cs.CL 85%

Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?

重新思考Pi-Serini中的代理搜索:词汇检索是否足够?

Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Stencilzeit University of Waterloo(斯泰尔齐特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理循环中,随着LLM能力提升,词汇检索是否足够。通过结合BM25与前沿LLM,引入Pi-Serini搜索代理,展示其在BrowseComp-Plus上优于现有检索代理的性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏