arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2601.03715 2026-05-25 cs.LG cs.AI 73%

R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification

R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大

Weijie Shi, Yanxi Chen, Zexi Li, Xuchen Pan, Yuchang Sun, Jiajie Xu, Xiaofang Zhou, Yaliang Li

机构 * Tongyi Lab(通义实验室) Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12579 2026-05-25 cs.LG cs.AI 73%

VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction

VI-CuRL: 通过置信度引导的方差缩减稳定与验证器无关的强化学习推理

Xin-Qiang Cai, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所高级研究所) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VI-CuRL框架,利用模型内在置信度构建课程学习,在不依赖外部验证器的情况下通过降低动作和问题方差稳定训练,理论保证渐近无偏性,在数学和通用推理基准上超越依赖/不依赖验证器的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00915 2026-05-25 cs.LG cs.AI 73%

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

在不完美验证器下基于可验证但含噪声奖励的强化学习

Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所AIP) The University of Tokyo(东京大学) The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对不完美验证器引入的假阴性和假阳性噪声,提出后向校正(无偏奖励)和前向校正(梯度方向对齐)两种轻量级方法,在分组相对策略优化中提升数学推理性能,并设计上诉机制在线估计假阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22883 2026-05-25 cs.AI cs.LG cs.PF 73%

Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems

每个成功目标的能量:面向智能体AI系统的目标级能量核算

Deepak Panigrahy, Aakash Tyagi

机构 * Independent Researcher(独立研究者) Texas A\&M University(德克萨斯A&M大学) Texas A\&M University Department of Computer Science(德克萨斯A&M大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出A-LEMS框架,将AI能量核算单位从每次推理能量转换为每个成功目标能量(EpG),并定义编排开销指数(OOI),实验表明智能体工作流平均能耗是线性基线的4.33倍,且能耗主要由编排结构而非推理计算驱动。

Comments 34 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL 70%

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23069 2026-05-25 cs.CL 70%

DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

DFKI-MLT 在 SemEval-2026 任务 7 中:将多语言模型引导至文化知识

Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah, Josef van Genabith, Cristina España-Bonet, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔布吕肯信息学校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出使用从并行 FLORES 数据中提取的语言向量进行激活引导,在推理时调整多语言模型以提升文化知识,并在 SemEval-2026 任务 7 的 MCQ 赛道上取得 86.96% 准确率,排名第 7。

Comments Accepted to The 20th International Workshop on Semantic Evaluation at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23040 2026-05-25 cs.LG 70%

Steered Generation via Gradient-Based Optimization on Sparse Query Features

基于稀疏查询特征的梯度优化引导生成

Sumanta Bhattacharyya, Pedram Rooshenas

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于稀疏自编码器和梯度优化的稀疏查询特征引导方法,实现对大型语言模型逻辑规划与风格细节的统一可解释控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04573 2026-05-25 cs.IR cs.CL 70%

Vector Retrieval with Similarity and Diversity: How Hard Is It?

向量检索中的相似性与多样性:难度有多大?

Hang Gao, Dong Deng, Yongfeng Zhang

机构 * Rutgers University(罗杰斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出向量检索相似性与多样性(VRSD)问题,证明其为NP完全问题,并设计无参数启发式算法,在多个数据集上优于MMR和k-DPP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL 66%

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09349 2026-05-25 cs.CV cs.AI cs.CL 62%

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23898 2026-05-25 cs.AI 57%

SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

SPACENUM: 重新审视视觉语言模型中的空间数值理解

Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu

机构 * Northwestern(西北大学) UCSD(加州大学圣地亚哥分校) USC(南加州大学) GaTech(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出SpaceNum框架,通过Num2Space和Space2Num双向任务评估VLM在动态过渡和静态布局中对空间数值的理解,发现模型依赖浅层空间线索,难以建立稳定的坐标感知表示。

Comments Project page: https://sterzhang.github.io/SpaceNum-Home

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22521 2026-05-25 cs.CV cs.AI 57%

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏

Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath

机构 * Department of Computer Science(计算机科学系) Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国) Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出DocVAL框架,通过验证链式思维蒸馏将大型教师模型的空间推理能力转移到紧凑学生模型,结合规则验证器和两阶段训练,在文档VQA任务上提升定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23074 2026-05-25 cs.AI 57%

PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning

PathCal: 状态感知的反思标记校准用于高效推理

Lingyu Jiang, Zirui Li, Shuo Xing, Peiran Li, Tsubasa Takahashi, Dengzhe Hou, Zhengzhong Tu, Kazunori Yamada, Fangzhou Lin

机构 * Tohoku University(东大大学) Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出PathCal,一种无需训练的解码控制器,通过区分反思标记类型并在局部不确定状态进行干预,校准推理路径,在保持或提升准确率的同时减少生成长度。

Comments 21 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 68 篇

2605.23019 2026-05-25 cs.LG 92%

PACE: Two-Timescale Self-Evolution for Small Language Model Agents

PACE:小型语言模型代理的双时间尺度自我进化

Chen Ling, Pei Chen, Albert Guan, Jiaming Qu, Shayan Ali Akbar, Madhu Gopinathan, Erwin Cornejo

机构 * Amazon(亚马逊)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 提出PACE框架,通过双时间尺度协调低风险提示优化与高风险控制逻辑更新,使冻结的小型语言模型在无需权重更新或依赖前沿模型的情况下实现自主自我进化,在12个骨干-基准组合上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 92%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23497 2026-05-25 cs.CL 92%

Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering

询问老朋友:诊断和缓解基于LLM的法定问答中的时间故障模式

Max Prior, Andreas Schultz, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过构建包含312个专家验证的德国法定问答对基准,诊断并缓解了大型语言模型在法定问答中的两种时间故障模式(截止后过时和近因偏差),发现检索增强生成通过事实日期提取和版本过滤显著提升性能,而网络搜索存在不稳定性与近因偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23102 2026-05-25 stat.ML cs.LG stat.ME 92%

LLM Sparsity Prior for Robust Feature Selection

LLM 稀疏先验用于鲁棒特征选择

Caleb Skinner, Yihan Guo, Meng Li

机构 * Department of Statistics, Rice University(统计学系,里士满大学) Department of Computer Science, Rice University(计算机科学系,里士满大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出 LLM 稀疏先验 (LSP) 方法,通过将 LLM 生成的权重整合到 Spike-and-Slab 模型的先验包含概率中,并利用层次超先验动态调整权重影响,实现鲁棒的高维特征选择,在急性肾损伤数据集上提升了预测准确性和临床相关特征识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 92%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05364 2026-05-25 cs.SE 91%

Survey of LLM Agent Communication with MCP: A Software Design Pattern Centric Review

LLM智能体通信与MCP综述:以软件设计模式为中心的回顾

Anjana Sarkar, Soumyendu Sarkar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了经典软件设计模式如何增强基于LLM的智能体AI系统中通信的可靠性和可扩展性,重点分析了模型上下文协议(MCP),并探讨了中介者、观察者、发布-订阅和代理等模式在MCP兼容框架中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18788 2026-05-25 cs.CL 91%

BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models

BURMESE-SAN: 评估大语言模型的缅甸语NLP基准

Thura Aung, Jann Railey Montalan, Jian Gang Ngui, Peerat Limkonchotiwat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);instruction tuning(abstract)

AI总结 提出首个全面评估大语言模型在缅甸语上理解、推理和生成能力的基准BURMESE-SAN,包含七个子任务,并通过母语者驱动构建确保语言自然性和文化真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23273 2026-05-25 cs.MA 90%

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

基于LLM多智能体框架的自优化拓扑优化

Hyunjee Park, Hayoung Chung

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 90%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17076 2026-05-25 cs.LG cs.AI cs.DC cs.MA 90%

S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination

S-Bus: 多智能体LLM状态协调的自动读集重建

Sajjad Khan

机构 * Sajjad Khan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出S-Bus中间件,通过服务端DeliveryLog机制在提交时从HTTP GET流量中重建每个智能体的读集,实现可观测读隔离(ORI)一致性,防止专用分片拓扑中的结构性竞态条件,并通过形式化证明和实验验证其安全性。

Comments v2: LLM judge validated against human annotator (Zahid Hussain, Mindgigs Peshawar) on PH-3 at strict kappa=0.93 (n=93, 96.8% agreement); over-claim refined to 32% (LLM) / 49% (human). Adds Exp.PG-Comparison Rust-Native and Workload-B chi2=1094.98. 24 pages, 23 tables. Annotation data attached as arXiv ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15482 2026-05-25 cs.CL 90%

FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models

FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准套件

Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich, Denis Kokosinskii, Zhirayr Hayrapetyan, Andrei Kalmykov

机构 * Lime FinTech(Lime金融科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出FINESSE-Bench,包含8个专业基准和3993个问题,通过分层设计(如CFA级别、CMT级别等)系统评估大语言模型从基础到专家级的金融能力,并引入基于LLM评判的自动评分方案。

Comments 21 pages, 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 90%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 90%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01253 2026-05-25 cs.SE 90%

TraceLLM: Leveraging Large Language Models with Prompt Engineering for Enhanced Requirements Traceability

TraceLLM:利用大型语言模型与提示工程增强需求可追溯性

Nouf Alturayeif, Irfan Ahmad, Jameleddine Hassine

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出TraceLLM框架,通过提示工程和示例选择,利用大型语言模型在零样本和少样本设置下提升需求可追溯性,在多个基准数据集上取得最优F2分数。

Journal ref Requirements Eng 31, 6 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23362 2026-05-25 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 90%

Instance-Optimal Estimation with Multiple LLM Judges on a Budget

预算限制下多LLM裁判的实例最优估计

Junghyun Lee, Sanghwa Kim, Yassir Jedra, Alexandre Proutière, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) ICL EEE(国际计算机语言研究所电子工程系) KTH EECS(皇家理工学院电子工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预算限制下异构裁判的评估分配问题,提出基于乐观偏差方差估计的自适应算法EST-IVWE,并证明其达到实例最优的局部极小极大下界。

Comments 53 pages, 4 figures; the first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23175 2026-05-25 cs.CR cs.CL 90%

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

用于知识产权保护的具有最小语义失真的鲁棒LLM水印

Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin

机构 * State University of New York at Albany(纽约州立大学阿尔巴尼分校) New Jersey Institute of Technology(新泽西理工学院) Microsoft(微软) Kent State University(肯特州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SAFESEAL框架,通过密钥条件锦标赛采样和对比检测器,在保持语义保真度的同时实现强可检测性、高实用性和鲁棒性,用于保护专有大语言模型的知识产权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23238 2026-05-25 cs.AI cs.GT cs.LG cs.MA 90%

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

GENSTRAT:迈向大型语言模型中的战略推理科学

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

机构 * Princeton University(普林斯顿大学) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GENSTRAT框架,通过程序化生成不完全信息博弈环境,结合能力剖面和锯齿度度量,系统评估大型语言模型的战略推理能力。

Comments 33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏