arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 66 篇

2606.05037 2026-06-04 cs.SE cs.AI 70%

Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

自反式API:结构优于冗长,助力AI代理恢复

Arquimedes Canedo, Grama Chethan

机构 * Siemens Digital Industries Software, USA(西门子数字工业软件公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出自反式API,在验证失败时返回机器可读的结构化建议,使AI代理无需外部推理即可修复请求并重试,在Anthropic模型上将任务完成率提升36.7-40.0个百分点,且每成功令牌效率提升1.8-2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04964 2026-06-04 cs.CL 70%

SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs

SemBlock: 扩散语言模型的语义边界动态块

Xinrui Song, Zhuoran Wang, Mingju Gao, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出SemBlock框架,通过预测语义边界动态构建解码块,利用轻量预测器在冻结的LLaDA隐状态上训练,并在自然语言、数学和代码任务中优于固定块解码和AdaBlock。

Comments Code: https://github.com/TH-AI-Lab-PKU/SemBlock

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04806 2026-06-04 cs.CV cs.AI 70%

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

机构 * The University of Sydney(悉尼大学) Australian National University(澳大利亚国立大学) RMIT University(皇家墨尔本理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04739 2026-06-04 cs.SE cs.AI 70%

Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models

重新审视Vul-RAG:基于RAG的漏洞检测的可复现性与可复制性——使用开放权重模型

Sabrina Kaniewski, Fabian Schmidt, Tobias Heer

机构 * Institute for Secure Networked Systems, Esslingen University(安全网络系统研究所,埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过本地部署和多种开放权重模型,复现并扩展了Vul-RAG框架,发现其性能存在约0.30成对准确率的上限,且模型能力提升无法显著改善性能。

Comments Accepted at AI&CCPS 2026 workshop, co-located with the 21st International Conference on Availability, Reliability and Security (ARES 2026). This is the authors' preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03564 2026-06-04 cs.CV cs.AI 70%

CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

CR-Seg:注意力引导与CoT增强的由粗到精推理分割

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03323 2026-06-04 cs.CR cs.AI 70%

Implement Kubernetes Pod-Level Remote Attestation for Confidential Workloads on dstack

dstack-capsule:Kubernetes 上机密工作负载的 Pod 级远程证明

Yang Yang, Kevin Wang, Yuanhai Luo, Hang Yin, Jie Cai, Shunfan Zhou, Wenfeng Wang

机构 * OPPO Phala

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出 dstack-capsule 平台,通过两层证明架构和权限熔断机制,在 Intel TDX 上实现多个 Pod 共享一个机密虚拟机且每个 Pod 保留独立硬件背书身份的 Pod 级远程证明,避免了每 Pod 独立虚拟机的资源开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09686 2026-06-04 cs.AI cs.CV 70%

Belief-Aware VLM Model for Human-like Reasoning

信念感知的VLM模型用于类人推理

Anshul Nayak, Shahil Shaik, Yue Wang

机构 * Mechanical Engineering Department, Clemson University(克莱姆森大学机械工程系)

专题命中 推理与问题求解 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出一种信念感知的视觉语言模型框架,通过检索式记忆和强化学习近似信念,提升长时程意图推理能力,在HD-EPIC等数据集上优于零样本基线。

Comments Accepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13384 2026-06-04 cs.SE cs.AI 70%

VulnAgent-R2: Evidence-Calibrated Multi-Agent Auditing for Repository-Level Vulnerability Detection

VulnAgent-R2: 证据校准的多智能体审计用于仓库级漏洞检测

Renwei Meng, Haoyi Wu, Jingming Wang

机构 * stu.ahu.edu.cn(安徽大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出VulnAgent-R2,一个预算感知的多智能体审计框架,通过反事实证据重加权、构建感知验证计划合成和成本风险帕累托调度器,在仓库级漏洞检测中提升F1和AUROC,并降低在线令牌消耗。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09803 2026-06-04 cs.LG 70%

Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning

好的推理产生好的示范:通过上下文强化学习进行隐式推理质量监督

Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Chinese Academy of Sciences(中国科学院大学) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出In-Context RLVR方法,利用策略模型自身的上下文学习能力衡量示范效用(Demonstration Utility),通过隐式奖励加权提升推理质量和准确性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 70%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL 70%

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20007 2026-06-04 cs.DB 67%

Rosetta Statements: Simplifying FAIR Knowledge Graph Construction with a User-Centered Approach

Rosetta Statements: 以用户为中心简化FAIR知识图谱构建

Lars Vogt, Kheir Eddine Farfar, Pallavi Karanth, Marcel Konrad, Allard Oelen, Manuel Prinz, Philip Stroemert

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出Rosetta Statement方法,通过自然语言语句建模和元模型,降低领域专家构建FAIR知识图谱的语义门槛,并在ORKG中实现。

Journal ref Database, Volume 2026, 2026, baag030

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15158 2026-06-04 cs.LG cs.AI 62%

Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data

基于结果的强化学习可证明地引导Transformer进行推理,但仅在合适的数据条件下

Yuval Ran-Milo, Yotam Alexander, Shahar Mendel, Nadav Cohen

机构 * Tel Aviv University(特拉维夫大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析单层Transformer在合成图遍历任务上的策略梯度动力学,证明了基于结果的强化学习能够使Transformer自发学习出结构化的迭代推理算法,并揭示了训练数据中“简单示例”的分布对推理能力涌现的关键作用。

Comments 94 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04036 2026-06-04 cs.LG 57%

Self-Distilled Policy Gradient

自蒸馏策略梯度

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Princeton AI Laboratory, Princeton University, Princeton, NJ, USA(普林斯顿大学普林斯顿AI实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 提出SDPG框架,结合组相对验证器优势、归一化标准差、精确全词汇在线自蒸馏和参考策略KL正则化,提升稀疏奖励强化学习的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 50%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 50%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13081 2026-06-04 cs.RO 50%

Agentic AI for Robot Control: Flexible but still Fragile

用于机器人控制的智能体AI:灵活但依然脆弱

Oscar Lima, Marc Vinci, Martin Günther, Marian Renz, Alexander Sung, Sebastian Stock, Johannes Brust, Lennart Niecksch, Zongyao Yi, Felix Igelbrink, Benjamin Kisliuk, Martin Atzmueller, Joachim Hertzberg

机构 * ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) German Aerospace Center (DLR)(德国航空航天中心(DLR))

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出一种基于推理型语言模型的智能体控制系统,通过迭代规划-执行循环选择并调用机器人技能完成任务,在两种物理平台上实验表明系统灵活但存在非确定性行为、指令遵循错误和提示敏感等脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 63 篇

2603.23841 2026-06-04 cs.CL cs.AI 93%

PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay

PoliticsBench: 通过多轮角色扮演基准测试大型语言模型中的政治价值观

Rohan Khetan, Ashna Khetan

机构 * Northville High School, Northville, USA(北维尅高中) Department of Computer Science, Stanford University, Stanford, USA(斯坦福大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出PoliticsBench,一个多阶段角色扮演基准,通过20个演化场景评估LLM的细粒度价值表达,发现场景提示比直接提问能引发更广泛和强烈的价值表达。

Comments 7 pages, 5 tables, 5 figures, 4 appendix pages. Accepted to the ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04924 2026-06-04 cs.CL 92%

Can Crowdsourcing Survive the LLM Era? A Community Survey on Human Data Collection

众包能否在LLM时代幸存?关于人类数据收集的社区调查

Aswathy Velutharambath, Neele Falk, Sofie Labat, Tarun Tater, Amelie Wuehrl

机构 * University of Stuttgart(斯图加特大学) Ghent University(根特大学) Harvard University(哈佛大学) IT University of Copenhagen(哥本哈根技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过调查155名NLP及相关领域研究者,探讨LLM对众包数据有效性的挑战、检测策略及应对措施,发现44%的受访者观察到LLM使用,但现有努力仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 91%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22396 2026-06-04 cs.CL cs.AI cs.CY cs.HC physics.soc-ph 91%

Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks

大型语言模型中的文化基础人物角色:与社会心理价值框架的表征与对齐

Candida M. Greco, Lucio La Cava, Andrea Tagarelli

机构 * DIMES, University of Calabria, Italy(意大利卡拉布里亚大学DIMES研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过世界价值观调查、英格尔哈特-韦尔策尔文化地图和道德基础理论,评估大型语言模型生成的文化基础人物角色是否准确反映不同文化条件下的世界和道德价值体系,并分析其跨文化结构和道德变异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04202 2026-06-04 cs.AI 90%

SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

SMAC-Talk: 面向大型语言模型的星际争霸多智能体挑战的自然语言扩展

Joel Sol, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science(工程与计算机科学学院) University of Victoria(维多利亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 提出SMAC-Talk环境,通过自然语言通信通道评估LLM智能体在合作多智能体场景中的协调与信任,并构建含欺骗性通信者的评估场景。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03660 2026-06-04 cs.AI 90%

From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

从答案到状态:大语言模型中化学推理的可验证过程级评估

Hongyu Guo, Hao Li, He Cao, Gongbo Zhang, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ChemCoTBench-V2基准,通过确定性规则和参考轨迹验证结构化化学推理步骤,揭示模型在最终答案正确性与推理状态一致性之间的差距。

Comments 23 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04296 2026-06-04 cs.AI 90%

The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents

饱和陷阱与干预时机的主观性:为什么基于情感的触发器和LLM评判者无法在自主智能体上把握干预时机

Manvendra Modgil

机构 * manvendramodgil.ai

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过18维情感动力学引擎HEART诊断自主智能体干预时机问题,发现状态饱和陷阱、LLM评判者的能力与上下文门槛,以及人类标注者之间极低的干预时机一致性,表明干预时机是一个低可靠性构念。

Comments 11 pages, 5 tables. Code and data:https://github.com/2025eb1100268-tech/intervention-timing-saturation-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30995 2026-06-04 cs.CY cs.CL 90%

Traceable by Design: An LLM Pipeline and Dashboard for EU Regulatory Consultation Analysis

可追溯性设计:用于欧盟监管咨询分析的LLM流程与仪表板

Thales Bertaglia, Haoyang Gui, Catalina Goanta, Gerasimos Spanakis

机构 * Utrecht University(乌特勒支大学) Maastricht University(马斯特里赫特大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于LLM的端到端流程与交互式仪表板,从监管咨询提交中提取结构化主题,确保逐字引用、完全可追溯和透明性,并以欧盟数字公平法案为例验证。

Comments This research has been supported by funding from the ERC Starting Grant HUMANads (ERC-2021-StG No 101041824)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15118 2026-06-04 cs.CR cs.CL 90%

Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

谈话(不)廉价:LLM攻击的分类法与基准覆盖审计

Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一个基于STRIDE的4×6目标×技术矩阵框架,用于审计LLM攻击基准的集体覆盖,发现现有基准仅覆盖最多25%的威胁面,且存在命名碎片化和评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 89%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-06-04 cs.HC 88%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-06-04 cs.CL 86%

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04867 2026-06-04 cs.AI 86%

AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

AICompanionBench: 以LLM为评判标准的AI伴侣安全基准测试

Yanjing Ren, Reza Ebrahimi, TengTeng Ma

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出AICompanionBench,首个公开的细粒度安全风险标注的人机伴侣对话基准数据集,并评估20个LLM在检测不安全交互中的表现,发现强模型在显式有害内容上准确率高,但难以识别隐式不安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏