arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2606.16003 2026-06-16 cs.AI 新提交 57%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15890 2026-06-16 cs.AI 新提交 57%

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试

Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui

机构 * University of Helsinki(赫尔辛基大学) Zhongguancun Academy(中关村学院) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。

Comments accepted by KDD Datasets and Benchmarks Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15508 2026-06-16 cs.AI 新提交 57%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交 57%

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15037 2026-06-16 cs.CL cs.CV 新提交 57%

ReportQA: QA-Based Radiology Report Evaluation

ReportQA: 基于问答的放射学报告评估

Yiming Shi, Shaoshuai Yang, Xi Chen, Haolin Li, Hengyu Zhang, Che Jiang, Kaiwen Wang, Xun Zhu, Dong Xie, Fei Wang, Dejing Dou, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Beijing Electronic Digital & Intelligence(北京电子数字与智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出ReportQA框架,利用知识树和LLM从报告中提取结构化信息生成QA对,以问答准确率作为评估指标,比现有指标更符合放射科医生判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15024 2026-06-16 cs.MA cs.AI cs.SY eess.SY 新提交 57%

Resilient Consensus in Agentic AI

智能体AI中的弹性共识

Sribalaji C. Anand, George J. Pappas

机构 * KTH(瑞典皇家理工学院) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究LLM智能体在多智能体系统中的共识问题,发现经典弹性共识理论在LLM智能体中失效,但结合经典滤波器可改善一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14817 2026-06-16 cs.IR cs.AI 新提交 57%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14145 2026-06-15 cs.CL 新提交 57%

Personal Care Utility: Health as Everyday Infrastructure

个人护理公用设施:健康作为日常基础设施

Mahyar Abbasian, Elahe Khatibi, Saba A. Farahani, Nitish Nagesh, Arshia Ilaty, Hooman Sajjadi, Amir Rahmani, Ramesh Jain

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出个人护理公用设施(PCU)分层事件驱动架构,将健康视为日常基础设施,通过Personicle组织连续信号,分离临床决策与语言表达,以2型糖尿病为例验证其生成实时干预和知识引导的能力。

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13944 2026-06-15 cs.CL 新提交 57%

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

LLM 蕴含多重性:部署上下文如何重塑模型层面的偏好与价值观

Filip Trhlik, Aoife O'Flynn, Angela Yu, Arduin Findeis, Paula Buttery

机构 * University of Cambridge(剑桥大学) ALTA Institute(ALTA研究所) Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Microsoft UK(微软英国)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究通过两个成对比较范式(国家偏好排序和效用判断)发现,部署上下文(如撰写Reddit帖子或新闻文章)对LLM偏好和价值观的影响远大于提示改写和温度控制,表明模型层面的偏好是上下文依赖的。

Comments 68 pages, 54 figures, 54 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 57%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13474 2026-06-12 cs.CY 新提交 57%

Exploring Systems-Thinking Approaches to Loss of Control Risk

探索系统思维方法应对失控风险

Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。

Comments Accepted to the Technical AI Governance Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13436 2026-06-12 cs.AI 新提交 57%

Evaluation Sovereignty in Metadata-Driven Classification: A Multi-Track Framework for Weakly Supervised Information Systems

元数据驱动分类中的评估主权:面向弱监督信息系统的多轨道框架

Raymond Vasquez

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对弱监督元数据系统中标签权威性影响评估有效性的问题,提出评估主权概念及多轨道评估框架,通过实验揭示模型性能在银标与金标评估下的显著差异,并重新定义评估有效性为系统级属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 57%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13111 2026-06-12 cs.CL 新提交 57%

MÖVE: A Holistic LLM Benchmark for the German Public Sector

MÖVE:德国公共部门的大语言模型整体基准

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Innovations Department, Bundesdruckerei GmbH(德国联邦印钞公司创新部)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出MÖVE基准,从性能和治理两个维度评估39个LLM在德国公共部门的应用,发现无单一模型全面领先,模型大小非质量可靠指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13044 2026-06-12 cs.CL 新提交 57%

No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions

无需隐藏提示!仅通过展示性修改即可欺骗AI同行评审

Xu Yang, Zhizhou Sha, Junbo Li, Jian Yu, Yifan Sun, Matthew Zhao, Jinrui Fang, Xinyue Guo, Yining Wu, Xu Hu, Yifu Luo, Qiang Liu, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者)

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL

AI总结 研究通过仅修改论文的展示层面(如摘要、贡献框架等)而不改变科学内容,利用AI评审反馈进行对抗性重打包,成功提升评分,揭示AI评审易被表面印象误导的结构性缺陷。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12988 2026-06-12 cs.CV cs.AI 新提交 57%

A Machine Learning Framework for Real-Time Personalized Ergonomic Pose Analysis

一种用于实时个性化人体工学姿态分析的机器学习框架

Manex Atxa, Bruno Simoes, Julen Balzategui

机构 * Vicomtech Foundation(Vicomtech基金会) Basque Research and Technology Alliance(巴斯克研究与技术联盟) BRTA

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出利用三维体积视频数据实时预测人体工学/非工学姿态的方法,结合3D点云多角度分析与个性化深度学习分类器,克服固定视角遮挡问题,实现实时评估。

Comments 13 pages, 7 figures, conference 24CMH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12984 2026-06-12 cs.CL 新提交 57%

SkillChain: Closing the Loop on Skill Evolution for Image-Based E-Commerce AI Assistants

SkillChain: 为基于图像的电商AI助手闭环技能演化

Yimin Hu, Mengtao Xu, Hao Guo, Yuheng Song, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出SkillChain框架,通过技能创建、路由优化和主体精炼三阶段自动化技能生命周期,解决电商图像助手多意图混淆问题,显著提升响应质量和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 57%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11876 2026-06-11 q-bio.QM cs.LG stat.ME 新提交 57%

Seeing Below the Limit of Detection: A Censored-Poisson Bayesian Latent-Growth Change-Point Detector (the Span Detector) for Serial ctDNA in HR+/HER2- Metastatic Breast Cancer

检测限以下:用于HR+/HER2-转移性乳腺癌连续ctDNA的删失泊松贝叶斯潜在增长变点检测器(Span检测器)

Aarchi Singh Thakur, Abhijoy Sarkar

机构 * Span AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出Span检测器,利用删失泊松贝叶斯潜在增长变点模型处理ctDNA非检测作为左删失观测,通过序贯广义似然比统计量检测变异检测率上升点,在10%假警报率下将提前三个月捕获进展的比例从11%提升至25%。

Comments 9 pages, 4 figures, 2 tables. Code and synthetic data generator: https://github.com/span-ai-labs/span-detector

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12369 2026-06-11 cs.CY 新提交 57%

Should LLM Agents Decide in Social Simulations? Comparing Finite-State and LLM-Based Decision Policies

LLM智能体应在社会模拟中做决策吗?比较有限状态与基于LLM的决策策略

Alejandro Buitrago López, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 研究评估LLM作为在线社交网络模拟中动作选择器时,是否保持可解释的参考策略,发现LLM在某些配置下可近似但不可靠地保持策略,且速度远慢于马尔可夫链采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11874 2026-06-11 cs.AI 新提交 57%

AutoMine Solution for AV2 2026 Scenario Mining Challenge

AutoMine 解决方案:面向 AV2 2026 场景挖掘挑战

Songliang Cao, Jiele Zhao, Yuru Wang, Hao Li, Daqi Liu, Zehan Zhang, Fangzhen Li, Yu Wang, Yue Zhang, Bing Wang, Guang Chen, Hao Lu, Hangjun Ye

机构 * Xiaomi EV(小米汽车) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出基于 LLM 和 VLM 的自优化场景挖掘方法 AutoMine,通过语义保持提示增强、鲁棒轨迹原子函数与 VLM 函数结合以及执行反馈优化,在 CVPR 2026 挑战赛中取得领先性能。

Comments CVPR 2026 Scenario Mining Challenge (Temporal Track Winners)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11435 2026-06-11 cs.CL 新提交 57%

Agent Skill Evaluation and Evolution: Frameworks and Benchmarks

智能体技能评估与进化:框架与基准

Kexin Ding, Yang Zhou, Can Jin, Feng Tong, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文系统综述了智能体技能从孤立创建到自动化评估驱动进化的范式转变,分类了四种进化范式并分析了六个技能基准类别,指出了覆盖缺口和开放方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11106 2026-06-10 cs.CV cs.AI 新提交 57%

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

FADA: 可访问的胎儿超声解读与标注——基于选择性蒸馏的统一视觉-语言模型

Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) HMC(哈马德医疗公司) Advanced AlRazi Diagnostic Center(高级阿尔拉齐诊断中心) Sidra Medicine(锡德拉医学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出统一视觉-语言模型FADA,通过选择性蒸馏从四个领域基础模型提取知识,实现胎儿超声的解读、分类、检测和分割,在单个消费级GPU上训练,无需外部标签,可在智能手机上离线运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10819 2026-06-10 cs.CV cs.AI 新提交 57%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10749 2026-06-10 cs.CR cs.AI 新提交 57%

Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation

迈向安全的LLM智能体:威胁面、攻击、防御与评估

Yuchen Ling, Shengcheng Yu, Zhenyu Chen, Chunrong Fang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过生命周期、系统导向的框架,综合247篇论文,围绕信息流、委托权限和持久状态,系统梳理了LLM智能体的威胁面、攻击、防御与评估,指出提示注入和工具控制流劫持仍是主要威胁,持久状态损坏和多智能体传播成为新兴关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10620 2026-06-10 cs.CV cs.AI 新提交 57%

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准

Xinrui Wu, Lichen Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10347 2026-06-10 cs.LG cs.LO 新提交 57%

Beyond Explaining Predictions: Logic-Based Explanations for Confidence in Machine Learning Models

超越预测解释:基于逻辑的机器学习模型置信度解释

Vinícius Peixoto Chagas, Carlos Henrique Leitão Cavalcante, Thiago Alves Rocha

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出置信度感知的反绎解释,通过最小置信度阈值量化解释的置信保证,并设计算法生成满足用户指定置信阈值的最小解释,在提升置信保证的同时仅适度增加解释长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10307 2026-06-10 cs.CL 新提交 57%

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

早期令牌置信度预测多智能体LLM辩论中的推理质量

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究利用解码时令牌级对数概率作为置信度信号,预测多智能体LLM辩论中的推理质量,发现早期令牌置信度是最强预测因子。

Comments 15 pages, 8 figures, 4 tables; ACL Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10286 2026-06-10 cs.AI 新提交 57%

Sim2Schedule: A Simulator-Guided LLM Framework for Autonomous Open-Pit Mine Scheduling

Sim2Schedule: 一种模拟器引导的LLM框架用于自主露天矿调度

Mustavi Ibne Masum, Thiago Eustaquio Alves de Oliveira, Mahzabeen Emu

机构 * Department of Computer Science, Lakehead University(湖头大学计算机科学系) Quantum Communications and Computing Research Center and Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学量子通信与计算研究中心及电气与计算机工程系) Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学电气与计算机工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出模拟器引导的LLM框架,将地质约束编码到动作生成中,零样本生成可解释调度方案,在保持线性计算时间下恢复MILP最优NPV的94%-99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 57%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏