arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2606.31748 2026-07-01 cs.LG 新提交 57%

Addressing Over-Refusal in LLMs with Competing Rewards

用竞争奖励解决大语言模型中的过度拒绝问题

Taeyoun Kim, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) SynthLabs

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31635 2026-07-01 eess.SY cs.AI cs.MA cs.SY 新提交 57%

A Tutorial on Autonomous Fault-Tolerant Control Using Knowledge-Grounded LLM Agents

基于知识接地LLM代理的自主容错控制教程

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Laboratory, Imperial College London(帝国理工学院自主工业系统实验室) Institute of Automation Technology, Helmut Schmidt University(赫尔穆特·施密特大学自动化技术研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出利用LLM代理作为约束监督规划器,通过外部验证器确保安全,辅助过程工厂故障恢复决策,并提供了可执行的Python环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31307 2026-07-01 cs.CL 新提交 57%

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。

Comments Accepted at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31023 2026-07-01 cs.CR cs.LG 新提交 57%

Certified Speculative Execution for Untrusted AI Agents

不可信AI代理的认证推测执行

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。

Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30973 2026-07-01 cs.CL 新提交 57%

From Propositional to Perceptual Asymmetry: Extending Frictive Policy Optimization to Asymmetric Partial Information Dialogue

从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话

Yifan Zhu, Kyeongmin Rim, James Pustejovsky

机构 * Brandeis University(布兰迪斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 将摩擦策略优化从共享感知场景扩展到感知不对称场景,通过跨语料库分析和LLM探测验证,发现摩擦函数仅在参与者信息视野内有效,并提出标注改进。

Comments 11 pages. To appear in Proceedings of SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30877 2026-07-01 eess.SY cs.LG cs.SY 新提交 57%

A Systematic Approach to Multi-Agent AI from Advanced Regulatory Control Theory: Safe and Auditable LLM Operator Agents for Process Control

基于先进调节控制理论的多智能体AI系统化方法:用于过程控制的安全且可审计的LLM操作员智能体

Idelfonso B. R. Nogueira, Sigurd Skogestad

机构 * Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出将先进调节控制理论映射为多智能体系统,每个反馈回路对应一个专业LLM操作员智能体,通过确定性或LLM编排器解决约束冲突,在奶牛场通风案例中实现可审计轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28270 2026-06-29 cs.AI cs.MA 新提交 57%

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体原生免疫系统:架构、分类与工程

Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li

机构 * Novo Ordo for AI

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 57%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 57%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 57%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24010 2026-06-24 cs.AI 新提交 57%

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

通过约束流形控制实现安全且可泛化的分层多智能体强化学习

Zihao Guo, Jianing Zhao, Ling Li, Hao Liang, Giuseppe Loianno, Yali Du

机构 * University of California, Berkeley(加州大学伯克利分校) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出分层多智能体强化学习框架,低层通过约束流形强制执行硬安全约束,高层学习协调策略,实现理论安全保证、稳定训练和高效泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23449 2026-06-23 cs.AI cs.OS 新提交 57%

AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction

AOHP:一个用于个性化、高效和安全交互的开源操作系统级Agent框架

Shanhui Zhao, Jiacheng Liu, Guohong Liu, Jichao Yan, Jialei Ye, Yuhao Yang, Hao Wen, Shizuo Tian, Yizhen Yuan, Yuxuan Chen, Yunxin Liu, Ju Ren, Ya-Qin Zhang, Chao Huang, Yao Guo, Yuanchun Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出AOHP,一个基于AOSP的操作系统级Agent框架,通过将Agent视为一等OS参与者,实现个性化服务组合、高效Agent接口和安全信息流,在任务完成率、令牌成本和策略合规性上优于现有系统。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21856 2026-06-23 cs.CR cs.AI 新提交 57%

Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents

Harness-MU:面向多用户LLM代理的安全、可控且有效的框架

Wangxuan Fan, Xiaoyu Nie, Zhongxiang Dai

机构 * OpenAI Codex team(OpenAI Codex团队)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对多用户LLM代理的权限冲突与数据泄露问题,提出模型无关、零微调的基础设施框架Harness-MU,通过执行钩子强制执行确定性治理约束,在Muses-Bench基准上实现隐私保护并提升指令遵循准确率高达48.9个百分点。

Comments 15 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 57%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20246 2026-06-23 cs.RO cs.AI 新提交 57%

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

微调视觉-语言-动作模型所需的层数比你想象的少

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics University of Arkansas(阿肯色大学) Technical University of Denmark(丹麦技术大学) Hanoi University of Science and Technology(河内科技大学) KAIST(韩国科学技术院) Monash University(莫纳什大学) Oldenburg University(奥尔登堡大学) DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Stanford University(斯坦福大学) Technische Universität Darmstadt(达姆施塔特工业大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19914 2026-06-19 cs.RO cs.AI 新提交 57%

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

Co-policy: 响应式人机音乐共创框架

Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Automation, Wuhan University of Technology(武汉理工大学自动化学院) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出Co-policy框架,通过语义锚定、约束变分和视觉运动策略实现人机音乐实时共创,在真实钟琴实验中优于扩散策略基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19542 2026-06-19 cs.LG 新提交 57%

Tracking Representation Dynamics in Large Language Models with Persistent Homology

利用持续同调追踪大型语言模型中的表示动态

Naman Malhotra, Jay Ambadkar, Abhinav Gupta, Kushal Kasivel, Abbas Schwarz, Kamillo Ferry, Anthea Monod

机构 * Imperial College London(伦敦帝国学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16326 2026-06-19 cs.GT cs.AI q-fin.RM 新提交 57%

Gaming-Resistant Insurance Contracts for Autonomous AI Agents: Strategy-Proof Toll Mechanism Design

自主AI代理的抗博弈保险合约:策略证明的通行费机制设计

Hao-Hsuan Chen

机构 * Hao-Hsuan Chen(何浩轩)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文扩展了时间一致精算运行时的框架,使运营商策略化,刻画了自主AI代理保险合约的五种攻击空间,并证明了精算运行时的抗博弈性,通过新合约条款实现激励兼容。

Comments 29 pages. Companion to arXiv:2605.26508 (Paper A, foundations) and arXiv:2605.25632 (Paper B, empirical)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 57%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18424 2026-06-18 stat.OT cs.AI cs.IT math.IT 新提交 57%

A Variational Framework for LLM Generator-Regulator Games

大语言模型生成器-调节器博弈的变分框架

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA(电气工程系,工程学院,纽约大学,布鲁克林,纽约,美国)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出一个变分框架,将语言生成建模为熵正则化吉布斯分布,将调节建模为最优判别器,通过鞍点问题平衡效用、熵、调节一致性和有限长度可检测性,并通过审查过滤和钓鱼防御案例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17062 2026-06-17 q-bio.QM cs.LG 新提交 57%

RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

RadSEM:放射学报告中临床一致性的逐发现指标

Zhenhong Yang, Zhuoyun Liu, Jintao Fei, Wen Tang, Shichao Quan, Jun Zhao, Jun Xu

机构 * JDH Algo, JD Health International Inc., China Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China Zhejiang Engineering Research Center for Hospital Emergency Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出RadSEM指标,通过约束LLM辅助将报告重写为原子发现句,进行矛盾感知的多对多匹配,并计算异常加权的F1分数,在SSREE测试中优于现有指标,实现高一致性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17539 2026-06-17 cs.CV cs.AI 新提交 57%

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

空间视觉语言模型中的双路径推理强化

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) University of California, San Diego(加州大学圣迭戈分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17405 2026-06-17 cs.AI 新提交 57%

Treatment Response Optimized Clinical Decision Support AI System via Digital Twin Simulation

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

Xinyu Qin, Anil K. Sood, Ruiheng Yu, Sara Corvigno, Elaine Stur, Lu Wang

机构 * The Cancer Genome Atlas (TCGA)(癌症基因组图谱(TCGA))

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出在线自适应框架,结合治疗效果估计、患者数字孪生和强化学习,在安全约束下实时优化治疗推荐,经合成和真实临床数据验证有效且稳定。

Comments Accepted for presentation at the IEEE Engineering in Medicine and Biology Conference (EMBC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交 57%

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16313 2026-06-16 cs.RO cs.AI 新提交 57%

Is Your Trajectory Displacement Safe in Long-tail?

你的轨迹位移在长尾场景中安全吗?

Qiao Sun, Weicheng Zheng, Yixin Huang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16244 2026-06-16 cs.CR cs.AI 新提交 57%

SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

SPARK: 基于安全知识引导与表示激活的LLM安全代码生成

Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Stjepan Picek

机构 * Radboud University(拉德堡德大学) University of Bristol(布里斯托大学) University of Zagreb(扎格雷布大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交 57%

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-06-16 cs.CL 新提交 57%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15709 2026-06-16 cs.AI cs.MA 新提交 57%

AI-Driven Framework for Adaptive Water Network Management with Proof-of-Concept Implementation: Addressing Non-Revenue Water in Jordan

基于AI的自适应水网管理框架及概念验证实施:解决约旦无收益水问题

Mohammed Fasha, Nahel Al-Maayta, Bilal Sowan, Mohammad Athamneh, Husam Barham

机构 * Jordan(约旦)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出集成EPANET水力建模、数字孪生、SCADA和LLM智能体的框架,通过实时数据与物理模拟结合实现异常检测与自适应决策,概念验证在约旦1164节点管网中实现2分钟内自动生成健康报告,爆管检测定位准确。

Journal ref 2026 2nd International Conference on Computational Intelligence Approaches and Applications (ICCIAA)

详情

展开后加载摘要…

URL PDF HTML 收藏