arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 82 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2608.17142 2026-08-19 eess.SY 新提交 50%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13113 2026-08-19 eess.SY cs.RO 版本更新 50%

MPC for underactuated spacecraft control with a Lyapunov supervised physics-informed neural network correction layer

基于李雅普诺夫监督的物理信息神经网络校正层的欠驱动航天器MPC控制

Amirhossein Ayanmanesh Motlaghmofrad, Carlo Cena, Mauro Martini, Marcello Chiaberge

机构 * Politecnico di Torino(托斯纳理工学院) Argotec S.R.L.(Argotec公司)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 针对欠驱动航天器姿态控制,提出一种分层架构,结合非线性模型预测控制、物理信息神经网络和李雅普诺夫监督机制,在不确定性下降低稳态误差并保持鲁棒性。

Comments Accepted at SPAICE (AI in and for Space) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 50%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 隐私与版权 3 篇

2608.17051 2026-08-19 cs.CL cs.AI 新提交 62%

Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss

基于机构特定的大语言模型提示工程恢复去标识化系统及其黄金标准均遗漏的受保护健康信息

Daniel Palacios, Matthew Brady Neeley, Angel Adetomike Otto, Shalini Dhamodharan, John P. Woodhouse, Chi-fan Lin, Mark Zobeck, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(简与丹·邓肯神经学研究所)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出校准良好的上下文学习(ICL)的大语言模型(LLM),可通过机构特定提示恢复去标识化系统遗漏的受保护健康信息(PHI),平衡精确率与召回率,是专用去标识化系统的有效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-19 cs.CL cs.AI 版本更新 62%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-08-19 cs.SE cs.AI cs.CR cs.IR cs.LG 版本更新 62%

From Adoption to Deployment: A Qualitative Study on AI Integration in Software Development Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 31 篇

2604.00547 2026-08-19 cs.AI cs.LG 版本更新 84%

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qin-Yi Zhang, Jiexun Shen, Yi-Fan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17183 2026-08-19 cs.AI cs.CR 新提交 83%

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

基准的基准:评估小型语言模型的自动化安全基准

Nyamtulla Shaik, Fengjun Li, Bo Luo

机构 * University of Kansas(堪萨斯大学)

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究通过评估5个基准套件在26个开源SLMs上的表现,发现现有以LLM为中心的安全基准无法可靠评估SLMs,模糊性会导致模型排名出现显著变化。

Comments This paper is accepted for publication at ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09471 2026-08-19 cs.CV 版本更新 82%

CKAA: Cross-subspace Knowledge Alignment and Aggregation for Robust Continual Learning

CKAA:用于鲁棒持续学习的跨子空间知识对齐与聚合

Lingfeng He, De Cheng, Zhiheng Ma, Huaijie Wang, Dingwen Zhang, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学电信工程学院) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) SUAT-Faculty of Computational Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学SUAT计算微电子学院) Brain and Artificial Intelligence Laboratory, Northwestern Polytechnical University(西北工业大学脑与人工智能实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对基于PEFT的持续学习方法在误导性任务ID下决策模糊的问题,提出CKAA框架,通过DKA和TC-MoA两项创新提升鲁棒性,实验显示其性能优于同类方法。

Comments Accepted by IEEE Transactions on Image Processing (TIP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16975 2026-08-19 cs.CL cs.LG 新提交 81%

Margin-Regularized Structured Semantic Alignment for Brain-Language Correspondence

用于脑-语言对应关系的边际正则化结构化语义对齐

Jiaqi Wang, Huawen Hu, Shu Zhang

机构 * School of Computer Science and Technology, Northwestern Polytechnical University(西北工业大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文针对脑-语言解码的模糊性问题,提出MD-SigLIP框架,通过边际正则化结构化语义对齐实现基于检索的解码,在全词汇与子集评估下均取得最优检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18017 2026-08-19 cs.AI 新提交 79%

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

大语言模型能否解释飞行安全事件?一种先验引导的基于语义大语言模型的方法

Lu Xu, Xu Li, Linjiang Zheng, Fan Li, Riquan Zhang, Jiaxing Shang

机构 * College of Computer Science, Chongqing University(重庆大学计算机学院) Sichuan Flight Engineering Technology Research Center, Civil Aviation Flight University of China(中国民航飞行学院四川飞行工程技术研究中心) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海对外经贸大学统计与数据科学学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对飞行安全事件解释难题,提出FlightLLM方法,结合特征工程、语义离散化、CatBoost先验引导及对比小样本学习等技术,在704个A320飞行样本上实现了良好分类与合理事件原因解释。

Comments 14 pages, 6 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 79%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: this https URL (https://baiyajing.github.io/harness-risk/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16895 2026-08-19 cs.CY physics.soc-ph 新提交 79%

Orphan risks at the frontier of artificial intelligence: What diverging safety and compliance frameworks reveal about how AI companies choose the risks they prioritize

人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险

Andrew D. Maynard

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。

Comments 21 pages, 40 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 78%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17175 2026-08-19 cs.HC 新提交 78%

Balancing Safety and Autonomy: Accessibility-Oriented Interventions in Generative AI for Cognitive Impairment

平衡安全与自主性:面向认知障碍群体的生成式AI可及性导向干预

Yibo Meng, Jingruo Chen, Lyumanshan Ye, Bingyi Liu, Zhicong Lu

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究针对认知障碍老年群体使用生成式AI的安全与自主冲突问题,通过对45名患者及照护者的质性研究,提出五种可及性导向机制,发现机制效果随障碍程度变化,强调需设计平衡安全与自主的动态AI方案。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16894 2026-08-19 cs.CY cs.CL 新提交 73%

An Investigation of the NeurIPS and ICML 2025 Position Tracks

NeurIPS与ICML 2025立场论文 track 的调查

Fan Yang, Wenkai Li, Jun Liu

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY

AI总结 本文审计了NeurIPS和ICML 2025立场论文 track 的公开投稿,发现其以改革派批判为主,建议增设方向设定类工作,并提出四项CFP层面干预措施以优化投稿结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17328 2026-08-19 cs.CV 新提交 67%

MS-MFAD: Multimodal large language models for Face Anti-spoofing Detection

MS-MFAD:用于人脸活体检测的多模态大语言模型

Xiaoyong Yu, Rongzhen Li, Shuming Shi, Xinge You

机构 * Mashang Consumer Finance Co., Ltd.(马上消费金融股份有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 针对人脸活体检测的复合威胁与现有方法瓶颈,提出基于多模态大语言模型MFAD的可解释系统,通过细粒度像素-语义锚定机制与少量语义标注实现优异检测性能,鲁棒性与效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17997 2026-08-19 cs.CY cs.AI 新提交 62%

Traceable Trust for action-ready artificial intelligence in bioscience

生物科学中可追溯信任的行动就绪人工智能

Huayu Xin, Yizhi Cai, Mukilan Deivarajan Suresh, Gavin Michael Farrell, Iwona Gajda, Charlie Harrison, Conor Houghton, Mato Lagator, Yang Lu, Virginia Portillo, Reyer Zwiggelaar, Sebastian Lobentanzer

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 针对生物科学领域AI输出指导实验室行动的关键节点,提出Traceable Trust框架,通过三个案例说明该框架可记录AI影响科学工作时的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-19 cs.LG cs.AI cs.HC 新提交 62%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17605 2026-08-19 cs.CL cs.AI cs.SD 新提交 62%

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战

Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。

Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17050 2026-08-19 cs.CL cs.AI 新提交 62%

Cross-Model Memory Transfer via Target-Side Reader Adaptation

通过目标侧读取器适配实现跨模型记忆迁移

Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型知识利用的两类方法缺陷,探究Engram式哈希记忆跨模型迁移的关键因素,通过跨模型冻结记忆提取实验,提出双层四分支读取器,实现同模型与跨模型复用差距的缩小,证明Engram可作为可复用外部知识人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-19 cs.CL cs.AI 版本更新 62%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-08-19 cs.AI cs.CL cs.CR 版本更新 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

Comments Published at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17994 2026-08-19 cs.CL 新提交 57%

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。

Comments Accepted at Conference on Language Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17620 2026-08-19 cs.LG 新提交 57%

OOD Detection for EEG-based Machine Learning in High-Risk Environments

高风险环境下基于脑电图(EEG)的机器学习的分布外(OOD)检测

Philipp Bomatter, Henry Gouk

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 针对脑电图机器学习在高风险环境中易受分布偏移影响的问题,引入EEG OOD检测基准,评估相关方法并结合互补方法构建稳健安全网。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-19 cs.AI 新提交 57%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交 57%

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team: Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17270 2026-08-19 cs.AI 新提交 57%

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

大型语言模型(LLMs)能否判断优质假说?基于logit的能量评分在科学假说排序上优于提示式LLM评判器

Swati Rajwal, Sanjay Das, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究针对科学假说评估难题,提出基于logit的能量评分方法,在12学科1323篇论文的基准测试中,该方法的Hit@1显著优于提示式LLM评判器,展现出模型内在置信度的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17070 2026-08-19 cs.LG cs.CR cs.LO 新提交 57%

Certified but Private: Scalable Zero-Knowledge Proofs for Neural Network Guarantees

可验证但隐私性强:用于神经网络保障的可扩展零知识证明

Youwei Zhong, Ben Merbaum, Timos Antonopoulos, Ning Luo, Charalampos Papamanthou, Katerina Sotiraki, Ruzica Piskac

机构 * Yale University(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于零知识证明的PANDA系统,可在不泄露神经网络私有参数的情况下高效证明其鲁棒性与公平性,支持参数超290万的网络,规模远超同类方案且开销更低。

Comments 23 pages, 2 figures (11 pages for the main text), for code of implementation and evaluation, see this https URL (https://github.com/youweizhong/PANDA)

详情

展开后加载摘要…

URL PDF HTML 收藏