arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2606.25161 2026-06-25 cs.AI 新提交 74%

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固

Tianyu Yang, Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23768 2026-06-24 cs.CR cs.AI cs.LO 新提交 74%

Cryptographic certificates of validity for trustworthy AI

可信AI的密码学有效性证书

Murdoch J. Gabbay

机构 * Heriot-Watt University(赫瑞思-瓦特大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16539 2026-08-18 cs.SD cs.AI cs.CL eess.AS 新提交 73%

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化

Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Muhammad Awais, Philip J. B. Jackson, Jiankang Deng, Ismail Elezi

机构 * University of Surrey(萨里大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。

Comments 19 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14577 2026-08-18 cs.CL cs.AI 新提交 73%

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile:刻画前沿大语言模型中的有害分布

Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06105 2026-08-07 cs.LG cs.AI cs.MA 新提交 73%

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文是否有帮助?北极航运中逆强化学习的受控评估

Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw, Jaswanth Kumar, Md Mahbub Alam, Gabriel Spadon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05439 2026-08-07 cs.AI cs.LG 新提交 73%

SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测

Yixuan Wang, Licheng Luo, Yu Fu, Kaidi Xu, Yue Dong, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 73%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22797 2026-07-28 cs.LG cs.AI 新提交 73%

Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis

基于物理可验证证据和大语言模型的轴承故障诊断报告

Yuntong Chen, Jianyu Liu, Guobin Zhao, Ziang Wang, Chao Chen, Ju Huang, Xitian Tian, Lijiang Huang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对安全关键型机械系统中AI诊断的验证问题,提出诊断证据网络DENet,将输出扩展为结构化证据记录,包括分类、预测特征频率等,能检测误分类,还通过约束语言模型减少无根据声明率,提升诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-07-23 cs.AI cs.CL 新提交 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 73%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 73%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08773 2026-07-13 cs.AI cs.LG 新提交 73%

Interval Certifications for Multilayered Perceptrons via Lattice Traversal

通过格遍历实现多层感知器的区间认证

Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

机构 * University of Crete(克里特大学) Catalan Institution for Research and Advanced Studies(加泰罗尼亚研究与高级研究所) University of Lleida(莱里达大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能安全中对抗鲁棒性问题,通过格遍历将其转化为区间认证问题,开发格遍历算子并用于细化与验证迭代方案,保证合理最大化和完全最小化,研究了优化问题的不对称性及对称区间优化问题,还进行了实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06163 2026-07-08 cs.LG cs.AI 新提交 73%

X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

X-FEMR:一种使用基于Transformer的模型对电子健康记录基础模型进行令牌级可解释的方法

Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Royal Melbourne Hospital(皇家墨尔本医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对电子健康记录基础模型是黑箱模型的问题,提出基于Transformer的令牌级可解释性方法,训练替代模型近似其行为,识别有影响力令牌,引入临床对齐度量,结果显示该方法能实现可解释且可信的临床人工智能。

Comments Accepted by IJCAI-ECAI 2026 AI and Health Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交 73%

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31567 2026-07-01 cs.CY cs.AI 新提交 73%

FLARE-AI: Flaw Reporting for AI

FLARE-AI:AI缺陷报告

Shayne Longpre, Elaine Zhu, Carson Ezell, Avijit Ghosh, Sean McGregor, Kevin Paeth, Kevin Klyman, Sayash Kapoor, Rishi Bommasani, Ruth Appel, Gregory Strom, Lauren McIlvenny, Mark M. Jaycox, Peter Slattery, Nathan Butters, Arvind Narayanan, Percy Liang, Alex Pentland

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 73%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 73%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 73%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 73%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20963 2026-06-23 cs.AI cs.CY cs.DB 新提交 73%

Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government

面向地方政府AI保障的生成式负责任AI数据评估模式(GRAIDES)

Ethan Knights, Christopher Conlan, Temilorun Gbolahan, Stephen Waterman, Gurpreet Muctor

机构 * AI Innovation Lab, Westminster City Council(威斯敏斯特市议会人工智能创新实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 提出轻量级开源数据模型GRAIDES,用于集中管理生成式AI的可观测性,通过代码、架构和统计评估蓝图,在组织层面实现系统保障,并在威斯敏斯特市议会案例中验证了人机对齐测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18557 2026-06-18 cs.AI cs.LG cs.LO 新提交 73%

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

DeFAb:基础模型中可废止溯因的可验证基准

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。

Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17478 2026-06-17 cs.CL cs.AI 新提交 73%

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器

Kexin Chen, Yi Liu, Haonan Zhang, Yanhui Li, Xinyu Deng, Dongxia Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12373 2026-08-14 cs.AI 新提交 72%

Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese

不想让你的大语言模型(LLM)推荐核打击?试试用日语提问

Rian Touchent

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI;trustworthy(journal_ref)

AI总结 该研究发现,用日语提问可降低部分LLM在核打击场景中的发动率,其机制为模型的推理语言而非输入语言,且仅适用于在英语中已存在犹豫的模型,表明LLM安全行为具语言依赖性。

Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), Jul 2026, San Diego, United States. pp.489-502

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14291 2026-08-17 cs.HC 新提交 71%

Human and Artificial Intelligence - Promoting Trustworthy and Understandable Collaboration

人类与人工智能——促进可信且可理解的协作

Gilbert Drzyzga

专题命中 安全评测 :trustworthy(title)

AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。

Comments Comments: 19 pages, dual-language (English and German)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12970 2026-08-14 cs.SE 新提交 71%

Requirements-Augmented Generation for Trustworthy Acceptance Testing of LLM-Based Software

面向基于大语言模型的软件的可信验收测试的需求增强生成技术

Fanyu Wang, Chetan Arora, Zhenping Xie, Yonghui Liu, Kla Tantithamthavorn, Aldeida Aleti, Siwei Jiang

专题命中 安全评测 :trustworthy(title)

AI总结 该研究针对基于大语言模型的软件的验收测试缺口,提出需求增强生成技术与置信度校准级联判定方法,经工业案例验证可提升预言机质量、准确率与成本效率,具备工业可行性。

Comments Accepted at ASE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02790 2026-08-05 cs.CV 新提交 71%

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) TReNDS Center(TReNDS中心)

专题命中 安全评测 :safety(title)

AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16896 2026-07-21 cs.NI 新提交 71%

PERA: A Perceive-Reason-Act Interface Bridging Sensing, Cognitive Reasoning, and Trustworthy Agentic Response for 6G

PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应

Mohammad Farzanullah, Melike Erol-Kantarci, Lajos Hanzo

专题命中 安全评测 :trustworthy(title)

AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。

Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 71%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 安全评测 :alignment(title)

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏