EXAONE Path 2.5: Pathology Foundation Model with Multi-Omics Alignment
EXAONE Path 2.5:多组学对齐的病理基础模型
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 EXAONE Path 2.5通过多组学对齐构建病理基础模型,实现更全面的肿瘤生物学建模,展现高效率和适应性,推动精准肿瘤学发展。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
EXAONE Path 2.5:多组学对齐的病理基础模型
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 EXAONE Path 2.5通过多组学对齐构建病理基础模型,实现更全面的肿瘤生物学建模,展现高效率和适应性,推动精准肿瘤学发展。
通过行为指导实现可信的多轮大语言模型代理
机构 * Gonca Gürsun(独立研究者)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。
Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)
通过ASCII、词性对齐和PCA进行句子结构的统计分析
机构 * New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 本研究通过ASCII、词性对齐和PCA分析句子结构的平衡,提出一种资源高效的统计方法,用于评估文本平衡并补充传统语法工具。
基于十项准则的可信 orchestration 人工智能与控制平面治理
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出基于十项准则的可信 orchestration 人工智能框架,通过整合人类输入、语义一致性等要素,系统性地提升人工智能系统的可信度与可控性。
RAD:迈向可信的检索增强多模态临床诊断
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University(上海交通大学医学人工智能研究所)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 RAD通过检索增强多模态模型,提升临床诊断的可信度与准确性,实现任务特定知识的显式注入。
Comments Accepted to NeurIPS 2025
教导语言模型与用户共同进化:面向个性化对齐的动态资料模型
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。
Comments NeurIPS 2025 Camera-ready
基于学习的社会协调以提高混合交通中协作自动驾驶车辆的安全性和鲁棒性
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 本文提出基于多智能体强化学习的方法,通过量化自动驾驶车辆的社会偏好并引入利他主义,提升其在混合交通中与人类驾驶车辆协作的安全性和鲁棒性。
Comments arXiv admin note: substantial text overlap with arXiv:2202.00881
了解你的轨迹 -- 通过基于重要性的轨迹分析实现可信的强化学习部署
机构 * Clifford F(未知) ; Devika Jay(未知) ; Abhishek Sarkar(未知) ; Satheesh K Perepu(未知) ; Santhosh G S(未知) ; Kaushik Dey(未知) ; Balaraman Ravindran(未知)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 本文提出基于重要性的轨迹分析框架,通过评估轨迹级状态重要性,提升强化学习部署的可信度和可解释性。
Comments Accepted at 4th Deployable AI Workshop at AAAI 2026
构建可信的人工智能用于材料发现:从自主实验室到Z分数
机构 * University of Toronto(多伦多大学) ; University of Tennessee(田纳西大学) ; Vector Institute for Artificial Intelligence(人工智能矢量研究所) ; Schwartz Reisman Institute for Technology and Society(技术与社会斯瓦茨-雷曼研究所)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 本文提出GIFTERS框架,用于评估材料发现中AI方法的信任度,强调信任原则和改进方法,以确保AI加速发现的同时符合科学规范。
迈向基于LLM生成代码的自动化和可信的科学分析与可视化
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文探讨了LLM生成代码在科学分析与可视化中的可信度与自动化潜力,提出三种策略提升代码执行成功率与质量,强调需进一步优化以构建更可靠的AI辅助研究工具。
拉索蒙集在可信机器学习中的双刃剑性质
机构 * Duke University(杜克大学) ; MIT(麻省理工学院) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Rutgers University(罗格斯大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 研究揭示了拉索蒙集在可信机器学习中的双刃剑性质,指出其在提升鲁棒性的同时也带来隐私风险。
RoParQ:面向抗 paraphrased 问题的大型语言模型对齐
机构 * Seoul National University(首尔国立大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。
Comments 12 pages, 9 figures, 8 tables
基于机器学习的临床风险预测方法:电子健康记录中的多尺度时间对齐
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 本研究提出基于多尺度时间对齐网络的临床风险预测方法,通过多尺度卷积和注意力机制提升EHR中异步时间序列的建模能力。
Comments 5 pages, 3 figures
CLLMRec: 基于大语言模型的认知感知概念推荐:通过语义对齐和先决知识蒸馏
机构 * Xihua University, Chengdu 610039, China(西华大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 CLLMRec通过语义对齐和先决知识蒸馏,利用大语言模型实现认知感知的概念推荐,无需依赖结构化知识图谱。
迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判
机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL
AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。
诚实胜过准确:通过强化犹豫实现可信语言模型
机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 通过强化犹豫方法,将回避作为核心训练目标,使语言模型在风险可控下提升可信度,降低计算成本。
T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。
Comments AAAI 2026
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments 28 pages, 26 figures
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI
专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.CL
机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) ; School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) ; School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Journal ref EMNLP 2025, pages 7683-7703
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments Published at IJCNLP-AACL 2025 Findings
机构 * Department of Computer Science NTNU - Norwegian University of Science and Technology(计算机科学系挪威科学技术大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
Comments 29 pages, 17 figures
机构 * University of Pisa(比萨大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI