arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-31 至 2026-07-31 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 39 篇

2607.28079 2026-07-31 cs.LG cs.AI 新提交 81%

Chem World: A Large-Scale Benchmark and Physics-Informed Framework for Trustworthy Chemical Property Prediction

Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架

Tianyou Bai, Huan Wang, Mingchen Gao, Fangyue Lin, Pinze Ren, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imperial College London(伦敦帝国学院) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 79%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 79%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27923 2026-07-31 cs.SE 新提交 78%

The Case for Vibe Modeling: A Missing Step in AI-Based Trustworthy Software Development

氛围建模的必要性:基于AI的可信软件开发中缺失的一环

Shalini Chakraborty, Michael Mittermaier, Judith Michael

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27310 2026-07-31 cs.SE 新提交 78%

TrustChain-Review: A Risk-Adaptive Blockchain and Game-Theoretic Framework for Trustworthy AI-Assisted Code Review

TrustChain-Review:一种用于可信AI辅助代码审查的风险自适应区块链与博弈论框架

Mohammad Naserameri

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 该研究提出TrustChain-Review框架,结合区块链、博弈论与风险自适应治理,通过模拟验证其在AI辅助代码审查中平衡可信性与成本的效果,为不同风险场景提供治理方案。

Comments 24 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 70%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27499 2026-07-31 cs.AI 新提交 70%

A dataset of rated conceptual arguments

已标注评分的概念论证数据集

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 70%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27897 2026-07-31 cs.CV 新提交 67%

Unifying Adversarially Robust Model Experts in Vision-Language Models

统一视觉-语言模型中的对抗鲁棒模型专家

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09306 2026-07-31 cs.CL cs.AI cs.HC cs.LG 版本更新 67%

Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins

创造力、诚实和设计遗忘在小型双曲语言模型中出现

Kwan Soo Shin

机构 * PolymathMinds Lab(多智思维实验室) POSTECH(浦项科技大学) aSSIST University(aSSIST大学) Korean Educational Development Institute(韩国教育开发院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨小型双曲语言模型如何成为可信陪伴式AI,通过行为审计器检测合规差距,用线性读出检测相关问题,创意框架播种器更优,记忆操作系统实现设计遗忘,为可信陪伴式AI提供了小模型路径。

Comments Substantially revised and narrowed version with a new title and estimand-centred analysis. Comparisons are now reported at three output resolutions, and the reproducibility package has been rebuilt. The author list was changed with the approval of all authors listed on v1-v2; previous versions remain publicly available. 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 62%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 62%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20780 2026-07-31 cs.AI cs.CL cs.CV 版本更新 62%

MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models

MedHallTune:用于缓解视觉-语言模型中医患幻觉的指令调优基准

Qiao Yan, Yuchen Yuan, Xiaowei Hu, Yihan Wang, Jiaqi Xu, Xiwen Wu, Jinpeng Li, Chi-Wing Fu, Pheng-Ann Heng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedHallTune基准,用于评估和缓解医疗视觉-语言模型的幻觉,实验表明用该基准微调模型可提升幻觉管理能力与下游VQA任务零样本性能,助力开发更可信的医疗视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28301 2026-07-31 cs.LG 新提交 57%

HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化

Tiangang Li, Xiangbo Tian

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28176 2026-07-31 cs.SE cs.AI 新提交 57%

Integrating AI into Requirements Quality Learning in Software Engineering Education: A TPACK-Guided Empirical Study

将人工智能融入软件工程教育中的需求质量学习:一项基于TPACK的实证研究

Hansika Ekanayake Mudiyanselage, Rohan Jai Dharmaraj, Malik Abdul Sami, Zheying Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对软件工程教育中AI融入需求质量学习的需求,基于TPACK框架将多智能体AI工具融入硕士级RE作业,通过混合方法验证了其在提升学生需求质量认知等方面的作用,为相关AI融入设计提供了指导。

Comments 11 pages, 6 figures, 3 tables, presented in the 38th CSEE&T in Florence, Italy, from July 20-22, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28087 2026-07-31 cs.AI 新提交 57%

Diversifying Personalized Research Ideation against AI-Induced Homogenization

针对AI引发的同质化问题实现个性化研究构思的多样化

Rui Xu, Yunke Wang, Linwei Tao, Wenjie Xuan, Yong Luo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交 57%

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27910 2026-07-31 cs.AI 新提交 57%

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

跨架构视觉语言模型中基于方向的推理时防御措施审计

Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27677 2026-07-31 cs.MA cs.AI 新提交 57%

Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness

不要凭直觉部署AI智能体:能力并非生产就绪

Fouad Bousetouane

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。

Comments 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27597 2026-07-31 cs.RO cs.AI cs.SY eess.SY 新提交 57%

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

面向视觉语言赋能的无人机分类与灾害响应的系统工程框架

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

机构 * University of Arkansas(阿肯色大学) University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。

Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum

Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27290 2026-07-31 cs.LG 新提交 57%

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

EvoCause:基于大语言模型引导的因果图进化的根本原因分析

Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27212 2026-07-31 cs.HC cs.CL 新提交 57%

Digital Harf: A Clinically Integrated Multimodal AI System for Pervasive Arabic Speech and Language Therapy

Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, Sabri Boughorbel, Abdulrhman Aljouie, Bdour Alwuqaysi, Yahya Bokhari, Ayah Othman Sindi, Ehsan Hoque

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28200 2026-07-31 physics.app-ph cond-mat.mtrl-sci cs.AI 新提交 57%

Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis

Vibe-FDTR:一种面向智能体的可复现频域热反射数据分析框架

Fuwei Yang, Weiheng Li, Bai Song

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 Vibe-FDTR是面向智能体的FDTR数据分析框架,结合领域代码包与智能体技能,在基准测试中表现优异,可降低计算成本与执行时间,助力低门槛可信热计量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 57%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26621 2026-07-31 cs.IR cs.AI 版本更新 57%

WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models

WhisperRec:用于高效基础推荐模型的潜在推理方法

Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, Wenwu Ou

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24845 2026-07-31 cs.IR cs.AI 版本更新 57%

REPREC: Representation Driven Parameter-Efficient Recommendation System

REPREC:表示驱动的参数高效推荐系统

Harshini Kavuru, Dwipam Katariya, Giri Iyengar, Pranab Mohanty, Kalanand Mishra, Raghu Machiraju

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的序列推荐,提出REPREC轻量级框架,通过轻量级用户表示对齐和MLP注入器映射用户嵌入,在多基准数据集实验中优于LoRA,能保持性能并降低训练时间,平衡推荐质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10579 2026-07-31 cs.CL 版本更新 57%

VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios

VISTA:一种用于日常协助的生成性眼动视频框架

Yu-Hsiang Liu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 57%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏