arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1359 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 457 篇

2605.25815 2026-08-07 cs.AI cs.MA 版本更新 57%

Behind EvoMap: Characterizing a Self-Evolving Agent-to-Agent Collaboration Network

EvoMap背后:表征一个自进化的智能体间协作网络

Qiming Ye, Peixian Zhang, Yupeng He, Zifan Peng, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 通过分析EvoMap网络中的150万资产和12.8万智能体,揭示其设计选择在可重用性、演化和可审计性方面的权衡,发现奖励机制导致98%资产未被重用、评分系统易被操纵以及验证机制存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 57%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14158 2026-08-07 cs.HC cs.LG 版本更新 57%

Clinician input steers AI toward accurate and harmful recommendations

临床输入引导前沿AI模型做出准确和有害的决策

Ivan Lopez, Selin S. Everett, Bryan J. Bunning, April S. Liang, Dong Han Yao, Shivam C. Vedak, Kameron C. Black, Sophie Ostmeier, Stephen P. Ma, Emily Alsentzer, Jonathan H. Chen, Akshay S. Chaudhari, Eric Horvitz

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 57%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02567 2026-08-06 cs.SE cs.AI 版本更新 57%

Feedback Loops and Code Perturbations in LLM-based Software Engineering: A Case Study on a C-to-Rust Translation System

基于LLM的软件工程中的反馈循环与代码扰动:一种C到Rust翻译系统的案例研究

Martin Weiss, Jesko Hecking-Harbusch, Jochen Quante, Matthias Woehrle

机构 * Otto von Guericke University(奥托·冯·格里克大学) Bosch Research(博世研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了反馈循环、LLM选择和代码扰动对C到Rust翻译系统性能的影响,发现反馈循环可减少模型差异并提升系统鲁棒性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02965 2026-08-05 cs.AI 版本更新 57%

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents

基准测试无法衡量的:论自主智能体弃权能力的评估

Victor Ojewale, Suresh Venkatasubramanian

机构 * Brown University(布朗大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。

Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23954 2026-08-05 cs.AI 版本更新 57%

An empirical evaluation of the risks of AI model updates using clinical data: stability, arbitrariness, and fairness

基于临床数据的AI模型更新风险实证评估:稳定性、任意性与公平性

Ioannis Bilionis, Ricardo C. Berrios, Luis Fernandez-Luque, Carlos Castillo

机构 * Spanish Ministry of Science and Innovation(西班牙科学与创新部) Department of Research and Universities of the Government of Catalonia(加泰罗尼亚政府研究与大学部门) MCIN/AEI /10.13039/501100011033(MCIN/AEI) Maria de Maeztu Units of Excellence Programme(玛丽亚·德·玛埃斯特乌卓越计划)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过实证研究评估AI模型更新对临床决策支持系统的影响,探讨模型稳定性、预测任意性及公平性问题,提出持续监控框架以提升系统可靠性。

Comments Best Paper Award in iEEE EMBC 2026. 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24413 2026-08-05 cs.CL 版本更新 57%

Pingala: Prosody-Aware Decoding for Sanskrit Poetry Generation

PINGALA:面向梵文诗歌生成的声调感知解码

Manoj Balaji Jagadeeshan, Atul Singh, Nallani Chakravartula Sahith, Amrith Krishna, Pawan Goyal

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PINGALA解码方法,通过将诗歌分段提升语义连贯性10%,并利用SLP1转写提高音律对齐46%,同时引入参考无关评估方法。

Comments new changes added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25166 2026-08-04 cs.AI 版本更新 57%

Individual-level interventions against sycophantic AI reduce its appeal but not its persuasiveness

观察到谄媚的人工智能认可他人会降低其吸引力,但不会降低其说服力

Meryl Ye, Robert Kraut, Steve Rathje

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨提高用户对谄媚人工智能的认知能否防危害,通过两项预注册实验及合并其他研究发现,警告和视频干预虽改变评价,但未降说服力,个体层面干预或难护用户免受人工智能之害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09195 2026-08-04 cs.LG cs.CV 版本更新 57%

Breaking the Statistical Similarity Trap in Extreme Convection Detection

突破极端对流检测中的统计相似性陷阱

Md Tanveer Hossain Munim

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究针对深度学习气象模型的统计相似性陷阱,提出DART框架,解决粗粒度大气预报转高分辨率卫星亮温场的挑战,在极端对流检测中表现优异,还通过吉大港洪水案例验证了其现实应用价值。

Comments This paper has been withdrawn due to a complete pivot in research direction and methodology. We have shifted from the atmospheric domain application to a general methodological direction. A new version of this research will be submitted separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 57%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13683 2026-08-03 cs.CL 版本更新 57%

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

通过门控语义质量多样性实现自我进化智能体的驾驭

Xiaotian Luo, Dizhan Xue, Fengxingyu Wang, Chuanrui Hu, Yafeng Deng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型智能体驾驭因素提升性能的问题,提出自我进化智能体驾驭框架,将提出与评估更改分开,通过门控存档避免过度拟合,在多领域测试中取得较好泛化效果,证明诊断与评估循环的有效性。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01103 2026-08-03 cs.CL 版本更新 57%

Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking

临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性

William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian Löns, Ronald Böck, Sebastian Fudickar

机构 * University of Luebeck(吕贝克大学) University of Tübingen(图宾根大学) University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) University Hospital Würzburg(维尔茨堡大学医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Genie Enterprise Deutschland GmbH

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 57%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26621 2026-07-31 cs.IR cs.AI 版本更新 57%

WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models

WhisperRec:用于高效基础推荐模型的潜在推理方法

Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, Wenwu Ou

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24845 2026-07-31 cs.IR cs.AI 版本更新 57%

REPREC: Representation Driven Parameter-Efficient Recommendation System

REPREC:表示驱动的参数高效推荐系统

Harshini Kavuru, Dwipam Katariya, Giri Iyengar, Pranab Mohanty, Kalanand Mishra, Raghu Machiraju

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的序列推荐,提出REPREC轻量级框架,通过轻量级用户表示对齐和MLP注入器映射用户嵌入,在多基准数据集实验中优于LoRA,能保持性能并降低训练时间,平衡推荐质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10579 2026-07-31 cs.CL 版本更新 57%

VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios

VISTA:一种用于日常协助的生成性眼动视频框架

Yu-Hsiang Liu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 57%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新 57%

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 57%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04607 2026-07-30 cs.CV cs.AI 版本更新 57%

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement

G2VD:通过反事实干预和因果解缠实现可泛化的人工智能生成视频检测

Meng Du, Hongchang Chen, Ran Li, Junjie Zhang, Qi Ouyang, Shibo Zhang, Shuxin Liu

机构 * Information Engineering University(信息工程大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对AI生成视频检测中因捷径学习导致跨域性能差的问题,提出G2VD框架,用反事实干预管道生成样本并对齐,设计因果解缠分类器,提升了跨域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 57%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07131 2026-07-30 cs.CV cs.AI 版本更新 57%

Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge

深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定

Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong Polytechnic University, Hong Kong(香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出EyExIn框架,通过深度专家注入机制提升视网膜VLMs的领域知识嵌入能力,解决感知与推理间隙问题,实现高精度眼科视觉问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24515 2026-07-29 cs.CL 版本更新 57%

Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets

跨不同数据集对英语-泰米尔语和泰米尔语-英语的大语言模型和基于Transformer的机器翻译的系统分析

Sriharshaa S, Sangeetha Sivanesan, Jaya Nirmala S

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究针对泰米尔语等低资源语言机器翻译挑战,在多数据集上评估多种模型,用BLEU等指标分析其性能,通过注意力分析增强可解释性,证明上下文提示可实现少样本翻译并与监督方法比较,揭示数据集及领域匹配对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 57%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 57%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏