arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2607.14707 2026-07-21 cs.CL cs.AI 版本更新 79%

Harnessing LLMs for Reliable Academic Supervision: A Comparative Study

利用大语言模型进行可靠的学术监督:一项比较研究

Akash Raj

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究以学术监督为案例,比较无支架的GPT-5聊天机器人基线与多模块系统ASuS,ASuS将小模型GPT-4o-mini封装在LangGraph支架中,经评估发现ASuS在各维度表现更优,提取了七种模式,挑战“大模型更好”直觉。

Comments 16 pages, 4 tables, 1 figure. Code and data available at https://github.com/AkashRajSingh/Harnessing-LLMs-for-Reliable-Academic-Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17356 2026-07-21 cs.AI cs.LG 版本更新 79%

Comprehend, Divide, and Conquer: Feature Subspace Exploration via Multi-Agent Hierarchical Reinforcement Learning

理解、划分与征服:通过多智能体分层强化学习进行特征子空间探索

Weiliang Zhang, Xiaohan Huang, Yi Du, Ziyue Qiao, Qingqing Long, Zhen Meng, Yuanchun Zhou, Meng Xiao

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Great Bay University(Great Bay大学) Duke-NUS Medical School, National University of Singapore(新加坡国立大学杜克-奈素医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对特征选择问题,提出HRLFS方法,先利用基于大语言模型的混合状态提取器捕捉特征特性并聚类,构建分层智能体,通过多智能体分层强化学习进行特征子空间探索,提升了下游机器学习性能并加速运行

Comments 25 pages, keywords: Automated Feature Engineering, Tabular Dataset, Multi-Agent Reinforcement Learning, Feature Selection, Accepted by ACM Transactions on Knowledge Discovery from Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26842 2026-07-17 cs.LG cs.AI cs.CV 版本更新 79%

VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection

VAN-AD:基于归一化流的视觉掩码自编码器用于时间序列异常检测

PengYu Chen, Shang Wan, Xiaohou Shi, Yuan Chang, Yan Sun, Sajal K. Das

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute Beijing(中国电信研究院北京) Department of Computer Science, Missouri University of Science and Technology(计算机科学系,密苏里科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VAN-AD,通过归一化流模块和自适应分布映射模块改进视觉掩码自编码器,提升时间序列异常检测的泛化能力和局部感知能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15239 2026-07-15 cs.CL cs.AI econ.GN q-fin.EC stat.ME 版本更新 79%

Modeling Story Expectations: A Generative Framework using LLMs

建模故事期望:一种使用大语言模型的生成框架

Hortense Fong, George Gui, Bo Yang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对非结构化叙事内容建模消费者故事期望的难题,利用大语言模型生成故事延续并提取特征,通过两种验证程序,将其应用于不同数据发现模型期望与人类信念及实际故事延续相关,为叙事内容信念建模提供可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06401 2026-07-14 cs.AI cs.CL 版本更新 79%

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型

Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

机构 * HiThink Research(HiThink研究机构) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20459 2026-07-03 cs.AI cs.CL 版本更新 79%

PreScience: A Dataset and Benchmark for Scientific Forecasting

PreScience:一个用于科学预测的数据集和基准

Anirudh Ajith, Amanpreet Singh, Jay DeYoung, Nadav Kunievsky, Austin C. Kozlowski, Oyvind Tafjord, James Evans, Daniel S. Weld, Tom Hope, Doug Downey

机构 * Allen Institute for Artificial Intelligence(Allen人工智能研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) School of Computer Science and Engineering, Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PreScience数据集和基准,包含98K篇AI论文及关联数据,设计7项预测任务,开发基线方法及LACER评估指标,发现合成论文多样性低于人类。

Comments 11 pages (70 with bibliography and appendix), 3 figures (14 with appendix), 5 tables (18 with appendix), 1 algorithm in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新 79%

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29676 2026-06-18 cs.AI cs.CL 版本更新 79%

Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems

符号至关重要:智能体AI系统中令牌优化格式的基准研究

Lorenz Kutschka, Bernhard Geiger

机构 * Know Center Research GmbH(知中心研究有限公司) Graz University of Technology(格拉茨技术大学) Graz Center for Machine Learning(格拉茨机器学习中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究在四个智能体基准上评估了两种令牌优化格式TOON和TRON,发现TRON在保持准确率的同时最多减少27%的令牌,而TOON虽减少18%但存在多轮解析失败和并行工具调用输出崩溃的问题。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-06-12 cs.CL cs.AI cs.DB 版本更新 79%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12306 2026-06-10 cs.LG cs.AI 版本更新 79%

GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support

GCA框架:面向海湾合作委员会国家的数据集与气候决策支持智能体管道

Muhammad Umer Sheikh, Khawar Shehzad, Salman Khan, Fahad Shahbaz Khan, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) University of Missouri(密苏里大学) Australian National University(澳大利亚国立大学) Linköping University(林肯大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GCA框架,包含GCC国家多模态数据集GCA-DS和工具增强型智能体GCA,通过领域微调和工具集成提升气候决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22097 2026-06-09 cs.SE cs.AI cs.CL cs.CR 版本更新 79%

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios

SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码

Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。

Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10119 2026-08-17 cs.SE 版本更新 78%

IntrinTrans: LLM-based Intrinsic Code Translator for RISC-V Vector

IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器

Liutong Han, Zhiyuan Tan, Hongbin Zhang, Pengcheng Wang, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09302 2026-08-12 cs.CV 版本更新 78%

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

用于宫腔镜手术场景分割的自举式视觉-语言模型

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。

Comments Accept by Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03804 2026-08-12 cs.HC 版本更新 78%

How Usable Are Geospatial Foundation Models? A Systematic Evaluation of 89 Models

地理空间基础模型的可用性如何?对89个模型的系统评估

Robin Young, Artyom Gabtraupov, Kenzy Soror, Srinivasan Keshav

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究针对89个地理空间基础模型(GeoFMs),结合生态学家需求与人机交互理论构建七维度评估框架,发现近三分之一模型除源代码外无从业者支持,为GeoFM的可用性优化提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21606 2026-08-12 cs.CV 版本更新 78%

Exploring Decoupled Spatio-Temporal Consistency Learning and Self-Prompting Evolution for Self-Supervised Tracking

探索用于自监督跟踪的解耦时空一致性学习与自提示演化

Yaozong Zheng, Bineng Zhong, Qihua Liang, Ning Li, Haiying Xia, Shuxiang Song, Rongrong Ji

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本研究提出SSTrack++自监督跟踪模型,通过弱到强自监督框架、解耦时空一致性策略等,在十个基准数据集上超越SOTA自监督跟踪方法,显著缩小与全监督跟踪器的性能差距。

Comments IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19069 2026-08-11 cs.CV 版本更新 78%

Delineate Anything v2: A Global Foundation Model for Field Delineation

描绘一切 v2:用于田地描绘的全球基础模型

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Charlotte Julia Li-Xing Wang, Zoltan Szantoi

机构 * European Space Agency(欧洲航天局) Space Research Institute NASU-SSAU(乌克兰国家科学院-乌克兰国家空间局空间研究所) University of Maryland(马里兰大学) National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”(乌克兰国立技术大学“ Igor Sikorsky基辅理工学院”)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对大规模农业田地边界描绘难题,提出全球可扩展基础模型描绘一切 v2,构建 FBIS - 73M 数据集,引入特定数据处理管道,建立评估基准,该模型超越现有技术,速度适合大规模部署,相关资源公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新 78%

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08813 2026-08-11 cs.RO 版本更新 78%

Calib3R: Hand-Eye Calibration and 3D Metric-Scaled Scene Reconstruction with 3D Foundation Models

Calib3R:基于三维基础模型的手眼标定与三维度量尺度场景重建

Davide Allegro, Matteo Terreran, Stefano Ghidoni

机构 * Department of Information Engineering (DEI) at the University of Padova(帕多瓦大学信息工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 Calib3R是一种基于3D基础模型的无标定板方法,通过统一优化联合完成手眼标定与度量尺度三维重建,仅用不到10张图像即可实现精确标定,性能优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04549 2026-08-07 cs.CL cs.AI cs.LG 版本更新 78%

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

EuroExec:前沿语言模型在欧洲行政决策任务上未能达到专家判断水平

Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

机构 * Sovrano AI(索夫拉诺人工智能公司)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建含413项欧洲行政任务的EuroExec基准,评估6款前沿LLMs,发现其解决率仅56.9%,远低于专家水平,凸显前沿LLMs在这类任务上的不足及人工评估的必要性。

Comments 17 pages, 9 figures, 12 tables, submitted to EACL 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02039 2026-08-05 cs.CV 版本更新 78%

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?

Hongjie Zhou, Shiqin Wang, Haoyang Chen, Haonan Guo, Di Wang, Juhua Liu, Fu Lin, Yong Luo

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新 78%

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00787 2026-08-04 cs.SE 版本更新 78%

The Rise of Language Models in Mining Software Repositories: A Survey

语言模型在软件仓库挖掘中的兴起:综述

Miguel Romero-Arjona, Saman Barakat, Ana B. Sánchez, Sergio Segura

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文综述了语言模型在软件仓库挖掘中的应用,分析了85篇论文,探讨了模型的应用方式、分析的 artifacts 类型、模型演变及可重复性,提出分类并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03831 2026-07-29 cs.CV 版本更新 78%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17643 2026-07-27 cs.HC cs.CY 版本更新 78%

Informal Learning Emerges in Everyday Human-LLM Interaction

日常人类与大语言模型交互中出现的非正式学习

Zixin Chen, Haotian Li, Ziang Xiao, Huamin Qu, Xing Xie

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究日常人类与大语言模型交互中的非正式学习,通过分析大规模对话,将学习科学结构转化为行为特征,发现认知与建设性参与情况及相关因素,表明交互含非正式学习特征,转变了AI评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22222 2026-07-27 eess.SP 版本更新 78%

WiFo-2: a generalist foundation model unifies heterogeneous wireless system design

WiFo-2:一种通用基础模型统一异构无线系统设计

Boxun Liu, Xuanyu Liu, Shijian Gao, Xuesong Cai, Xiang Cheng, Liuqing Yang

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 WiFo-2通过统一无线通信与传感系统设计,实现异构无线系统设计的通用化,利用大规模CSI数据训练,提升跨场景、配置和任务的泛化能力,展现缩放律行为,优于传统监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18311 2026-07-27 cs.CV 版本更新 78%

Improving Large Vision-Language Models' Understanding for Flow Field Data

提升大型视觉-语言模型对流场数据的理解能力

Xiaomei Zhang, Hanyu Zheng, Xiangyu Zhu, Jinghuan Wei, Junhong Zou, Zhen Lei, Zhaoxiang Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 FieldLVLM通过场感知语言生成策略和数据压缩多模态模型调优,提升大型视觉-语言模型对流场数据的理解能力。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新 78%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 78%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16667 2026-07-22 cs.CV 版本更新 78%

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

在放弃之前再看一眼:预算约束下的共形证据获取用于可靠的视觉-语言模型

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * South China University of Technology(华南理工大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进智能研究中心) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对视觉-语言模型幻觉问题,提出预算约束共形证据获取(BCEA)方法,通过三级决策(回答、放弃或获取额外视觉证据)在有限计算预算下控制幻觉率,并恢复有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 78%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏