arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2606.03888 2026-06-03 cs.CV cs.LG 74%

CoralBay: A Self-Supervised CT Foundation Model

CoralBay: 一种自监督CT基础模型

Ioannis Gatopoulos, Nicolas Känzig, Sebastian Otálora, Fei Tang

机构 * kaiko.ai(Kaiko AI)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 提出CoralBay框架,通过分层3D Swin骨干网络和自蒸馏学习多尺度特征,实现CT体积数据的自监督预训练,有效提升下游放射学任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03648 2026-06-03 cs.CL cs.AI 73%

Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

微调大语言模型的安全性测量应基于能力

Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi, Svetlana Kiritchenko

机构 * National Research Council, Canada(加拿大国家研究理事会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过将微调锚定于特定能力目标,多维度评估微调对模型能力和安全性的影响,发现微调模型对安全提示可能产生不连贯输出、自动安全判断不可靠,且结论因安全基准和评估者而异。

Comments 8 pages plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI 73%

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02584 2026-06-03 cs.CL cs.AI cs.IR 73%

IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation

IdiomX:习语理解、检索和解释的多语言基准

Ayman Ali Sharara

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IdiomX,一个大规模多语言习语基准,通过可复现的多阶段流水线构建,涵盖190K+上下文示例和12K+习语,定义四项任务(检测、上下文-习语检索、阿拉伯语-英语习语检索、习语解释),实验表明上下文Transformer模型提升检测,混合检索重排序增强单语和跨语言检索,习语解释可建模为语义检索任务。

Comments 12 pages, 21 figures. Includes dataset and code. Resources available on HuggingFace, Kaggle, and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-06-03 cs.CL cs.LG 73%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13174 2026-06-03 cs.AI cs.LG q-fin.CP stat.ML 73%

AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining

AlphaEval:一个全面高效的公式化Alpha挖掘评估框架

Hongjun Ding, Binqi Chen, Jinsheng Huang, Taian Guo, Zhengyang Mao, Guoyi Shao, Lutong Zou, Luchen Liu, Ming Zhang

机构 * CUNY Baruch College(CUNY 巴纳特学院) Peking University(北京大学) Harvard University(哈佛大学) Zhengren Research(正人研究所) Zhengren Quant(正人量化)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AlphaEval框架,通过五个维度(预测能力、稳定性、鲁棒性、金融逻辑、多样性)对自动Alpha挖掘模型进行统一、可并行化且无需回测的评估,实现与回测相当的评估一致性并提高效率。

Comments Accepted by KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03879 2026-06-03 cs.CV cs.AI 70%

Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

超越编码器累加:衡量多编码器视觉语言模型中编码器的作用

Wei Ding, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Macau(澳门大学) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 通过重新训练所有31个非空子集,提出容量-必要性分解和预投影器秩分析,揭示多编码器视觉语言模型中编码器角色并非简单累加,并给出最优配对原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03635 2026-06-03 cs.CV cs.AI 70%

VidMsg: A Benchmark for Implicit Message Inference in Short Videos

VidMsg:短视频中隐含信息推断的基准测试

Issar Tzachor, Michael Green, Rami Ben-Ari

机构 * OriginAI, Israel(OriginAI以色列)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。

Comments Project page: https://iyttor.github.io/VidMsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03453 2026-06-03 cs.CR cs.AI cs.MA 70%

FORGE: Multi-Agent Graduated Exploitation and Detection Engineering

FORGE:多智能体渐进式利用与检测工程

Farooq Shaikh

机构 * Dynatrace

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多智能体系统FORGE,通过渐进式利用深度桥接漏洞利用生成、优先级排序和检测规则工程三个孤立领域,在603个CVE上实现67.8%的端到端L1+利用,并生成低误报的Sigma和Snort检测规则。

Comments 18 pages, 4 figures, 3 tables. Accepted at the AgentCy Workshop at the 21st International Conference on Availability, Reliability and Security (ARES 2026). Keywords: Vulnerability assessment, Multi-agent systems, Exploit generation, Detection engineering, Risk prioritization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03312 2026-06-03 cs.RO cs.AI 70%

RobotValues: Evaluating Household Robots When Human Values Conflict

RobotValues: 当人类价值观冲突时评估家用机器人

Jongwook Han, Hyeongjin Kim, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RobotValues基准,通过10K个价值冲突场景评估家用机器人规划器,发现视觉语言模型存在默认价值偏好且难以覆盖,表明评估需考虑价值冲突下的行动选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03291 2026-06-03 cs.CL 70%

Multilingual Unlearning in LLMs: Transfer, Dynamics, and Reversibility

大型语言模型中的多语言遗忘:迁移、动态与可逆性

Chaoyi Xiang, Olga Ohrimenko, Benjamin I. P. Rubinstein, Lea Frermann

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过扩展TOFU基准到五种语言,研究大型语言模型中的多语言遗忘,发现遗忘迁移在不同语言间高度可变,且遗忘主要作用于后期解码层而非共享的跨语言潜在空间,因此可以通过推理时的单一引导方向逆转大部分遗忘效果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02060 2026-06-03 cs.AI 70%

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

深度研究代理在何处出错?代理轨迹中的跨度级错误定位

Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) JIUTIAN Research(JIUTIAN研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对深度研究代理在长轨迹中难以定位错误的问题,本文通过构建TELBench基准和提出DRIFT审计框架,实现了跨度级错误定位,将首次错误定位准确率提升高达30个百分点。

Comments 28 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28556 2026-06-03 cs.AI 70%

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

品味问题:提高智能体基准测试的覆盖率和难度

Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichart

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TASTE方法,通过反转任务构建流程,利用自适应对比n-gram模型和聚类自动生成覆盖广泛工具组合的高难度基准任务,以解决现有基准饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13663 2026-06-03 cs.PL cs.LG 70%

SAIL: Sound Abstract Interpreters with LLMs

SAIL: 基于LLM的可靠抽象解释器

Qiuhan Gu, Avaljot Singh, Gagandeep Singh

专题命中 评测与基准 :LLM(title_cn);分类 cs.LG

AI总结 提出SAIL框架,利用大语言模型自动合成全局可靠的抽象变换器,通过约束优化和代价函数确保可靠性,在神经网络验证中匹配甚至超越人工设计的变换器。

Comments 43 pages, 21 figures

Journal ref Proc. ACM Program. Lang. 10, PLDI, Article 230, 26 pages (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17484 2026-06-03 cs.DC cs.AI 70%

Power- and Fragmentation-aware Online Scheduling for GPU Datacenters

面向GPU数据中心的功耗与碎片感知在线调度

Francesco Lettich, Emanuele Carlini, Franco Maria Nardini, Raffaele Perego, Salvatore Trani

机构 * Istituto di Scienza e Tecnologie dell’Informazione "Alessandro Faedo", Consiglio Nazionale delle Ricerche(阿莱索·法多信息科学与技术研究所,意大利国家研究委员会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GPU数据中心在线调度问题,提出PWR调度策略,结合碎片梯度下降(FGD)方法,在降低功耗和最小化GPU碎片之间取得平衡。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV 67%

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03387 2026-06-03 cs.CR 67%

Bastet: A Fine-Grained Expert-Labeled Dataset for DeFi Smart Contract Vulnerability Detection

Bastet:用于DeFi智能合约漏洞检测的细粒度专家标注数据集

Wan-Hsuan Hsu, Wei-Hsin Wang, Cheng-Yu Liou, Ting-Rui Ke, Kentaroh Toyoda

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有数据集存在的过时Solidity版本、自动标注噪声和粗粒度标签问题,提出基于真实审计报告和专家共识标注的细粒度两层分类法(46个标签和77个子标签)的DeFi智能合约漏洞数据集Bastet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03786 2026-06-03 physics.soc-ph stat.ME 67%

Disentangling conviction and conformity: a Bayesian ideal point model of voting behaviour in online debates

区分信念与从众:在线辩论中投票行为的贝叶斯理想点模型

Elena Candellone

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出贝叶斯逻辑回归模型,区分在线辩论中基于信念的conviction和基于同伴影响的conformity,并在this http URL数据集上发现不同话题下两种机制的主导性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23055 2026-06-03 cs.LG cs.AI cs.CL 67%

Decomposing and Measuring Evaluation Awareness

分解与度量评估意识

Changling Li, Terry Jingchen Zhang, Jie Zhang, Zhijing Jin, Sahar Abdelnabi, Maksym Andriushchenko

机构 * ETH Zürich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究院) Tübingen AI Center(图宾根人工智能中心) University of Toronto & Vector Institute(多伦多大学及向量研究所) EuroSafeAI(欧洲安全人工智能)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究借鉴社会心理学,将评估意识分解为环境与模型两部分,通过EvalAwareBench基准测试发现识别率取决于模型与基准的配对,且识别很少导致行为改变,安全评估比能力评估更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19684 2026-06-03 cs.LG cs.AI cs.CL cs.CV 67%

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

CoMPAS3D: 一个用于交互动作的数据集和基准

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica Lim

机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。

Comments https://rosielab.github.io/compas3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12574 2026-06-03 cs.IR 67%

Uncovering Competing Poisoning Attacks in Retrieval-Augmented Generation

揭示检索增强生成中的竞争性投毒攻击

Liuji Chen, Xiaofang Yang, Yuanzhuo Lu, Jinghao Zhang, Xin Sun, Qiang Liu, Shu Wu, Jing Dong, Liang Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对检索增强生成系统,研究多个攻击者同时投毒以争夺同一查询目标的问题,提出竞争有效性指标和PoisonArena框架。

Comments Accepted by KDD 2026. Project page: https://poison-arena.github.io/

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03544 2026-06-03 cs.AI cs.CL 62%

SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

SAGE: 智能体生态中社会化演化的定量评估

Linyue Pan, Yaoming Zhu, Lin Qiu, Xuezhi Cao, Xunliang Cai

机构 * Tsinghua University, China(清华大学, 中国) Meituan, China(美团, 中国)

专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 提出SAGE框架,通过对比社会演化(SocialEvo)与自我演化(SelfEvo)两种计算条件,在三个领域评估共享经验对智能体性能的影响,发现群体历史并非普遍放大器,但能帮助陷入停滞的智能体取得突破,且社会收益依赖于抽象能力而非暴露量。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18572 2026-06-03 cs.CV cs.AI cs.LG 62%

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

回到柏拉图的洞穴:大规模检验跨模态表示收敛性

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros

机构 * UC Berkeley(伯克利大学) Technical University Munich, MCML(慕尼黑技术大学) University of Tübingen, Tübingen AI Center(图宾根大学) Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。

Comments Project page: http://akoepke.github.io/cave_umwelten/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11429 2026-06-03 cs.CL cs.AI 62%

Relational Linearity is a Predictor of Hallucinations

关系线性是幻觉的预测因子

Yuetian Lu, Yihong Liu, Sebastian Gerstner, Lea Hirlimann, Jonas Rohweder, Hinrich Schütze

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过合成未知实体基准测试,发现语言模型在回答线性关系问题时更容易产生幻觉,且关系线性度与幻觉率强相关。

Comments 15 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03292 2026-06-03 stat.ML cs.LG 57%

Combining Statistical Features and Deep Encodings for Rehearsal-Based Class-Incremental Time Series Classification

结合统计特征与深度编码的基于排练的类增量时间序列分类

Pablo García-Santaclara, Bruno Fernández-Castro, Rebeca Pilar Díaz-Redondo

机构 * atlanTTic – ICLAB, Universidade de Vigo(atlanTTic–ICLAB,维戈大学) Centro Tecnolóxico de Telecomunicacións de Galicia (GRADIANT)(加利西亚电信技术中心(GRADIANT)) Universidade de Vigo(维戈大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出一种双流特征提取管道(结合预训练冻结基础模型的深度时间嵌入特征与统计特征),用于多变量时间序列的类增量持续学习,在五个基准数据集上实现了有竞争力的平均准确率和低遗忘率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03686 2026-06-03 cs.AI 57%

The DeepSpeak-Agentic Dataset

DeepSpeak-Agentic 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Stanford University, USA(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出了一个包含37小时人机半结构化对话视频的数据集DeepSpeak-Agentic,用于评估AI代理的自动取证识别、研究人机交互特性,并作为大型语言模型和AI生成语音/面部技术的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01166 2026-06-03 cs.CR cs.CL 57%

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

Yunhao Feng, Xiaohu Du, Xinhao Deng, Yifan Ding, Ming Wen, Yixu Wang, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Kerui Cao, Wenke Huang, Yanming Guo, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hunan Institute of Advanced Technology(湖南高级技术研究所) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出BraveGuard框架,通过从开放世界威胁信号和真实代理轨迹中训练防护模型,实现轨迹级别的安全检测,显著提升计算机使用代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09755 2026-06-03 cs.CR cs.LG 57%

Jailbreak Attack Initializations as Extractors of Compliance Directions

越狱攻击初始化作为合规方向的提取器

Amit Levi, Rom Himelstein, Yaniv Nemcovsky, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion - Israel Institute of Technology(技术学院计算机科学系) Department of Data and Decision Science, Technion - Israel Institute of Technology(技术学院数据与决策科学系) School of Electrical and Computer Engineering Engineering, Ben-Gurion University of the Negev(内盖夫本· Gurion大学电气与计算机工程学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.LG

AI总结 本文发现基于梯度的越狱攻击初始化会收敛到抑制拒绝的单一合规方向,并据此提出CRI框架,通过沿合规方向投影未见提示来提高攻击成功率并降低计算开销。

Comments Accepted to Findings of the Association for Computational Linguistics 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03682 2026-06-03 cs.RO 50%

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation

GN0:迈向视觉语言导航中生成、评估与策略学习的统一范式

Xinhai Li, Xiaotao Zhang, Yuehao Huang, Jiankun Dong, Tianhang Wang, Sunyao Zhou, Yunzi Wu, Chengnuo Sun, Yunfei Ge, Qizhen Weng, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(人工智能研究院,中国电信) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tongji University(同济大学) Fudan University(复旦大学) Jiangsu University(江苏大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GN0统一框架,通过自动生成大规模导航数据集GN-Matrix、基于3DGS的高保真仿真平台和BEV基准GN-Bench,结合RL驱动的导航基础模型BAE,在VLN任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03401 2026-06-03 cs.CV 50%

Towards Characterizing Scientific Image Utility and Upgradability

面向科学图像效用与可升级性的表征

WenZhe Li, Qihang Yan, Liang Chen, Junying Wang, Farong Wen, Yijin Guo, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对AI生成内容对科学图像完整性的威胁,提出SIU²A框架,通过效用(错误检测与修正可行性)和可升级性(修正质量)两个维度评估科学图像,并构建基准数据集揭示当前多模态系统在科学错误评估与忠实修正方面的显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏