arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2606.19259 2026-07-28 cs.CV cs.AI 版本更新 57%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 57%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 57%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23706 2026-07-24 eess.SP cs.HC cs.LG 版本更新 57%

Zero-Shot Neural Priors for Generalizable Cross-Subject and Cross-Task EEG Decoding

零样本神经先验用于可泛化的跨被试和跨任务脑电解码

Baimam Boukar Jean Jacques, Brandone Fonya, Nchofon Tagha Ghogomu, Pauline Nyaboe, Kipngeno Koech

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对脑电信号跨被试和跨任务泛化难题,提出零样本解码框架,采用渐进解冻策略微调Transformer,在大型数据集上实现优于基线的性能。

Comments EEG Decoding research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00945 2026-07-24 q-bio.GN cs.CV cs.LG 版本更新 57%

Evaluation and Prognostic Validation of Deep Regression Models for WSI-Based Gene-Expression Prediction

基于全切片图像的基因表达预测的深度回归模型的评估与预后验证

Fredrik K. Gustafsson, Constance Boissin, Johan Vallon-Christersson, Mattias Rantalainen

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究对基于全切片图像的基因表达预测的深度回归模型进行评估与验证,采用基于注意力的多实例学习与PFM特征提取器的直接回归,在多个数据集及队列中验证,证明该方法可泛化并恢复有意义分子结构,支持其用于转录组表型分析和风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17075 2026-07-23 cs.CR cs.CL 版本更新 57%

A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs

传统隐私政策分析工具针对大语言模型的系统评估

Madhav Aryal, Sudipa Saha, Sunil Manandhar, Anshuman Chhabra, Kaushal Kafle

机构 * University of South Florida(佛罗里达州立大学) IBM T.J. Watson Research Center(IBM 汤普森研究中心)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文系统评估现成大语言模型能否取代专业隐私分析工具,研究六个具三种主要功能及三个中间任务的工具,对比两个先进大语言模型与工具性能,发现大语言模型在隐私政策和法规分析功能上能匹配或超越现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09530 2026-07-23 cs.CL 版本更新 57%

FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis

FreyaTTS技术报告

Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

专题命中 评测与基准 :post-training(abstract);分类 cs.CL

AI总结 介绍无分词器的土耳其语文本转语音模型Freya-TTS,通过无规则端到端建模、非自回归并行去噪等方法推进框架,在基准测试中表现出色,优于开源系统,适合边缘部署,且已开源模型权重、代码和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30201 2026-07-23 cs.CV cs.CL 版本更新 57%

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

SHOVIR:评估放射学报告生成中视觉捷径学习的基准

Filippo Ruffini, Marco Salmé, Rosa Sicilia, Valerio Guarrasi, Paolo Soda

机构 * UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy(乌尼卡米尔斯-圣卡米卢斯国际健康科学大学,意大利罗马)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出SHOVIR基准,通过遮挡实验检测放射学报告生成模型是否依赖视觉捷径而非真实病理证据,发现高报告质量模型未必具有良好空间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03989 2026-07-23 cs.CV cs.AI 版本更新 57%

When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models

当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针

Qianpu Chen, Derya Soydaner, Rob Saunders

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12985 2026-07-22 cs.AI 版本更新 57%

Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs

抵抗与更新:用于激励兼容大语言模型的反事实报告坐标

Sen Yang, Yuen-Hei Yeung

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究大语言模型在非证据激励压力下误报问题,提出学习和验证反事实报告调解器方法,通过互换干预识别低秩报告坐标,引入CRC钳位,在基准测试中取得成果,贡献了接口和认证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新 57%

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新 57%

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12175 2026-07-20 cs.CV cs.AI 版本更新 57%

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data

从重建到解释:X射线断层扫描数据的零设置多相分割

Pradyumna Elavarthi, Arun J. Bhattacharjee, Harrison Lisabeth, Anca Ralescu, Petrus H. Zwart, Dilworth Parkinson, Elizabeth G. Clark

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究针对X射线断层扫描数据快速解释受限问题,提出零设置多相分割框架,结合材料无关掩码准备策略与预训练语义分割网络,能快速生成诊断级分割,支持近实时束线反馈与可扩展成像工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15677 2026-07-20 cs.CL cs.CV 版本更新 57%

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

VCG-Bench:迈向统一的视觉导向基准,用于结构化生成与编辑

Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (GuangZhou)(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出VCG-Bench,一个统一的视觉导向mxGraph任务基准,通过符号逻辑和XML实现精确的图表生成与编辑,解决现有方法在结构化任务中的局限性。

Comments Accepted by ICML2026, 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00100 2026-07-20 cs.CY cs.AI cs.ET 版本更新 57%

A Scaffolded GenAI Lab in Early Undergraduate CS: A Mixed-Methods, Multi-Course Evaluation

本科早期计算机科学中的一个支架式生成式人工智能实验室:混合方法、多课程评估

Ethan Dickey, Andres Bejarano, Rhianna Kuperus, Bárbara Fagundes

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究在本科早期计算机科学课程中评估 “AI实验室” 这一支架式GenAI素养干预。通过多课程混合方法收集数据,发现其能改变学生对GenAI的态度及使用策略,且不增加评分作业中GenAI的使用量,推动相关三角测量研究。

Comments 18 pages, 3 figures, 18 tables; v2 substantially refined qualitative analysis and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13006 2026-07-16 cs.LG 版本更新 57%

The Spectrum Is Not Enough: When Context Helps Time-Series Forecasting

频谱并不够:上下文何时有助于时间序列预测

Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究时间序列预测中上下文的作用,指出频谱指标与添加上下文等因素回答的问题不同,通过替代对等给出覆盖不足诊断,在七个基准测试中验证,表明窗口键控检索等情况,为部署决策提供区分、比较及诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12252 2026-07-16 cs.CL 版本更新 57%

FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality

金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量

Beidi Luan, Rui Sun, Sinuo Wang, Yan Gu, Chao Li, Zhenliang Xiong, Jing Li, Zuo Bai

机构 * StepFun(步趣) FinStep(鳍步) University of Adelaide(阿德莱德大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06614 2026-07-16 cs.CV cs.LG 版本更新 57%

Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels

整体最优标签选择用于在部分标签下的鲁棒提示学习

Yaqi Zhao, Haoliang Sun, Yating Wang, Yongshun Gong, Yilong Yin

机构 * Shandong University, Jinan, China(山东大学(济南,中国))

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出Holistic Optimal Label Selection方法,通过局部密度过滤和全局最优传输策略,提升部分标签下的提示学习性能,实验表明其在八个基准数据集上表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18548 2026-07-16 cs.SE cs.AI 版本更新 57%

1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World

1D-Bench: 一个用于具有实时反馈的现实世界迭代UI代码生成的基准

Qiao Xu, Yipeng Yu, Chengxiao Feng, Xu Liu

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 1D-Bench通过现实电商工作流提供迭代UI代码生成基准,测试模型在中间表示缺陷下的鲁棒性,实验表明迭代编辑能提升渲染成功率和视觉相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05860 2026-07-16 cs.CL 版本更新 57%

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

克服语言障碍:对2023年瑞士隐私法影响的多语言分析

Luka Nenadic, David Rodriguez, Joseph A. Calandrino

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。

Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23993 2026-07-14 cs.CL 版本更新 57%

The GRADIEND Python Package: An End-to-End System for Gradient-Based Feature Learning

GRADIEND Python包:一种基于梯度的特征学习端到端系统

Jonathan Drechsel, Steffen Herbold

机构 * Faculty of Computer Science and Mathematics University of Passau(计算机科学与数学学院 巴伐利亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 GRADIEND Python包提供端到端系统,通过语言模型中的事实-反事实MLM和CLM梯度学习特征方向,并支持特征数据创建、训练、评估及多特征比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07533 2026-07-14 cs.IR cs.CL cs.DL 版本更新 57%

Loci Similes: A Benchmark for Extracting Intertextualities in Latin Literature

《相似轨迹:拉丁文学中互文性提取的基准》

Julian Schelb, Michael Wittweiler, Marie Revellio, Barbara Feichtinger, Andreas Spitz

机构 * Department of Computer and Information Science, University of Konstanz(计算机与信息科学系,康斯坦茨大学) Department of Latin Philology, University of Konstanz(拉丁语言学系,康斯坦茨大学) Department of Archaeology, Classical Philology and Ancient Studies, University of Zurich(考古学、古典语言学与古代研究系,苏黎世大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对拉丁文学互文性提取任务,因缺乏标准化基准和数据集阻碍新方法发展的问题,引入“相似轨迹”基准,利用约172k文本片段数据集及545个相似之处,用先进语言模型建立互文性检索和分类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新 57%

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13994 2026-07-10 cs.CV cs.AI q-bio.NC 版本更新 57%

Human-like Object Grouping in Self-supervised Vision Transformers

自监督视觉Transformer中的类人物体分组

Hossein Adeli, Seoyoung Ahn, Andrew Luo, Mengmi Zhang, Nikolaus Kriegeskorte, Gregory Zelinsky

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文通过行为基准测试,探讨自监督视觉模型在物体感知上的类人特性,发现基于DINO目标的Transformer模型在预测人类反应时间方面表现最佳,且Gram矩阵结构对感知对齐有驱动作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新 57%

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 57%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11539 2026-07-08 cs.CV cs.AI 版本更新 57%

CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性

Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。

Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY

详情

展开后加载摘要…

URL PDF HTML 收藏