arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-12 至 2026-06-12 共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 73 篇

2606.13204 2026-06-12 cs.IR 新提交 75%

CoDeR: Local Constraint-Compatible Retrieval Beyond Semantic Similarity

CoDeR: 超越语义相似性的局部约束兼容检索

Xingkun Yin, Xuebin Tang, Hongyang Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对约束敏感查询中语义相似性作为相关性代理的失效问题,提出CoDeR方法,通过分离主题相关性与约束兼容性,利用对比学习训练兼容性评分器,在不调用外部大模型的情况下实现约束兼容检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07516 2026-06-12 math.PR 新提交 75%

Counterintuitive problems in discrete probability

离散概率中的反直觉问题

Luca Avena, Gianmarco Bet, Bernardo Busoni

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文收集了一系列离散概率中的反直觉问题及详细解答,旨在挑战启发式推理,评估大语言模型在概率推理中的认知偏差。

Comments Feedback on possible mistakes or typos and suggested additions to the list of problems are welcome at the email address of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 75%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12809 2026-06-12 cs.AI cs.LG 新提交 73%

MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs

MLUBench: 多模态大语言模型终身遗忘评估基准

He Li, Haoang Chi, Qizhou Wang, Yunxin Mao, Zhiheng Zhang, Jie Tan, Tongliang Liu, Wenjing Yang, Bo Han

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MLUBench基准,评估多模态大模型在连续遗忘请求下的性能,发现现有方法存在累积退化,并揭示多模态对齐保持的挑战,提出LUMoE方法缓解退化。

Comments 36 pages, accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12616 2026-06-12 cs.AI cs.CL 新提交 73%

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体

Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13249 2026-06-12 cs.AI 新提交 70%

Multi-Field Hybrid Retrieval-Augmented Generation for Maritime Accident Root Cause Analysis

面向海事事故根因分析的多字段混合检索增强生成

Seongjin Kim, Sungil Kim

机构 * Department of Industrial Engineering, Ulsan National Institute of Science and Technology (UNIST)(蔚山国立科学技术院工业工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多字段混合检索增强生成框架,利用结构化事故卡片和分层原因分类,通过字段感知的混合检索与融合排序,显著提升海事事故根因分析的检索和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13100 2026-06-12 cs.CL 新提交 70%

LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction

LEDGER:基于公司年报的长上下文基准,用于基于事实的金融检索与提取

Charles Moslonka, Amaury de Vitry, Arthur Garnier, Hicham Randrianarivo, Emmanuel Malherbe

机构 * Artefact Research Center(Artefact 研究中心) MICS, CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学中央理工高等电力学院 MICS 实验室) Ardian

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LEDGER基准,包含4,999份数字化公司年报,用于评估大语言模型在长上下文金融任务中的表现,涵盖KPI检索、单值查找和全量提取任务。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12984 2026-06-12 cs.CL 新提交 70%

SkillChain: Closing the Loop on Skill Evolution for Image-Based E-Commerce AI Assistants

SkillChain: 为基于图像的电商AI助手闭环技能演化

Yimin Hu, Mengtao Xu, Hao Guo, Yuheng Song, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SkillChain框架,通过技能创建、路由优化和主体精炼三阶段自动化技能生命周期,解决电商图像助手多意图混淆问题,显著提升响应质量和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12924 2026-06-12 cs.AI 新提交 70%

Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce

迭代优化搜索:面向电子商务中智能搜索架构评估的双智能体仿真框架

Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

机构 * eBay Inc.(eBay公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出模块化双智能体仿真框架,通过固定买家智能体对比不同应答器设计,发现滚动窗口记忆在质量和速度上优于意图提取记忆,并基于失败分析将失败率降低62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12871 2026-06-12 cs.AI 新提交 70%

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

DailyReport: 一个用于评估搜索代理在日常搜索任务上的开放式基准

Jingxuan Han, Wei Liu, Mingyang Zhu, Youpeng Wang, Ziwen Wang, Lin Qiu, Xuezhi Cao, Xunliang Cai, Zheren Fu, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DailyReport基准,包含150个开放式日常搜索任务和3546个级联评分标准,通过分解子任务和维度评估,揭示当前搜索代理系统仍未能满足用户期望。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12790 2026-06-12 cs.CL 新提交 70%

GENIE: A Fine-Grained Measure for Novelty

GENIE:一种细粒度新颖性度量方法

Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng, Greg Durrett, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GENIE指标,通过任务特定特征细粒度衡量模型生成内容的新颖性,克服整体指标无法捕捉高维新颖性的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12748 2026-06-12 cs.CL 新提交 70%

Agent-based models for the evolution of morphological alternation patterns

基于智能体的形态交替模式演化模型

Aravinth Kulanthaivelu, Richard Sproat

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过多智能体模拟,研究形态交替(如go/went)的涌现机制,发现无标度社交网络和随机采纳策略能产生更真实的形态模式。

Comments 51 + 37 pages. 31 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12709 2026-06-12 cs.MA cs.CR cs.LG 新提交 70%

Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows

更聪明的破坏者,更好的修复者:线性多智能体工作流中的规模与安全性

Timothy McAllister, Sina Abdidizaji, Ivan Garibay, Ozlem Ozmen Garibay

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究模型规模对线性多智能体工作流安全性的影响,发现大模型更易执行恶意指令,但轻量级修复阶段可恢复性能,表明线性结构在适当校正下具有鲁棒性。

Comments 16 pages (4 are main text), 2 figures, 6 tables. Accepted to the AIWILD Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12040 2026-06-12 cs.AI cs.GR 新提交 70%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07218 2026-06-12 cs.IR cs.CL 新提交 70%

HKVM-RAG: Key-Value-Separated Hypergraph Evidence Organization for Multi-Hop RAG

HKVM-RAG:用于多跳RAG的键值分离超图证据组织

Mingyu Zhang, Ying Ma

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出HKVM-RAG,一种键值分离的证据组织层,通过超图键值检索改进多跳RAG的证据链暴露,在三个基准上提升F1分数。

Comments Submitted to ICDE 2027. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20763 2026-06-12 cs.LG 版本更新 70%

ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

ShapeBench: 一种可扩展的基准和诊断套件,用于气动形状优化的标准化评估

Shaghayegh Fazliani, Krissh Chawla, Jack Guo, Yiren Shen, Matthias Ihme, Madeleine Udell

机构 * Stanford University(斯坦福大学) Spinoza Labs(斯皮诺扎实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出ShapeBench,一个开源的气动形状优化基准,提供统一的API,涵盖103个任务和八个形状类别,通过验证的代理模型和高保真CFD流程进行系统分析,展示了不同形状类别和问题形式中优化器排名的显著差异,强调了需要更通用方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21227 2026-06-12 cond-mat.mtrl-sci cs.AI 版本更新 70%

PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation

PhononBench:面向晶体生成中动态稳定性的基于声子的大规模基准

Xiao-Qi Han, Ze-Feng Gao, Wen-Kao Li, Peng-Jie Guo, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PhononBench,首个大规模AI生成晶体动态稳定性基准,利用MatterSim势高效计算声子,评估7个模型生成的133,838个结构,发现平均动态稳定性率仅32.15%。

Comments 53 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13477 2026-06-12 cs.LG cs.AI cs.CL 新提交 67%

SupraBench: A Benchmark for Supramolecular Chemistry

SupraBench: 超分子化学基准

Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 为评估大语言模型在超分子化学推理中的能力,与领域专家合作发布了首个超分子基准SupraBench,包含四个基本任务和一个辅助视觉任务,并提供了16M令牌的语料库SupraPMC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12469 2026-06-12 cs.CR 新提交 67%

Influence Factors on RAG Poisoning

RAG投毒的影响因素

Pedro Pereira, Eva Maia, Isabel Praça, Adrien Bécue

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 通过432种配置的全因子实验,研究数据集、检索器类型、检索深度、数据库组成、分块策略和生成模型对RAG系统投毒鲁棒性的影响,发现检索器架构、数据集和检索深度是主要因素,且投毒脆弱性源于多组件交互。

Comments 10 pages, 3 figures, 2 Tables, conference KES-2026 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01391 2026-06-12 cs.CV 版本更新 67%

VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

VISTA:视频交互时空分析基准

Alejandro Aparcedo, Akash Kumar, Aaryan Garg, Dalton Pham, Wen-Kai Chen, Anirudh Bharadwaj, Aman Chadha, Yogesh Rawat

机构 * University of Central Florida(中央佛罗里达大学) BITS Pilani(比特斯理工学院) Ho Chi Minh City University of Science(胡志明市科学大学) Amazon GenAI Project(亚马逊生成人工智能项目)

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。

Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13513 2026-06-12 cs.AI 新提交 57%

CloudCons: A Comprehensive End-to-End Benchmark for Cloud Resource Consolidation

CloudCons:云资源整合的全面端到端基准测试

Xiaobin Zhang, Lefei Shen, Mouxiang Chen, Zhuo Li, Hongkai Li, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) State Street Technology (Zhejiang) Ltd.(道富科技(浙江)有限公司) Richoo AI Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Datadog AI Research

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出CloudCons基准,评估云资源整合中预测模型的决策效用,发现基础模型零样本预测准确但决策效用未必更优,并分析预测分位数选择对资源效率与可靠性的权衡。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12807 2026-06-12 cs.CL 新提交 57%

Detect, Remask, Repair: Diffusion Editing for Faithful Summarization of Evolving Contexts

检测、重掩、修复:面向动态上下文忠实摘要的扩散编辑

Hao Zou, Zachary Horvitz, Chandhru Karthick, Zhou Yu, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出DETECT-REMASK-REPAIR框架,利用掩码扩散语言模型识别并修复摘要中过时内容,在保持支持内容的同时实现局部忠实性修复,并引入StreamSum基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12419 2026-06-12 cs.CY cs.AI 新提交 57%

GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次

Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) Bocconi University(博科尼大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16689 2026-06-12 cs.AI 版本更新 57%

The Query Channel: Information-Theoretic Limits of Masking-Based Explanations

查询通道:基于掩码的解释的信息论极限

Erciyes Karakaya, Ozgur Ercetin

机构 * Department of Electrical and Computer Engineering, University of Maryland, College Park, USA(美国马里兰大学电气与计算机工程系) Faculty of Engineering and Natural Sciences, Sabanci University, Turkiye(土耳其萨班奇大学工程与自然科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出查询通道框架,将掩码后解释建模为通信过程,推导解释率与识别容量之间的信息论极限,并证明稀疏最大似然解码器可实现可靠恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15372 2026-06-12 cs.CR cs.AI cs.MM 57%

The Synthetic Media Shift: Tracking the Rise, Virality, and Detectability of AI-Generated Multimodal Misinformation

合成媒体的演变:跟踪AI生成多模态虚假信息的兴起、传播与可检测性

Zacharias Chrysidis, Stefanos-Iordanis Papadopoulos, Symeon Papadopoulos

机构 * Centre for Research and Technology Hellas(希腊研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出CONVEX数据集,研究多模态虚假信息的传播与共识动态,发现AI生成内容虽传播迅速但依赖被动互动,且检测性能随生成模型发展而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08610 2026-06-12 cs.GT cs.AI cs.CY 版本更新 57%

Competition and Diversity in Generative AI

生成式人工智能中的竞争与多样性

Manish Raghavan

机构 * MIT Sloan School of Management & Department of Electrical Engineering and Computer Science(麻省理工学院斯隆管理学院及电气工程与计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 通过博弈论模型和Scattergories游戏实验,研究竞争如何促使生成式AI模型多样化,缓解同质化,并提升社会福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13394 2026-06-12 cs.RO 新提交 50%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12671 2026-06-12 cs.CV 新提交 50%

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。

Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06113 2026-06-12 cs.CV 版本更新 50%

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位

Huaisong Zhang, Hao Yu, Yuxuan Zhang, Jiahe Wang, Xinrui Chen, Haoxiang Cao, Feng Lu, Wendong Zhang, Changqian Yu, Chun Yuan

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) South China Normal University(华南师范大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏