arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 247 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 56 篇

2605.23955 2026-08-21 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 82%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 82%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: this http URL (http://github.com/agulaya24/beyond-recall) 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19207 2026-08-21 cs.CL 新提交 81%

Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages

合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试

Juan Yeo, Geewook Kim

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09498 2026-08-21 cs.CL 版本更新 81%

Self-Harness: Harnesses That Improve Themselves

Self-Harness:自我改进的操控框架

Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。

Comments this https URL (https://github.com/qzzqzzb/Self-Harness)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-21 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07382 2026-08-21 cs.LG astro-ph.HE astro-ph.IM 版本更新 79%

Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试

Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte, K. E. L. de Farias, Rafael A. Batista

机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。

Comments 31 pages, 7 figures. Section added with analysis for real data. New figures and tables added. Other minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15411 2026-08-21 cs.CL cs.AI 版本更新 79%

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

HiFi-KPI:用于从财报中提取层次化KPI的数据集

Rasmus T. Aavang, Giovanni Rizzi, Rasmus Tjalk-Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) ALIPES ApS(ALIPES公司) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(先锋人工智能中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对财报中关键绩效指标(KPI)跨公司可迁移性差的问题,提出包含165万段落和19.8万层次化标签的HiFi-KPI数据集,并评估分类、提取和结构化提取三个任务。

Comments Camera-ready. Accepted at LREC 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20167 2026-08-21 cs.SE 新提交 78%

BreakGuard: Towards Detecting Dependency Breaking Changes with LLM-Generated Tests

BreakGuard:基于大语言模型生成的测试检测依赖项破坏性变更

Rachna Raj, Benoit Baudry, Diego Elias Costa

专题命中 评测与基准 :LLM(title,abstract)

AI总结 BreakGuard是一种基于大语言模型生成测试的方法,可静态提取客户端焦点方法生成测试,在89个真实破坏性变更上检测到30.3%的变更,对崩溃型破坏性变更检测可靠性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-08-21 cs.RO 版本更新 78%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19515 2026-08-21 cs.CL 新提交 77%

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

Hear2Act:对韵律应何时改变助手行为的基准测试

Xinyi Liu, Hooshang Nayyeri, Dilek Hakkani-Tur, Emine Yilmaz, JK Kim, Yifei Zhang, Charith Peris, Hari Thadakamalla

机构 * Amazon(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究推出 Hear2Act 基准,评估发现词汇证据不足时韵律对助手决策很重要,具备音频能力的 LLM 能从语音恢复信息但需显式中间表示才能可靠转化为行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-21 cs.CL cs.AI cs.CY 版本更新 73%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 70%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19901 2026-08-21 cs.CR cs.AI 新提交 70%

MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection

MaliciousSkillBench:用于恶意智能体技能检测的综合基准

Yue Wang, Yi Liu, Gelei Deng, Ying Zhang, Yuekang Li, Zhenyu Chen, Leo Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。

Comments Project page: this https URL (https://protectskills.github.io/MaliciousSkillBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19447 2026-08-21 cs.LG 新提交 70%

Quantifying Event Impacts on Time Series via Multiscale Contrastive Learning

基于多尺度对比学习量化事件对时间序列的影响

Yiming Sun, Shengyu Chen, Zhengzhang Chen, Haoyu Wang, Xiaowei Jia, Haifeng Chen

机构 * Rutgers University(罗格斯大学) NEC Laboratories America(美国NEC实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出多分辨率框架EventTime,结合多维度信息与动态对比目标,在自主构建的SECURE数据集上,实现了对网络安全事件后短期金融异常损失的更精准估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 70%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18752 2026-08-21 cs.IR cs.CL 版本更新 70%

GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval

GreekBarRetrieval:希腊成文法检索基准

Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis, Ion Androutsopoulos

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究推出希腊成文法检索基准GreekBarRetrieval,通过实验发现基于大型语言模型的查询重表述可提升BM25检索效果,使其在多项指标上优于其他检索方法。

Comments Submitted to NLLP workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-08-21 cs.AI 版本更新 70%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19263 2026-08-21 cs.SE cs.MA 新提交 67%

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

评估上下文协议(ECP):一种用于AI智能体评估的便携式契约

Aniket Wattamwar, Manav Anandani, Mrunal Kakirwar

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。

Comments 14 pages, 4 tables, 4 figures, Code available at this https URL (https://github.com/evaluation-context-protocol)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-21 cs.SE 版本更新 67%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09970 2026-08-21 cs.CR cs.CY 版本更新 67%

Evaluating AI Models' Capability to Automate Voice Phishing Attacks

评估人工智能模型自动实施语音网络钓鱼攻击的能力

Fred Heiding, Claudio Mayrink Verdun, Simon Lermen, Andrew Kao, Vitor Albiero, Lauren Deason, Irina-Elena Veliche, Christine Lehane

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究评估美国成年人对人工智能驱动语音网络钓鱼攻击的易感性,通过大规模调查实验和定性访谈,让参与者接触多种语音模型及人类基线生成的诈骗场景,发现高合规率,分析得出人工智能驱动的vishing在经济上可行,其风险在于自动化经济性,引发相关政策担忧。

Comments Updated to the published version. Published in Expert Systems with Applications, Volume 332, Part D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-08-21 cs.CV 版本更新 67%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 评测与基准 :language model(abstract);SFT(abstract)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: this https URL (https://ethanliang99.github.io/ZOOMIQA-Projectpage)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17965 2026-08-21 cs.LG cs.AI cs.SE 版本更新 62%

Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

过于自信难安全:面向可靠日志异常检测的模型校准

Bin Li, Dongdong Wang, Siyang Lu

机构 * Beijing Jiaotong University(北京交通大学) University of Florida(佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基于语言模型的日志异常检测器置信度校准差的问题,提出轻量级事后校准框架LoRD,经实验验证其可提升置信度可靠性并减少过度自信异常相关错误且不牺牲检测性能。

Comments Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03259 2026-08-21 cs.LG cs.AI 版本更新 62%

FinVerse: Financial Time-Series Benchmark

FinVerse:金融时间序列基准

Jaehoon Lee, Jun Seo, Seunghan Lee, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Minjae Kim, Sungdong Yoo, Junhyeok Kang, Sangjun Han, Soonyoung Lee, Wonbin Ahn

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-21 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence (TBER): Explanatory Insufficiency, Transition Regimes, and the Emergence of New Representational Levels

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20317 2026-08-21 cs.IR 新提交 50%

Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search

将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库

Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin

专题命中 评测与基准 :language model(abstract)

AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 50%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: this https URL (https://yigitekin.github.io/BeyondMasks/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 50%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19272 2026-08-21 astro-ph.IM astro-ph.CO astro-ph.GA 新提交 50%

The Cross-Survey Decade: A Call to Action

跨巡天十年:行动号召

Gioia Rau, Robert Benjamin, Federica Bianco, Ranga-Ram Chary, Andy Connolly, Cecilia Garraffo, Suvi Gezari, Leanne P. Guy, Željko Ivezić, Stephanie Juneau, Vicky Kalogera, Mansi M. Kasliwal, François Lanusse, Zack Li, Rachel Mandelbaum, Peter Melchior, Stella Offner, Antonella Palmese, Jason Rhodes, Edward Schlafly, Kartik Sheth, Rachel Street, Michael Troxel, Tony Tyson, Beth Willman, Michael Wood-Vasey, Yuanyuan Zhang

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文呼吁构建跨巡天科学基础设施,围绕四大支柱推进,以实现三个旗舰巡天项目联合数据的科学价值,需多方协作且当下是行动的关键时机。

Comments 23 pages, 1 figure. Community perspective on cross-survey science infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-21 cs.RO 版本更新 50%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16289 2026-08-21 cs.CV 版本更新 50%

PosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster

PosterText:面向电商海报的统一视觉文本生成与编辑

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Jingling Fu, Xiaolong Fu, Hao Yang, Tongxuan Liu, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Junshi Huang

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出PosterText框架,将文本块作为原子单元实现电商海报的统一生成与编辑,构建了带块级标注的数据集与评估基准,经实验验证其性能优于现有相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏