arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-20 至 2026-05-20 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 93 篇

2603.05910 2026-05-20 cs.AI 70%

The World Won't Stay Still: Programmable Evolution for Agent Benchmarks

世界不会静止:为智能体基准测试的可编程进化

Guangrui Li, Yaochen Xie, Yi Liu, Ziwei Dong, Xingyuan Pan, Tianqi Zheng, Jason Choi, Michael J. Morais, Binit Jha, Shaunak Mishra, Bingrou Zhou, Chen Luo, Monica Xiao Cheng, Dawn Song

机构 * Amazon(亚马逊公司) UC Berkeley(伯克利大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了结构化环境进化作为智能体基准测试构建问题,提出了一种基于图的框架ProEvolve,使环境进化可编程,并在电商和航班预订领域验证了其在质量、实现有效性及失败模式方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13193 2026-05-20 cs.CL 70%

Retrieval-Augmented Generation for Natural Language Processing: A Survey

检索增强生成在自然语言处理中的应用:综述

Shangyu Wu, Ying Xiong, Yufei Cui, Haolun Wu, Can Chen, Ye Yuan, Lianming Huang, Xue Liu, Tei-Wei Kuo, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University, Mila(麦吉尔大学,MILA) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了检索增强生成(RAG)在自然语言处理中的应用,重点探讨了检索器和检索融合技术,提出了新的融合分类,并分析了RAG在不同NLP任务中的应用、评估方法、训练范式以及工业部署中的挑战和未来方向。

Comments Accepted by Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19382 2026-05-20 cs.AI 70%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19132 2026-05-20 cs.LG 70%

CLIC: Contextual Language-Informed Cardiac Pathology Classification

CLIC: 基于上下文的语言引导心脏病理分类

Giovani D. Lucafo, Rafael da Costa Silva, João Lucas Luz Lima Sarcinelli, Andre Guarnier De Mitri, Diego Furtado Silva

机构 * Institute of Mathematical and Computer Sciences(数学与计算机科学学院) Universidade de São Paulo(圣保罗大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CLIC框架,通过将患者上下文数据转化为描述性文本,利用自然语言编码技术提升心脏病理诊断的精确度,同时探索大语言模型生成的临床描述在下游分类任务中的应用。

Comments 6 pages, 2 figures, accepted at the ICLR 2026 Workshop on Time Series in the Age of Large Models (TSALM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17439 2026-05-20 cs.SE cs.AI 70%

DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

DiagEval: 用于通过GUI代理进行可靠软件评估的轨迹条件诊断

Sirui Hong, Zhijie Liu, Tengfei Li, Wei Tao, Yifan Wu, Chenglin Wu

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出DiagEval,一种基于轨迹的诊断评估协议,用于在GUI代理评估交互式软件后失败时进行诊断。通过重用失败轨迹选择针对性的诊断探针,并将结果聚合为内部归因信号,从而提高准确性,优于基于重试的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14678 2026-05-20 cs.AI 70%

$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

$π$-Bench:评估长周期工作流中主动型个人助理代理

Haoran Zhang, Luxin Xu, Zhilin Wang, Runquan Gui, Shunkai Zhang, Haodi Lei, Zihao He, Bingsu He, Chicheng Qin, Tong Zhu, Xiaoye Qu, Yang Yang, Yu Cheng, Yafu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Tongji University(同济大学) Soochow University(苏州大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18759 2026-05-20 cs.HC cs.AI 70%

Interoceptive Divergence in Aesthetic Evaluation and Implications for Human-AI Alignment

内感受差异在审美评价中的体现及其对人机对齐的影响

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Artificial intelligence (AI), exemplified by large language models (LLMs)(人工智能(由大型语言模型(LLMs)体现))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了人类与AI在审美体验中的收敛与分歧,通过对比人类和AI的反应,发现尽管两者在审美评分与情绪的相关性及图像特征优先级上相似,但在情绪反应分布和审美评分与内感受的关系上存在显著差异,揭示了AI在审美评估中的局限性,特别是在内感受方面的不足。

Comments 20 pages, 9 figures. Supplementary material is included as a separate PDF in the source files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19720 2026-05-20 cs.SI 67%

Asking Grok: AI-Assisted Sensemaking in Social Media Conversations

询问Grok:社交媒体对话中的AI辅助理解

Michelle Bobek, Emma Demirel, Nicolas Pröllochs

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究探讨了用户在社交媒体平台上与AI助手Grok互动的方式和影响,发现Grok主要用于获取或验证信息,尽管响应迅速但受众有限,且与X的社区事实核查系统有有限的重叠,但Grok通常在早期使用且不预测后续纠正活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19717 2026-05-20 cs.CV 67%

Physics-in-the-Loop: A Hybrid Agentic Architecture for Validated CAD Engineering Design

物理闭环:一种混合代理架构用于验证的CAD工程设计

Elias Berger, Muhammad Usama, Jan Mehlstäubl, Bernhard Saske, Kristin Paetzold-Byhain

机构 * Dresden University of Technology(德累斯顿技术大学) MAN Truck & Bus SE(MAN卡车与巴士股份有限公司) German Research Center for Artificial Intelligence(德国人工智能研究中心) RPTU Kaiserslautern-Landau(凯撒斯劳滕-兰道大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种混合代理-物理架构,通过将经过验证的知识工程工具直接嵌入到自主AI代理的决策循环中,以解决大型语言模型在生成CAD设计时缺乏物理理解的问题。该方法通过显式的物理验证指导闭环、顺序决策过程,提高了生成CAD设计的物理正确性。

Comments Accepted in IJCAI-ECAI 2026 (Special Track on AI4Tech)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19265 2026-05-20 cs.SE 67%

MuMuTestUp: Mutation-based Multi-Agent Test Case Update

MuMuTestUp: 基于变异的多智能体测试用例更新

Dawei Tian, Jiakun Liu, Yun Peng, Yichen Zhang, Jianlei Chi, Jun Sun, Xiaohong Su

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对持续集成/持续交付实践中测试用例过时导致的问题,本文提出MuMuTestUp多智能体框架,通过变异分析、覆盖率分析和语义检索三个智能体提升测试用例的准确性与覆盖率,同时构建PRBENCH数据集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19223 2026-05-20 cs.CV 67%

HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

HAVEN:用于统一视频理解的层次对齐多模态基准

Mengqi Shi, Haopeng Zhang

机构 * Department of Information and Computer Sciences(信息与计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出HAVEN,一个用于统一视频理解的层次对齐多模态基准,旨在解决现有多模态大语言模型在复杂叙事总结和推理方面评估不足的问题,通过引入全粒度和全多模态的数据集架构,提供了一个严谨的标准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17046 2026-05-20 cs.LG cs.AI cs.CL 67%

1GC-7RC: One Graphic Card -- Seven Research Challenges! How Good Are AI Agents at Doing Your Job?

1GC-7RC:一张图形卡——七个研究挑战!AI代理在做你的工作方面有多好?

Robin-Nico Kampa, Fabian Deuser, Anna Bößendörfer, Konrad Habel, Norbert Oswald

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出1GC-7RC基准测试,通过七个跨领域机器学习任务评估AI代理在从头设计、实现和训练模型的能力,揭示了不同代理在隐式机器学习知识、规划能力和时间预算管理方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02223 2026-05-20 cs.SD cs.CV 67%

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran

机构 * Posts and Telecommunications Institute of Technology

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18984 2026-05-20 cs.CV 67%

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

Artifact-Bench: 评估MLLMs在检测和评估AI生成视频中的伪影

Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang, Haotian Wang, Yuanxing Zhang, Pengfei Wan

机构 * Kling Team(Kling团队) Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Artifact-Bench,一个用于评估多模态大语言模型在检测和分析AI生成视频伪影能力的基准,揭示了现有模型在伪影感知和推理上的显著局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19077 2026-05-20 cs.CL cs.AI 62%

ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking

ReacTOD:用于零样本对话状态跟踪的受限神经符号代理NLU

Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出ReacTOD,一种受限神经符号架构,通过在自我纠正的ReAct循环中将NLU重新表述为离散工具调用来解决零样本对话状态跟踪问题,其核心方法是确定性验证,主要贡献是实现了新的零样本状态-of-the-art结果。

Comments Accepted at TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18769 2026-05-20 cs.IR cs.AI cs.CL 62%

ClusterRAG: Cluster-Based Collaborative Filtering for Personalized Retrieval-Augmented Generation

ClusterRAG: 基于聚类的协同过滤用于个性化检索增强生成

Gibson Nkhata, Uttamasha Anjally Oyshi, Quan Mai, Susan Gauch

机构 * University of Arkansas(阿肯色大学) Walmart Inc.(沃尔玛公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 ClusterRAG通过聚类用户轮廓文档,利用相似用户的协同信号提升当前用户的个性化生成性能,通过在集群和文档层面进行检索,实现了高效的个性化检索增强生成。

Comments 17 pages, 2 figures, to be published in the proceedings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20049 2026-05-20 cs.SE cs.AI 57%

Does Code Cleanliness Affect Coding Agents? A Controlled Minimal-Pair Study

代码整洁性影响编码代理吗?一项受控的最小对研究

Priyansh Trivedi, Olivier Schmitt

机构 * SonarSource

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本研究探讨了代码整洁性对编码代理性能的影响,通过构建结构和风格相似但整洁度不同的代码库对,发现整洁性不影响通过率,但显著降低计算成本和文件重复访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09063 2026-05-20 cs.CL 57%

Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs

Soohak:一个由数学家精心编订的基准,用于评估大语言模型的研究级数学能力

Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee, Hyeonah Kang, Jiang Longxi, Jin Yun, JungYup Lee, Kyungmin Lee, Sam Yoosuk Kim, Sang Park, Seunghyeok Hong, SeungJae Lee, Seungyeop Yi, Shinae Shin, SunHye Bok, Sunyoung Shin, Yonghoon Ji, Youngtaek Kim, Hanearl Jung, Akari Asai, Graham Neubig, Sean Welleck, Youngjae Yu, Akshelin R, Alexander B. Ivanov, Boboev Muhammadjon, Chae Young Han, Christian Stump, Cooper R. Anderson, Dmitrii Karp, Dohyun Kwon, Dongryung Yi, DoYong Kwon, Duk-Soon Oh, Eunho Choi, Giovanni Resta, Greta Panova, Huiyun Noh, Hyungryul Baik, Hyungsun Bae, Inomov Mashrafdzhon, Jeewon Kim, Jeong-Rae Kim, Ji Eun Lee, Jiaqi Liu, Jieui Kang, Jimin Kim, Jon-Lark Kim, Joonyeong Won, Junseo Yoon, Junwoo Jo, Kibeom Kim, Kiwoon Kwon, Mario Kummer, Max Mercer, Min Hoon Kim, Minjun Kim, Nahyun Lee, Ng Ze-An, Nicolas Libedinsky, Rafał Marcin Łochowski, Raphaël Lachièze-Rey, Robert Auffarth, Ruichen Zhang, Sejin Park, Seonguk Seo, Shin Jaehoon, Sunatullo, Taewoong Eom, Yeachan Park, Yongseok Jang, Youchan Oh, Zhaoyang Wang, Zoltán Kovács

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出Soohak基准,通过64位数学家自主编写439道问题,评估大语言模型在研究级数学问题上的能力,同时引入拒绝子集以测试模型对不恰当问题的识别能力。

Comments Under review, For questions or model-evaluation requests, contact $guijin.son@snu.ac.kr$

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 57%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22453 2026-05-20 cs.CL cs.SI 57%

XNote: Benchmarking Automated Community Notes Generation for Image-based Contextual Deception

XNote: 对基于图像的上下文欺骗的自动社区笔记生成进行基准测试

Jin Ma, Jingwen Yan, Mohammed Aldeen, Ethan Anderson, Taran Kavuru, Jinkyung Katie Park, Feng Luo, Long Cheng

机构 * School of Computing, Clemson University(克莱姆森大学计算机学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文研究了基于图像的上下文欺骗的自动社区笔记生成任务,提出了一个真实世界数据集XNote,并对前沿大视觉语言模型和商业工具进行了基准测试,以评估其在欺骗检测和笔记生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06740 2026-05-20 q-bio.QM cs.AI 57%

ViroGym: Realistic Large-Scale Benchmarks for Evaluating Viral Proteins

ViroGym: 用于评估病毒蛋白的现实大规模基准

Yichen Zhou, Jonathan Golob, Amir Karimi, Stefan Bauer, Patrick Schwab

机构 * GlaxoSmithKline(葛兰素史克) Technical University of Munich(慕尼黑技术大学) University of Washington(华盛顿大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出ViroGym,一个用于评估蛋白质语言模型在病毒蛋白上的表现的综合基准,通过三个任务评估pLMs:79个深入突变扫描实验、21个流感中和任务以及SARS-CoV-2的现实世界预测任务,发现ProGen2家族在所有任务中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14261 2026-05-20 cs.CL 57%

Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior

重写历史:一种用于干预分析以研究数据对模型行为影响的配方

Rahul Nadkarni, Yanai Elazar, Hila Gonen, Noah A. Smith

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Allen Institute for Artificial Intelligence(人工智能阿伦研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种实验方法,用于研究训练数据与语言模型行为之间的关系,通过干预数据批次(即'重写历史')并重新训练模型检查点来测试数据与行为之间的假设,展示了如何通过案例研究来验证事实知识获取中的数据影响。

Comments Accepted to TACL, pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14148 2026-05-20 cs.SD cs.CL eess.AS 57%

Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment

基于声学散射的非侵入式物体分类AI:一项关于头发评估的案例研究

Long-Vu Hoang, Tuan Nguyen, Tran Huy Dat

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文提出了一种利用声学散射进行非侵入式物体分类的新方法,通过头发评估的案例研究进行演示。通过发射声学刺激并捕捉带有头发样本的头部对象散射信号,利用AI驱动的深度学习声学分类技术对头发类型和湿度进行分类。我们评估了包括(i)完全监督深度学习、(ii)嵌入式分类、(iii)监督基础模型微调和(iv)自监督模型微调在内的全面方法。我们的最佳策略通过微调自监督模型的所有参数实现了接近90%的分类准确率。这些结果凸显了声学散射作为隐私保护、非接触替代视觉分类的潜力,为各行业应用提供了巨大前景。

Comments This paper has been retracted by the authors. Due to miscommunication, the authorship is incomplete and missing early contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20090 2026-05-20 cs.CV 50%

MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

MetaEarth-MM:基于场景中心联合建模的多模态遥感图像生成

Zhiping Yu, Chenyang Liu, Jinqi Cao, Qinzhe Yang, Siwei Yu, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术系,航天学院,北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Shenyuan Honors College, Beihang University(Shen Yuan荣誉学院,北京航空航天大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出MetaEarth-MM模型,通过统一的多模态遥感图像生成框架,实现多模态图像的联合生成和任意模态之间的转换,展示了其在多模态遥感观测中的强大生成能力和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20085 2026-05-20 cs.CV 50%

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

基于空间提示的视觉轨迹预测用于目视操控

Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

机构 * Michigan State University(密歇根州立大学) NVIDIA Research(英伟达研究)

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出了一种新的视觉轨迹预测方法SP-VTP,通过空间提示定义任务目标,结合任务编码器、观察编码器和轨迹生成器,提升了跨场景的目视操控轨迹预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20700 2026-05-20 cs.CV 50%

NGL: Natural Garment Language for Training-Free Sewing Pattern Estimation

NGL:自然服装语言用于无训练缝纫图案估计

Anna Badalyan, Pratheba Selvaraju, Giorgio Becherini, Omid Taheri, Victoria Fernandez Abrevaya, Michael Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究提出NGL自然服装语言,通过利用视觉语言模型的自然描述能力,实现无训练的缝纫图案估计,解决了传统方法在泛化能力、真实世界关联性和多层服装处理上的不足。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19744 2026-05-20 cs.CV 50%

Real-World On-Vehicle Evaluation of Embedding-Based Anomaly Detection

车载场景中基于嵌入的异常检测实测

Albert Schotschneider, Daniel Bogdoll, Svetlana Pavlitska, Ahmed Abouelazm, Johann Marius Zoellner

机构 * FZI Research Center for Information Technology(FZI信息科技研究中心) KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出了一种适应性强的实时异常检测方法,利用预训练视觉变换器嵌入来检测潜在异常,通过在潜在语义特征空间中使用最近邻相似性检测偏差,并在真实世界场景中评估了该方法的性能。

Comments Accepted at CVPR 2026 Workshop AUTOPILOT-NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19613 2026-05-20 cs.CV 50%

White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation

先白平衡,后调整:通过视觉-语言评估实现跨相机颜色恒常性

Shuwei Li, Lei Tan, Robby T. Tan

机构 * National University of Singapore(国立新加坡大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出VLM-CC框架,通过视觉-语言模型评估实现跨相机颜色恒常性的迭代反馈优化,利用感知反馈替代直接RGB回归,提升鲁棒性。

Comments In CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19527 2026-05-20 cs.CV 50%

Dual-Prompt CLIP with Hybrid Visual Encoders for Occluded Person Re-Identification

双提示CLIP与混合视觉编码器用于遮挡行人重识别

Zhangjian Ji, Shaotong Qiao, Kai Feng, Wei Wei

机构 * organization= School of Computer \& Information Technology, Shanxi University , addressline= Wucheng Rd.92 , city= Taiyuan , postcode= 030006 , state= Shanxi , country= China organization= Key Laboratory of Computational Intelligence

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种双提示学习重识别模型DPL-ReID,通过双提示学习策略和现实遮挡增强方法,提升遮挡行人重识别的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏