arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 113 篇

2604.14989 2026-04-28 cs.AI cs.AR 70%

Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement

Dr. RTL:通过工具引导的自我改进实现自主代理RTL优化

Wenji Fang, Yao Lu, Shang Liu, Jing Wang, Ziyan Guo, Junxian He, Fengbin Tu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Dr. RTL通过真实环境下的闭环优化和群体相对技能学习,提升RTL时序优化的性能、功耗和面积指标,实现更高效的自改进优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23539 2026-04-28 cs.AI 70%

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

MetaGAI:一个大规模且高质量的生成AI模型和数据卡生成基准

Haoxuan Zhang, Ruochi Li, Yang Zhang, Zhenni Liang, Junhua Ding, Ting Xiao, Haihua Chen

机构 * University of North Texas(北德克萨斯大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MetaGAI基准,通过语义三角化构建2541个验证文档三元组,采用多智能体框架进行评估,揭示稀疏MoE架构在成本与质量效率上的优势,为大规模评估生成模型和数据卡方法提供基础测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23348 2026-04-28 cs.CV cs.AI 70%

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试

He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Queen Mary University of London(女王学院伦敦大学) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23338 2026-04-28 cs.CR cs.LG 70%

From Stateless Queries to Autonomous Actions: A Layered Security Framework for Agentic AI Systems

从无状态查询到自主行动:面向代理AI系统的分层安全框架

Kexin Chu

机构 * School of Computing, University of Connecticut(康涅狄格大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出分层攻击面模型,分析代理AI系统安全威胁的分层结构与时间维度,揭示高层攻击与慢烧时间的交集区域,提出跨层防御体系,强调将代理安全视为嵌入对抗生态的分布式系统问题。

Comments 23 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23251 2026-04-28 cs.SE cs.AI 70%

AI-Assisted Code Review as a Scaffold for Code Quality and Self-Regulated Learning: An Experience Report

AI辅助代码审查作为代码质量和自主学习的支架:经验报告

Eduardo Oliveira, Michael Fu, Patanamon Thongtanunam, Sonsoles López-Pernas, Mohammed Saqr

机构 * The University of Melbourne(墨尔本大学) University of Eastern Finland(东芬兰大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了AI辅助代码审查在软件工程教育中的应用,通过混合方法设计分析了学生自主学习过程,发现工具优化后技术问题显著减少,且AI审查的响应率稳定,提出了AI审查在教育中的设计和教学建议。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16286 2026-04-28 cs.AI 70%

Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases

审计恶意破坏基准:用于检测和修复ML代码库中恶意破坏的基准

Eric Gan, Aryan Bhatt, Buck Shlegeris, Julian Stastny, Vivek Hebbar

机构 * Redwood Research(红木研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Auditing Sabotage Bench基准,用于评估审计工具检测和修复ML研究代码库中恶意破坏的能力,测试显示现有方法在检测和修复恶意破坏方面效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06316 2026-04-28 cs.CL 70%

Annotating Dimensions of Social Perception in Text: A Sentence-Level Dataset of Warmth and Competence

对文本中社会感知维度进行标注:一个句子级别的温暖与能力数据集

Mutaz Ayesh, Saif M. Mohammad, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) National Research Council Canada(加拿大国家研究理事会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个句子级别标注的温暖与能力数据集W&C-Sent,包含1600多个英文句子-目标对,评估了大型语言模型在识别信任、亲和力和能力方面的性能。

Comments Accepted at ACL2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23817 2026-04-28 cs.IR 67%

FUTURAL: A Metasearch Platform for Empowering Rural Areas with Smart Solutions

FUTURAL:一个赋能农村地区智能解决方案的元搜索引擎平台

Matei Popovici, Ciprian Dobre

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FUTURAL项目通过元搜索引擎平台提供五个关键领域的智能解决方案,利用大语言模型生成用户友好的自然语言接口,验证了其在农村地区应用的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23781 2026-04-28 cs.CV cs.SE 67%

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

ClawMark:多轮、多日、多模态同事代理的活体世界基准

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

机构 * ClawMark Team(ClawMark团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 ClawMark基准通过多轮多日任务和状态化沙盒环境评估同事代理在动态环境中的表现,包含100个专业场景任务,测试七种前沿代理系统,揭示部分进展常见但完整流程完成罕见。

Comments github repo: https://github.com/evolvent-ai/ClawMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23734 2026-04-28 cs.IR 67%

Prism-Reranker: Beyond Relevance Scoring -- Jointly Producing Contributions and Evidence for Agentic Retrieval

Prism-Reranker:超越相关性评分——联合生成贡献与证据以实现代理检索

Dun Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 Prism-Reranker通过联合生成贡献说明和证据片段,提升代理检索性能,其在多个数据集上均取得显著效果。

Comments 28 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23288 2026-04-28 cs.NI 67%

An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation

面向6G NaaS的意图共创作代理框架:架构与开源模型评估

Kostis Trantzas, Besiana Agko, Christos Tranoris, Irene Denazi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24401 2026-04-28 cs.SD cs.AI cs.CL eess.AS 62%

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

并非所有闪耀都是音频:重新思考音频-语言评估中的文本先验和音频依赖

Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立成功大学人工智能卓越研究中心(NTU AI-CoRE))

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过文本先验和音频依赖两个维度评估音频-语言模型,发现模型在无音频输入时仍能保持60-72%的分数,挑战了音频理解与评估成绩等同的假设。

Comments 6 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20833 2026-04-28 cs.CR cs.AI cs.CL 62%

AVISE: Framework for Evaluating the Security of AI Systems

AVISE:人工智能系统安全性的评估框架

Mikko Lempinen, Joni Kemppainen, Niklas Raesalmi

机构 * University of Oulu(奥卢大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AVISE框架,用于识别和评估人工智能系统安全漏洞,通过改进的Red Queen攻击和自动化安全测试发现语言模型的逃逸漏洞,展示了框架的高效性和广泛适用性。

Comments Fixed LaTex label command typos in Tables 8 and 9; fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 62%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 62%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24346 2026-04-28 cs.CV cs.AI 57%

SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度加尔各答理工学院) IIT Kanpur(印度坎浦尔理工学院) Asian Institute of Technology(亚洲理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。

Comments 13 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23783 2026-04-28 cs.IR cs.AI 57%

S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA

S2G-RAG:结构充分性与间隙判断用于迭代检索增强问答

Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 S2G-RAG通过结构化充分性判断和间隙判断机制,提升多跳问答的准确性和鲁棒性,适用于多轮检索流程。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 57%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23407 2026-04-28 cs.CV cs.AI 57%

PushupBench: Your VLM is not good at counting pushups

PushupBench: 你的VLM在计数俯卧撑时并不出色

Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei

机构 * Shengzhi Li(李盛之) Jiarun Chen(陈佳润) Karun Sharma(Sharma 卡鲁恩) Jiaqi Su(苏佳琦) Shichao Pei(裴世超)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 PushupBench通过446个长视频片段评估重复计数任务,发现最佳模型准确率仅42.1%,开源模型表现更差,表明计数能力反映更广泛的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 57%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24441 2026-04-28 cs.CV 50%

AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

AutoGUI-v2:一个全面的多模态GUI功能理解基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Hong Kong Institute of Science & Innovation(香港科学创新研究院) PolyU Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24317 2026-04-28 cs.CV 50%

Don't Pause! Every prediction matters in a streaming video

不要暂停!在流媒体视频中每个预测都至关重要

Dibyadip Chatterjee, Zhanzhong Pang, Fadime Sener, Yale Song, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google Inc.(谷歌公司)

专题命中 评测与基准 :post-training(abstract)

AI总结 本文提出SPOT-Bench基准,通过多轮主动查询评估流媒体感知能力,引入Timeliness-F1指标,发现离线模型易产生无用预测,提出AsynKV方法提升流媒体响应性能。

Comments 29 pages, 14 figures; https://dibschat.github.io/SPOT-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24300 2026-04-28 cs.CV 50%

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science(香港科学大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))

专题命中 评测与基准 :language model(abstract)

AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。

Comments Project Page: https://3dlg-hcvc.github.io/revsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24163 2026-04-28 cs.CV 50%

Robust Deepfake Detection, NTIRE 2026 Challenge: Report

鲁棒深度伪造检测,NTIRE 2026挑战:报告

Benedikt Hopf, Radu Timofte, Chenfan Qu, Junchi Li, Fei Wu, Dagong Lu, Mufeng Yao, Xinlei Xu, Fengjun Guo, Yongwei Tang, Zhiqiang Yang, Zhiqiang Wu, Jia Wen Seow, Hong Vin Koay, Haodong Ren, Feng Xu, Shuai Chen, Minh-Khoa Le-Phan, Minh-Hoang Le, Trong-Le Do, Minh-Triet Tran, Chih-Yu Jian, Yi-Fan Wang, Bang-Kang Chen, You-Chen Chao, Chia-Ming Lee, Fu-En Yang, Yu-Chiang Frank Wang, Chih-Chung Hsu, Aashish Negi, Hardik Sharma, Prateek Shaily, Jayant Kumar, Sachin Chaudhary, Akshay Dudhane, Praful Hambarde, Amit Shukla, Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Krish Wadhwani, Liam Fitzpatrick, Utkarsh Tiwari, Bilel Benjdira, Anas M. Ali, Wadii Boulila, Cristian Lazo Quispe, Aishwarya A, Akshara S, Ashwathi N, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi

机构 * University of Würzburg(乌尔姆大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文报告了NTIRE 2026鲁棒深度伪造检测挑战,探讨了深度伪造检测中鲁棒性问题,介绍了挑战赛设置、数据集准备及方法性能,重点分析了基于大模型、集成学习和退化训练的顶级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 50%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 评测与基准 :language model(abstract)

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23788 2026-04-28 cs.CV cs.HC 50%

MIRAGE: A Micro-Interaction Relational Architecture for Grounded Exploration in Multi-Figure Artworks

MIRAGE:一种面向多人物艺术品 grounded 探索的微交互关系架构

Jui-Cheng Chiu, Yu-Chao Wang, Shengyang Luo, Tongyan Wang, Qi Yang, Nabin Khanal, Yingjie Victor Chen

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :language model(abstract)

AI总结 MIRAGE通过构建结构化中间表示,提升多人物艺术品中微交互的识别与解释,增强身份一致性并减少关系幻觉。

Comments 14 pages (11 pages main text), 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 50%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22984 2026-04-28 cs.CV cs.GR 50%

BrickNet: Graph-Backed Generative Brick Assembly

BrickNet:基于图的生成积木组装

Peter Kulits, Cordelia Schmid

机构 * Inria, Ècole Normale Supèrieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学校、CNRS、巴黎萨克雷大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 BrickNet通过图结构生成积木构建序列,解决物理约束下的结构生成问题,提升生成序列的物理合理性。

Comments CVPR 2026; project page: https://kulits.github.io/BrickNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22855 2026-04-28 cs.CV 50%

Evaluating Remote Sensing Image Captions Beyond Metric Biases

超越度量偏差的遥感图像描述评估

Ziyun Chen, Fan Liu, Liang Yao, Chuanyi Zhang, Yuye Ma, Wei Zhou

机构 * Hohai University(河海大学) Cardiff University(卡迪夫大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19035 2026-04-28 cs.CV 50%

OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

OpenVO:具有时间动态意识的开放世界视觉里程计

Phuc D. A. Nguyen, Anh N. Nhu, Ming C. Lin

机构 * University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 OpenVO通过时间动态信息编码和3D几何先验,提升在有限输入条件下对单目行车记录仪视频的现实尺度自我运动估计,实现鲁棒轨迹数据集构建。

Comments Main paper CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏