arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-27 至 2026-03-27 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 46 篇

2603.25253 2026-03-27 cs.CL cs.AI 79%

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准

Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24066 2026-03-27 hep-ph 78%

OmniLearned: A Foundation Model Framework for All Tasks Involving Jet Physics

OmniLearned:适用于所有涉及喷注物理任务的基础模型框架

Wahid Bhimji, Chris Harris, Vinicius Mikuni, Benjamin Nachman

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出OmniLearned框架,通过改进模型架构、使用超大规模喷注数据集及提供完整软件工具,提升喷注物理任务的发现潜力,展现其在顶夸克喷注标记、底夸克标记和异常检测中的领先性能。

Comments 12 pages, 5 figures

Journal ref Phys.Rev.D 113 (2026) 3, 032020

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 77%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25250 2026-03-27 cs.CV cs.AI cs.LG 76%

Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models

激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测

Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。

Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25393 2026-03-27 cs.CR 75%

ALPS: Automated Least-Privilege Enforcement for Securing Serverless Functions

ALPS:用于安全无服务器函数的自动最小特权执行

Changhee Shin, Bom Kim, Seungsoo Lee

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ALPS通过静态分析和大语言模型生成安全策略,有效提升无服务器环境的最小特权执行,实现高覆盖率和性能优化。

Comments Accepted at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 74%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25226 2026-03-27 cs.SE cs.AI cs.CL cs.MA 73%

WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing

WebTestBench: 评估面向端到端自动化网页测试的计算机使用代理

Fanheng Kong, Jingyuan Zhang, Yang Yue, Chenxi Sun, Yang Tian, Shi Feng, Xiaocui Yang, Daling Wang, Yu Tian, Jun Du, Wenchong Zeng, Han Li, Kun Gai

机构 * Northeastern University(东北大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WebTestBench基准,用于评估端到端自动化网页测试能力,揭示现有方法在测试完整性、检测瓶颈和长周期交互可靠性方面的不足。

Comments 24 pages, code: https://github.com/friedrichor/WebTestBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI 73%

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 73%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25501 2026-03-27 cs.CL 70%

An Experimental Comparison of the Most Popular Approaches to Fake News Detection

对检测虚假新闻最流行方法的实验比较

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro

机构 * Dipartimento di Ingegneria dell'Informazione, University of Pisa(比萨大学信息工程系) Dipartimento di Informatica, University of Pisa(比萨大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文对比了12种主流虚假新闻检测方法,评估了不同数据集下的分类性能,发现领域内模型表现良好但泛化能力差,跨领域架构和LLM在零样本学习中表现突出。

Journal ref Dell'Oglio, P., Bondielli, A., Marcelloni, F., and Passaro, L. C. (2026). An experimental comparison of the most popular approaches to fake news detection. Information Sciences, Article 123407

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25227 2026-03-27 cs.CL 70%

Comparing Natural and Synthetic Structured Data: A Study of the Passive Verb Alternation in French and Italian

比较自然与合成结构数据:法语和意大利语中被动语动词交替的研究

Giuseppe Samo, Paola Merlo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究比较自然与合成数据对大语言模型训练与评估的影响,探讨法语和意大利语中被动语动词交替的处理能力,发现自然数据训练模型在自然和合成测试中表现更稳健。

Comments 13 pages, 8 figures, paper accepted at the Workshop on Structured Linguistic Data and Evaluation (SLiDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 70%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25146 2026-03-27 cs.SE cs.AI 70%

Factors Influencing the Quality of AI-Generated Code: A Synthesis of Empirical Evidence

影响人工智能生成代码质量的因素:一项经验证据的综合分析

Vehid Geruslu, Zulfiyya Aliyeva, Eray Tüzün

机构 * Queen’s University Belfast(贝尔法斯特女王大学) Azerbaijan Technical University(阿塞拜疆技术大学) MilliSoft MMC Corporation(MilliSoft MMC公司) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究综合现有经验证据,分析影响人工智能生成源代码质量的因素,并探讨这些因素在不同评估情境下的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08371 2026-03-27 cs.CL 70%

ViGoEmotions: A Benchmark Dataset For Fine-grained Emotion Detection on Vietnamese Texts

ViGoEmotions:面向越南语文本细粒度情感检测的基准数据集

Hung Quang Tran, Nam Tien Pham, Son T. Luu, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息科技大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ViGoEmotions数据集,包含20664条越南语社交媒体评论,细粒度情感分类为27种。通过评估不同预处理策略,发现将表情符号转为文本能提升基线模型性能,而保留表情符号对ViSoBERT和CafeBERT效果最佳。

Comments Accepted as main paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11703 2026-03-27 cs.DB cs.AI 70%

A Comprehensive Survey on Vector Database: Storage and Retrieval Technique, Challenge

向量数据库的全面综述:存储与检索技术、挑战

Le Ma, Ran Zhang, Yikun Han, Shirui Yu, Zaitian Wang, Zhiyuan Ning, Jinghan Zhang, Ping Xu, Pengjiang Li, Ziyue Qiao, Wei Ju, Chong Chen, Dongjie Wang, Kunpeng Liu, Pengyang Wang, Pengfei Wang, Yanjie Fu, Chunjiang Liu, Yuanchun Zhou, Chang-Tien Lu

机构 * Sichuan University(四川大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Science Library (Chengdu), Chinese Academy of Sciences(中国科学院成都科学图书馆) University of Chinese Academy of Sciences(中国科学院大学) Portland State University(波特兰州立大学) Great Bay University(大湾大学) Terminus Group(Terminus集团) University of Kansas(堪萨斯大学) University of Macau(澳门大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了向量数据库的核心设计与算法,分析了存储与检索技术的演变,比较了主流架构并探讨了与大语言模型整合的新兴方向,为研究者提供系统参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25220 2026-03-27 cs.HC 67%

Beyond Benchmarks: How Users Evaluate AI Chat Assistants

超越基准:用户如何评估AI聊天助手

Moiz Sadiq Awan, Muhammad Haris Noor, Muhammad Salman Munaf

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究通过调查388名AI聊天用户,揭示了用户对不同AI平台的满意度、使用动机及摩擦点,发现顶级平台满意度相似,用户倾向于多平台切换,且各平台因不同特点吸引用户,挑战了单一基准主导的竞争格局。

Comments 13 pages, 15 figures, 5 tables, 32 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25195 2026-03-27 cs.HC 67%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19918 2026-03-27 cs.CV 67%

Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs

Widget2Code: 通过多模态大语言模型从视觉小部件到UI代码

Houston H. Zhang, Tao Zhang, Baoze Lin, Yuanqi Xue, Yincheng Zhu, Huan Liu, Li Gu, Linfeng Ye, Ziqiang Wang, Xinxin Zuo, Yang Wang, Yuanhao Yu, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Widget2Code任务,通过多模态大语言模型提升小部件到UI代码的生成能力,设计了图像-only基准测试和WidgetFactory框架,提升视觉保真度。

Comments CVPR 2026, Code: https://github.com/Djanghao/widget2code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25089 2026-03-27 cs.CV 67%

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

THEMIS:迈向多模态大语言模型在科学论文欺诈取证中的全面评估

Tzu-Yen Ma, Bo Zhang, Zichen Tang, Junpeng Ding, Haolin Tian, Yuanze Li, Zhuodi Hao, Zixin Ding, Zirui Wang, Xinyu Yu, Shiyao Peng, Yizhuo Zhao, Ruomeng Jiang, Yiling Huang, Peizhi Zhao, Jiayuan Chen, Weisheng Tan, Haocheng Gao, Yang Liu, Jiacheng Liu, Zhongjun Yang, Jiayu Huang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 THEMIS通过真实场景和复杂图像评估多模态大语言模型在学术欺诈推理中的能力,引入了五种欺诈类型和16种细粒度操作,揭示模型在不同核心能力上的优劣。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24696 2026-03-27 cs.CV 67%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :language model(abstract);instruction tuning(abstract)

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25333 2026-03-27 cs.CL cs.AI cs.IR 62%

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

自适应分块:为RAG优化分块方法选择

Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

机构 * Ekimetrics

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自适应分块框架,通过五个新指标优化分块策略,提升RAG性能,使答案正确率提升至72%,问题解答数增加30%。

Comments Accepted at LREC 2026. 10 pages, 4 figures. Code: https://github.com/ekimetrics/adaptive-chunking

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25499 2026-03-27 cs.CV cs.LG 57%

Knowledge-Guided Failure Prediction: Detecting When Object Detectors Miss Safety-Critical Objects

基于知识的故障预测:检测对象检测器何时错过安全关键对象

Jakob Paul Zimmermann, Gerrit Holzbach, David Lerch

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Fraunhofer IOSB(弗劳恩霍夫光电、系统技术及图像处理研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出KGFP框架,通过检测内部特征与视觉基础模型嵌入之间的语义偏差来识别对象检测器的故障,提升安全关键对象的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25269 2026-03-27 cs.CL 57%

When Hate Meets Facts: LLMs-in-the-Loop for Check-worthiness Detection in Hate Speech

当仇恨遇见事实:用于仇恨言论检测的LLM循环检查机制

Nicolás Benjamín Ocampo, Tommaso Caselli, Davide Ceolin

机构 * Centrum Wiskunde & Informatica(荷兰国家数学与计算机科学研究中心) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出WSF-ARG+数据集和LLM循环框架,通过12种不同模型测试,证明该框架能减少人工标注工作量并提升仇恨言论检测性能,检查标签可使大模型宏F1提升0.213。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25216 2026-03-27 cs.NI cs.AI eess.SP 57%

A Wireless World Model for AI-Native 6G Networks

面向AI原生6G网络的无线世界模型

Ziqi Chen, Yi Ren, Yixuan Huang, Qi Sun, Nan Li, Yuhong Huang, Chih-Lin I, Yifan Li, Liang Xia

机构 * China Mobile Research Institute(中国移动研究院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出无线世界模型(WWM),通过内化三维几何与信号动态的因果关系,预测无线信道的时空演化,实现跨动态环境的泛化能力,优于现有单模基础模型和任务专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25169 2026-03-27 cs.CL 57%

To Write or to Automate Linguistic Prompts, That Is the Question

是编写还是自动化语言提示,这是个问题

Marina Sánchez-Torrón, Daria Akselrod, Jason Rauchwerk

机构 * Smartling

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文系统比较了手工零样本专家提示、基础DSPy签名和GEPA优化DSPy签名在翻译、术语插入和语言质量评估中的表现,发现不同任务下不同提示方法各有优劣。

Comments 10 pages, to be submitted for EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02013 2026-03-27 cs.CL 57%

SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents

SpeechRole: 一个大规模数据集和基准,用于评估语音角色扮演代理

Changhao Jiang, Jiajun Sun, Yifei Cao, Jiabao Zhuang, Xinmeng Che, Hui Li, Xiaoran Fan, Ming Zhang, Junjie Ye, Shihan Dou, Zhiheng Xi, Jingqi Tong, Yilong Wu, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理实验室) IEIT Systems Co., Ltd.(浪潮电子信息产业股份有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出SpeechRole数据集和基准,用于评估语音角色扮演代理,通过大规模语音对话数据和多维评估指标,揭示了端到端模型在语音连贯性和情感适配性方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25248 2026-03-27 cs.IR 50%

ColBERT-Att: Late-Interaction Meets Attention for Enhanced Retrieval

ColBERT-Att:晚期交互与注意力结合以提升检索性能

Raj Nath Patel, Sourav Dutta

专题命中 评测与基准 :language model(abstract)

AI总结 ColBERT-Att通过整合注意力机制于晚期交互框架,提升检索性能,在MS-MARCO和多个BEIR、LoTTE数据集上实现召回准确率提升。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 50%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV 50%

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24713 2026-03-27 cs.CV 50%

Lookalike3D: Seeing Double in 3D

Lookalike3D: 在3D中看到双倍

Chandan Yeshwanth, Angela Dai

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出Lookalike3D方法,通过多视角图像变换器区分重复物体对,提升3D场景中物体识别与生成的准确性,通过3DTwins数据集验证其效果。

Comments Project page: https://cy94.github.io/lookalike3d/, Video: https://www.youtube.com/watch?v=g6S7J0y_52U

详情

展开后加载摘要…

URL PDF HTML 收藏