arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-19 至 2026-03-19 共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 77 篇

2603.17303 2026-03-19 cs.CL cs.AI 73%

From Words to Worlds: Benchmarking Cross-Cultural Cultural Understanding in Machine Translation

从词语到世界:评估机器翻译中跨文化文化理解的基准测试

Bangju Han, Yingqi Wang, Huang Qing, Tiyuan Li, Fengyi Yang, Ahtamjan Ahmat, Abibulla Atawulla, Yating Yang, Xi Zhou

机构 * Xinjiang Technical Institute of Physics \& Chemistry, Chinese Academy of Sciences Urumqi China Xinjiang Technical Institute of Physics \& Chemistry, Chinese Academy of Sciences

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CulT-Eval基准测试,用于评估机器翻译对文化相关表达的处理能力,发现现有指标无法有效捕捉文化语义偏差,提出新的评估指标以改进翻译质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 73%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17962 2026-03-19 cs.CL 70%

ConGA: Guidelines for Contextual Gender Annotation. A Framework for Annotating Gender in Machine Translation

ConGA:上下文性别标注指南。一种用于机器翻译中标注性别的框架

Argentina Anna Rescigno, Eva Vanmassenhove, Johanna Monti

机构 * University of Pisa(比萨大学) University of Naples ``L'Orientale''(那不勒斯) Tilburg University(蒂尔堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ConGA框架,通过上下文性别标注解决机器翻译中性别处理的挑战,揭示当前系统在性别标注上的系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17838 2026-03-19 cs.CL 70%

Event-Centric Human Value Understanding in News-Domain Texts: An Actor-Conditioned, Multi-Granularity Benchmark

基于事件的人类价值理解:新闻领域文本中的演员条件、多粒度基准

Yao Wang, Xin Liu, Zhuochen Liu, Jiankang Chen, Adam Jatowt, Kyoungsook Kim, Noriko Kando, Haitao Yu

机构 * Graduate School of Comprehensive Human Sciences, University of Tsukuba, Tsukuba, Japan(茨口大学综合人类科学研究生院) Intelligent Platforms Research Institute, National Institute of Advanced Industrial Science and Technology, Tokyo, Japan(国家先进工业科学与技术研究院智能平台研究所) Digital Science Center, University of Innsbruck, Innsbruck, Austria(因斯布鲁克大学数字科学中心) National Institute of Informatics, Tokyo, Japan(日本信息处理学会) Institute of Library, Information and Media Science, University of Tsukuba, Tsukuba, Japan(茨口大学图书馆、信息与媒体科学研究所)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出NEVU基准,用于评估模型在事实新闻中识别价值线索、归因正确演员及确定价值方向的能力,包含45,793个单元-演员对和168,061个定向价值实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17722 2026-03-19 cs.LG cs.CY 70%

Predicting Trajectories of Long COVID in Adult Women: The Critical Role of Causal Disentanglement

预测长期新冠轨迹:因果解缠的至关作用

Jing Wang, Jie Shen, Yiming Luo, Amar Sra, Qiaomin Xie, Jeremy C. Weiss

机构 * National Library of Medicine(国家医学图书馆) Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) The George Washington University(乔治华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过整合临床数据与可穿戴设备数据,利用大语言模型构建因果网络,预测长期新冠严重程度,实现86.7%的预测精度,并区分病理活性与基线噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 70%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17265 2026-03-19 cs.CV cs.CL 70%

LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis

LED:用于评估文档分析中布局错误检测的基准

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

机构 * Department of Computer Engineering Chungnam National Univ.(计算机工程系, 首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LED基准,用于评估文档分析中结构推理能力,定义八种标准错误类型并构建数据集,通过三种任务揭示模型在多模态和架构上的弱点。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17173 2026-03-19 cs.CV cs.AI 70%

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

通用多模态大语言模型通过人类显著性获得生物特征专家能力

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究通用多模态大语言模型在隐私约束下通过人类显著性信息实现虹膜攻击检测的可行性,实验表明其在虹膜攻击检测中优于传统CNN模型和人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17146 2026-03-19 cs.CY cs.CL 70%

Multilingual Reference Need Assessment System for Wikipedia

多语言参考需求评估系统用于维基百科

Aitolkyn Baigutanova, Francisco Navas, Pablo Aragon, Mykola Trokhymovych, Muniza Aslam, Ai-Jou Chou, Miriam Redi, Diego Saez-Trumper

机构 * Pompeu Fabra University(庞培法布拉大学) Wikimedia Foundation(维基媒体基金会) Barcelona(巴塞罗那) Spain(西班牙)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种多语言机器学习系统,帮助编辑识别需要引用的声明,通过测试10种语言版本的维基百科,优于现有基准,考虑模型准确性和计算效率的权衡。

Comments Accepted for publication at the Proceedings of the ACM Web Conference 2026 (WWW '26). Author's copy

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16975 2026-03-19 cs.SE cs.AI cs.CY cs.ET cs.HC 70%

The State of Generative AI in Software Development: Insights from Literature and a Developer Survey

生成式人工智能在软件开发中的现状:文献和开发者调查的洞察

Vincent Gurgul, Robin Gubela, Stefan Lessmann

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过文献综述和65名开发者的调查,发现生成式AI在设计、实现、测试和文档中影响最大,显著减少重复性任务时间,但早期SDLC阶段收益较低,需加强治理以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15674 2026-03-19 cs.CL 70%

What Patients Really Ask: Exploring the Effect of False Assumptions in Patient Information Seeking

患者真正的问题:探索假定在患者信息获取中的影响

Raymond Xiong, Furong Jia, Lionel Wong, Monica Agrawal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了患者实际提问中错误假设的影响,通过分析谷歌People Also Ask数据集,发现现有LLM在识别日常问题中的错误假设方面表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03369 2026-03-19 cs.CL stat.ML 70%

Silenced Biases: The Dark Side LLMs Learned to Refuse

沉默的偏见:LLMs所学习到的拒绝的黑暗面

Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Silenced Bias Benchmark,通过激活引导减少问答中的拒绝,揭示模型潜在的公平性问题,挑战传统公平评估方法。

Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17998 2026-03-19 cs.CV 67%

The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering

文本嵌入插值在连续图像操控中的不合理有效性

Yigit Ekin, Yossi Gandelsman

机构 * Reve

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一种无需训练的连续可控图像编辑框架,通过文本嵌入空间的简单操控实现平滑编辑控制,引入弹性范围搜索确保连续性,并在文本条件模态间实现泛化。

Comments Project Page: https://yigitekin.github.io/diffusion-sliders

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 67%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19132 2026-03-19 cs.SE 67%

LLMs-Powered Real-Time Fault Injection: An Approach Toward Intelligent Fault Test Cases Generation

基于大语言模型的实时故障注入:一种智能故障测试用例生成方法

Mohammad Abboush, Ahmad Hatahet, Andreas Rausch

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一种利用大语言模型生成实时故障测试用例的方法,通过分析功能安全需求提高测试效率和安全性。

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17580 2026-03-19 cs.IR 67%

Negation is Not Semantic: Diagnosing Dense Retrieval Failure Modes for Trade-offs in Contradiction-Aware Biomedical QA

否定并非语义:诊断密集检索失败模式以权衡矛盾意识生物医学问答

Soumya Ranjan Sahoo, Gagan N., Sanand Sasidharan, Divya Bharti

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究了密集检索在矛盾意识生物医学问答中的失败模式,提出解耦词法架构和叙事感知重排序方法,提升矛盾检测和引用覆盖能力,实现高精度和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04468 2026-03-19 cs.SE 67%

Improving IR-based Bug Localization with Semantics-Driven Query Reduction

通过语义驱动的查询缩减改进基于信息检索的Bug定位

Asif Mohammed Samir, Mohammad Masudur Rahman

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出IQLoc方法,结合信息检索与大语言模型的优势,通过语义理解优化查询,提升Bug定位的准确性和效率,实验结果表明其在多个评估指标上均优于现有方法。

Comments 62 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16885 2026-03-19 eess.SP cs.CL cs.HC cs.LG 62%

DECODE: Dual-Enhanced Conditioned Diffusion for EEG Forecasting

DECODE:双增强条件扩散用于脑电波预测

Mehran Shabanpour, Sadaf Khademi, Konstantinos N Plataniotis, Arash Mohammadi

机构 * Concordia Institute for Information Systems Engineering (CIISE), Concordia University, Canada. Department of Electrical Computer Engineering, University of Toronto, Canada

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 DECODE通过结合自然语言描述与历史信号的时序动态,实现对认知事件特定神经响应的预测,达到亚微伏精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 62%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03981 2026-03-19 cs.CL 57%

RADAR: Retrieval-Augmented Detector with Adversarial Refinement for Robust Fake News Detection

RADAR:基于对抗细化的检索增强检测器用于鲁棒虚假新闻检测

Song-Duo Ma, Yi-Hung Liu, Hsin-Yu Lin, Pin-Yu Chen, Hong-Yan Huang, Shau-Yung Hsu, Yun-Nung Chen

机构 * National Taiwan University(台湾大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 RADAR通过生成器与检测器的对抗训练提升虚假新闻检测鲁棒性,利用结构化反馈优化生成与检测过程,优于现有基线和LLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20866 2026-03-19 cs.CR cs.AI 57%

AVIATOR: Towards AI-Agentic Vulnerability Injection Workflow for High-Fidelity, Large-Scale Code Security Dataset

AVIATOR:面向高保真、大规模代码安全数据集的AI代理漏洞注入流程

Amine Lbath, Massih-Reza Amini, Aurelien Delaitre, Vadim Okun

机构 * National Institute of Standards and Technology, Software and Systems Division(美国国家标准与技术研究院软件与系统 division) Université Grenoble Alpes, CNRS, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,LIG实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出AVIATOR,首个AI代理漏洞注入框架,通过协调AI代理、工具分析和迭代自我纠正,生成高保真漏洞数据,提升漏洞检测模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17247 2026-03-19 cs.LG q-bio.QM 57%

Binary Latent Protein Fitness Landscapes for Quantum Annealing Optimization

二进制潜在蛋白质适应度景观用于量子退火优化

Truong-Son Hy

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出Q-BIOLAT框架,通过二进制潜在空间建模和优化蛋白质适应度景观,利用预训练蛋白质语言模型生成连续嵌入并转换为二进制表示,结合二次无约束二元优化模型实现高效组合搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17204 2026-03-19 cs.CL cs.AR cs.PL 57%

CODMAS: A Dialectic Multi-Agent Collaborative Framework for Structured RTL Optimization

CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架

Che-Ming Chang, Prashanth Vijayaraghavan, Ashutosh Jadhav, Charles Mackin, Vandana Mukherjee, Hsinyu Tsai, Ehsan Degan

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17171 2026-03-19 cs.CL 57%

Exploiting the English Grammar Profile for L2 grammatical analysis with LLMs

利用英语语法图谱对二语语法进行分析:基于大语言模型

Stefano Bannò, Penny Karanasou, Kate Knill, Mark Gales

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出利用英语语法图谱和大语言模型检测二语学习者的语法表现,通过规则和LLM分类器比较,展示LLM在语义和语用复杂构造上的优势,并验证混合方法在语法能力评估中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS 57%

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16874 2026-03-19 cs.HC cs.AI 57%

Disclosure By Design: Identity Transparency as a Behavioural Property of Conversational AI Models

设计中的披露:对话式AI模型的身份透明性作为行为属性

Anna Gausen, Sarenne Wallbridge, Hannah Rose Kirk, Jennifer Williams, Christopher Summerfield

机构 * AI Security Institute(人工智能安全研究所) University of Southampton(萨默塞特大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究探讨对话式AI在人类与AI交互日益模糊时如何维持身份透明性,提出通过设计实现披露,以提升系统可靠性并保护用户自主验证能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19995 2026-03-19 cs.MA cs.CL 57%

Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication

通信至完成:利用智能多智能体通信建模协作流程

Yiming Lu, Xun Wang, Simin Ma, Shujian Liu, Sathish Reddy Indurthi, Song Wang, Haoyun Deng, Fei Liu, Kaiqiang Song

机构 * Emory University(埃默里大学) Zoom Video Communications(Zoom视频通讯)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出C2C框架,通过建模通信为受限资源提升协作效率,实验表明成本意识策略使效率提升超40%,揭示出智能体自然采用管理者为中心的协调模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25918 2026-03-19 cs.CL 57%

Bringing Emerging Architectures to Sequence Labeling in NLP

将新兴架构引入自然语言处理中的序列标注

Ana Ezquerro, Carlos Gómez-Rodríguez, David Vilares

机构 * Universidade da Coruña, CITIC(圣地亚哥大学,CITIC) Graz University of Technology, IML(格拉茨技术大学,IML)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究新兴架构在不同序列标注任务中的适应性,发现其在简单任务中的表现不适用于复杂任务和多语言场景。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17965 2026-03-19 cs.CV 50%

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

LaDe:统一的多层图形媒体生成与分解

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

机构 * Adobe Research(Adobe研究院)

专题命中 评测与基准 :LLM(abstract)

AI总结 LaDe通过结合LLM提示扩展器、4D RoPE位置编码的潜在扩散变换器和RGBA VAE,实现灵活的多层媒体设计生成与分解,提升文本到多层媒体设计的对齐能力。

Comments 18 pages (main + supp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17840 2026-03-19 cs.CV 50%

Video Understanding: From Geometry and Semantics to Unified Models

视频理解:从几何与语义到统一模型

Zhaochong An, Zirui Li, Mingqiao Ye, Feng Qiao, Jiaang Li, Zongwei Wu, Vishal Thengane, Chengzu Li, Lei Li, Luc Van Gool, Guolei Sun, Serge Belongie

机构 * Department of Computer Science(计算机科学系) University of Copenhagen(哥本哈根大学) College of Computer Science(计算机科学学院) Nankai University(南开大学) School of Computer and Communication Sciences(计算机与通信科学学校) EPFL(苏黎世联邦理工学院) Department of Computer Science & Engineering(计算机科学与工程系) Washington University in St. Louis(圣路易斯华盛顿大学) Computer Vision Lab(计算机视觉实验室) University of Würzburg(乌尔姆大学) Computer Science Research Centre(计算机科学研究中心) University of Surrey(萨里大学) School of Electrical, Computer and Telecommunications Engineering(电气、计算机和电信工程学院) University of Wollongong(沃林根大学) Language Technology Lab(语言技术实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence(人工智能学院) Beijing Institute of Technology(北京理工大学) Institute for Computer Science(计算机科学研究所) INSAIT

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文综述了视频理解的发展,从低层几何理解到高层语义理解和统一模型,探讨了时间动态和视觉上下文建模的重要性,并总结了当前研究趋势和挑战。

Comments A comprehensive survey of video understanding, spanning low-level geometry, high-level semantics, and unified understanding models

Journal ref Machine Intelligence Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏