arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-30 至 2026-03-30 共收录 201 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2509.21891 2026-03-30 cs.SE cs.CL 70%

AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans

AgentPack:一个由代理和人类共同撰写的代码更改数据集

Yangtian Zi, Zixuan Wu, Aleksander Boruch-Gruszecki, Jonathan Bell, Arjun Guha

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AgentPack数据集,包含180万条由Claude Code、OpenAI Codex和Cursor Agent与人类共同撰写的代码更改,分析其结构特性,并展示基于该数据集微调的模型在代码编辑任务中优于传统人类提交数据集的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02835 2026-03-30 cs.LG cs.IR 70%

Defending Against Knowledge Poisoning Attacks During Retrieval-Augmented Generation

在检索增强生成过程中防御知识污染攻击

Kennedy Edemacu, Vinay M. Shashidhar, Micheal Tuape, Dan Abudu, Beakcheol Jang, Jong Wook Kim

机构 * Department of Computer Science, The City University of New York - College of Staten Island(纽约市立大学史泰登岛学院计算机科学系) Department of Mathematics and Computer Science, Northern Michigan University(北密歇根大学数学与计算机科学系) Department of Software Engineering, Lappeenranta-Lahti University of Technology(拉彭兰塔-拉赫蒂理工大学软件工程系) Energy and Bioproducts Research Institute, Aston University(阿斯顿大学能源与生物产品研究所) Graduate School of Information, Yonsei University(延世大学信息研究生院) Department of Computer Science, Sangmyung University(祥明大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FilterRAG和ML-FilterRAG方法,通过识别对抗性文本与清洁文本的差异特性,有效缓解PoisonedRAG攻击,实验表明其性能接近原始RAG系统。

Comments Preprint for Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25780 2026-03-30 cs.SE cs.LG 70%

A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation

裁判代理缩小了人工智能生成的科学模拟的可靠性差距

Chengshuai Yang

机构 * NextGen PlatformAI C Corp(NextGen PlatformAI C公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出裁判代理自动验证生成的科学模拟代码,将失败率从42%降至1.5%,并在12个领域中实现89%的成功率,同时引入spec.md规范格式。

Comments 36 pages, 5 figures, 22 tables, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25770 2026-03-30 cs.SE cs.AI 70%

ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation

ReCUBE:评估代码生成中仓库级上下文利用

Jiseung Hong, Benjamin G. Ascoli, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReCUBE基准测试评估LLM在代码生成中利用仓库级上下文的有效性,通过重建掩码文件并使用依赖关系和文档作为上下文,发现即使先进模型在完整上下文设置下也仅达到37.57%的通过率,而引入Caller-Centric Exploration工具包可显著提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16629 2026-03-30 cs.CV cs.AI 70%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 67%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26497 2026-03-30 cs.CR cs.SE 67%

Reentrancy Detection in the Age of LLMs

在LLM时代中的重入检测

Dalila Ressi, Alvise Spanò, Matteo Rizzo, Lorenzo Benetollo, Sabina Rossi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过构建两个基准测试,评估了12种形式化方法工具、10种机器学习模型和9种大语言模型在检测Solidity 0.8+中的重入漏洞方面的性能,结果显示大语言模型在重入检测中表现优于传统工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26174 2026-03-30 cs.CV 67%

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

CREval: 一种自动化可解释的评估方法用于复杂指令下的创意图像操纵

Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Pengcheng Lab, Guangzhou(广州鹏城实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出CREval,一种基于问答的自动化评估框架,用于评估复杂指令下的创意图像编辑任务,通过CREval-Bench基准测试揭示模型在复杂创意任务中的表现及挑战。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 67%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26033 2026-03-30 cs.CV 67%

Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

知识即力量:利用大语言模型的多模态语义提升少样本动作识别

Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出FSAR-LLaVA,首次利用大语言模型作为多模态知识库直接增强少样本动作识别。通过多模态解码器提取时空丰富表示,结合多模态特征增强模块生成视觉和文本特征,并利用MLLM的灵活性设计复合任务导向原型构造,提升跨数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17528 2026-03-30 cs.CV 67%

MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

MM-OVSeg:多模态光学-合成孔径雷达融合用于遥感中的开放词汇分割

Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所先进智能研究中心)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 MM-OVSeg通过融合光学和SAR数据,提升恶劣天气下的开放词汇分割鲁棒性与泛化能力,采用跨模态统一过程和双编码器融合模块实现多传感器表征对齐与多模态分割。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV 67%

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 62%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18349 2026-03-30 cs.AI cs.CL 62%

Large-Scale Analysis of Persuasive Content on Moltbook

对Moltbook上说服性内容的大规模分析

Julia Jose, Meghna Manoj Nair, Rachel Greenstadt

机构 * New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过LLM分类器分析Moltbook上政治宣传内容,发现政治宣传占所有帖子的1%和政治内容的42%,集中于少数社区,由少数代理生成,但评论未显著放大宣传内容。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26221 2026-03-30 cs.CR cs.AI cs.ET cs.SE 57%

Clawed and Dangerous: Can We Trust Open Agentic Systems?

带刺且危险:我们能信任开放代理系统吗?

Shiping Chen, Qin Wang, Guangsheng Yu, Xu Wang, Liming Zhu

机构 * CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文探讨开放代理系统在安全治理中的挑战,提出六维分析框架和安全建设参考原则,指出当前在部署控制、运营治理等方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26137 2026-03-30 cs.SE cs.AI 57%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26130 2026-03-30 cs.SE cs.AI 57%

SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback

SWE-PRBench:基于拉取请求反馈的AI代码审查质量基准测试

Deepak Kumar

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 SWE-PRBench通过350个带人工标注的拉取请求评估AI代码审查质量,发现即使在代码生成基准测试中表现良好,AI在仅基于差异的配置下仍只能检测出人类标记问题的15-31%,表明AI代码审查距离人类专家表现仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26017 2026-03-30 cs.LG 57%

QuitoBench: A High-Quality Open Time Series Forecasting Benchmark

QuitoBench: 一个高质量的开放时间序列预测基准

Siqiao Xue, Zhaoyang Zhu, Wei Zhang, Rongyao Cai, Rui Wang, Yixiang Mu, Fan Zhou, Jianguo Li, Peng Di, Hang Yu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 QuitoBench通过构建覆盖八个TSF领域的高质量时间序列基准,揭示了深度学习模型在短上下文中的优势、预测难度对性能的影响以及数据量扩展对模型效果的提升作用。

Comments project site: https://hq-bench.github.io/quito/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13227 2026-03-30 cs.IR cs.AI 57%

Insider Knowledge: How Much Can RAG Systems Gain from Evaluation Secrets?

内部知识:RAG系统能从评估秘密中获得多少收益?

Laura Dietz, Bryan Li, Eugene Yang, Dawn Lawrie, William Walden, James Mayfield

机构 * University of New Hampshire(新罕布什尔大学) University of Pennsylvania(宾夕法尼亚大学) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过对比实验探讨RAG系统在评估秘密泄露时的评估风险,指出盲评和方法多样性的重要性。

Comments To appear in ECIR 2026, Lecture Notes in Computer Science, Volume 16483

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-03-30 cs.CV cs.AI 57%

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18602 2026-03-30 cs.CL 57%

Do LLMs suffer from Multi-Party Hangover? A Diagnostic Approach to Addressee Recognition and Response Selection in Conversations

大型语言模型是否受多方对话的困扰?一种诊断方法用于对话中的收件人识别和回应选择

Nicolò Penzo, Maryam Sajedinia, Bruno Lepri, Sara Tonelli, Marco Guerini

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) University of Trento, Italy(意大利特伦托大学) University of Turin, Italy(意大利都灵大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种方法论流程,用于研究对话特定结构属性下的模型性能,通过诊断子数据集分析回应选择和收件人识别任务,揭示模型弱点。

Comments Accepted to EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00181 2026-03-30 cs.CV cs.AI 57%

Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly

揭示是什么、为什么和如何:面向视频异常因果理解的全面基准

Hang Du, Sicheng Zhang, Binzhu Xie, Guoshun Nan, Jiayang Zhang, Junrui Xu, Hangyu Liu, Sicong Leng, Jiangming Liu, Hehe Fan, Dajiu Huang, Jing Feng, Linli Chen, Can Zhang, Xuhuan Li, Hao Zhang, Jianhang Chen, Qimei Cui, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Yunnan University(云南大学) Zhejiang University(浙江大学) China Telecom Co., Ltd. Sichuan Branch(中国电信股份有限公司四川分公司)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出CUVA基准,通过三种人类标注解决视频异常的'what'、'why'和'how'问题,并引入MMEval评估指标和基于提示的方法,验证其在异常因果理解中的有效性。

Comments Accepted in CVPR2024, Codebase: https://github.com/fesvhtr/CUVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL 57%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 57%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02080 2026-03-30 cs.CV cs.LG 57%

From Pixels to Patches: Pooling Strategies for Earth Embeddings

从像素到拼接:地球嵌入的池化策略

Isaac Corley, Caleb Robinson, Inbal Becker-Reshef, Juan M. Lavista Ferres

机构 * Wherobots Microsoft AI for Good Research Lab(微软人工智能造福研究实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究提出三种池化策略以提升地理嵌入的泛化能力,通过基准测试发现统计池化和协方差池化在空间分割任务中表现更优,比均值池化提升50%以上。

Comments ICLR 2026 ML4RS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21011 2026-03-30 cs.CV 50%

Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

Score2Instruct: 通过自动化维度评分扩展视频质量导向的指令

Qizhi Xie, Kun Yuan, Yunpeng Qu, Jiachao Gong, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :instruction tuning(abstract)

AI总结 本文提出Score2Instruct管道,通过自动化生成视频质量指令数据,提升视频大模型的质量评分和解释能力,构建了S2I-Bench基准测试集并验证了方法的有效性。

Comments 16 pages, 5 figures. Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25891 2026-03-30 cs.CV 50%

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

少样本文本到图像检索:新基准数据集和优化方法

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出FSIR任务及FSIR-BD数据集,通过少样本学习方法提升图像检索性能,实验表明其基准挑战性及优化方法优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09858 2026-03-30 cs.CV 50%

Weakly Supervised Learning for Facial Affective Behavior Analysis : A Review

弱监督学习用于面部情感行为分析:综述

R. Gnana Praveen, Patrick Cardinal, Eric Granger

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Laboratoire d’imagerie, de vision et d’intelligence artificielle (LIVIA), ETS Montreal(蒙特利尔高等技术学院图像、视觉与人工智能实验室 (LIVIA))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文综述了弱监督学习在面部情感行为分析中的应用,探讨了弱标注场景下的分类与回归任务方法,分析了其优缺点及未来研究方向。

Comments Provided a link of constantly updated papers \url{https://github.com/praveena2j/ awesome-Weakly-Supervised-Facial-Behavior-Analysis}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 38 篇

2603.26498 2026-03-30 cs.DC cs.AI 89%

Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference

岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度

Konstantinos Papaioannou, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏