arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11211 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2608.09223 2026-08-11 cs.CV 新提交 50%

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection

PatchHead:学习空间块证据以实现可泛化的AI生成图像检测

Shengbo Qi, Hongyi Fang, Benjia Zhou, Rui Mao

专题命中 指令微调 :foundation model(abstract)

AI总结 针对AI生成图像检测器泛化能力差的问题,提出保留DINO块token二维结构的PatchHead,仅优化少量参数,在9个跨数据集基准上表现优异,提升了检测准确率并降低了域差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08867 2026-08-11 cs.CV 新提交 50%

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

基于粗到细VLM跟踪流水线的零样本交通事故检测

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

机构 * Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种无需训练的双通粗到细流水线,结合Qwen3-VL-32B-Instruct、YOLO11x与BoT-SORT,在零样本约束下于ACCIDENT @ CVPR基准测试中实现22%相对优势,达成0.504的三方调和均值得分。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026, Denver, CO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08336 2026-08-11 cs.CV 新提交 50%

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

面向计算高效的Transformer适配的电路微调

Uri Z. Kialy, Gil Ben-Artzi

专题命中 指令微调 :language model(abstract)

AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07981 2026-08-11 cs.CV 新提交 50%

Distilling Physical Priors into Streaming World Models

将物理先验知识蒸馏为流式世界模型

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出PhyS三阶段框架,构建120K物理交互数据集,经微调、蒸馏及在线强化学习结合TCR方法,提升流式世界模型的物理一致性,在PhysicsIQ等基准上取得显著性能提升。

Comments 9 pages, 7 figures. Project page: https://lyongo.github.io/PhyS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 50%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 指令微调 :language model(abstract)

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交 50%

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

专题命中 指令微调 :language model(abstract)

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05036 2026-08-06 cs.CR 新提交 50%

When Do PEFT Adaptations Leak Structure? Measuring Black-Box Structural Bounds in Public-Base Model Services

参数高效微调(PEFT)适配何时会泄露结构?测量公共基础模型服务中的黑盒结构边界

Zhongjiang Yao, Shuangshuang Liang, Chun Yang, LiWei Chen, Gang Shi

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究提出VectorHijack-SR方法,测量公共基础模型PEFT适配的结构泄露边界,发现PEFT服务会泄露结构与版本信息,且存在可见性-可利用性差距。

Comments Submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04791 2026-08-06 cs.CV 新提交 50%

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

遥感领域基于视觉语言模型的联邦学习中适配策略的有效性研究

Simon Lösche, Barış Büyüktaş, Mathis Adler, Angelos Zavras, Ioannis Papoutsis, Begüm Demir

机构 * BIFOLD - Berlin Institute for the Foundations of Learning and Data(BIFOLD - 柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) National Technical University of Athens(雅典国家技术大学) National Observatory of Athens(雅典国家天文台) Harokopio University of Athens(哈罗科皮奥雅典大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文针对遥感图像分类场景,首次对比全微调、LoRA等四种VLM适配策略在联邦学习中的表现,给出不同约束下的策略选择指南。

Comments Accepted at the SPIE Artificial Intelligence and Image and Signal Processing for Remote Sensing, Edinburgh, Scotland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03357 2026-08-05 cs.CV 新提交 50%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 指令微调 :prompting(abstract)

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03267 2026-08-05 cs.CR 新提交 50%

FedGSA: Geometry-Consistent Subspace Aggregation for Differentially Private Federated LoRA

FedGSA:用于差分隐私联邦LoRA的几何一致子空间聚合

Lele Zheng, Ruijie Hu, Tao Zhang, Ke Cheng, Yulong Shen

专题命中 指令微调 :language model(abstract)

AI总结 FedGSA是用于差分隐私联邦LoRA的几何一致子空间聚合框架,通过格拉斯曼流形上的基不变子空间聚合减少更新扭曲,在GLUE等任务上较基线提升2.17%、2.27%且无额外隐私损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 50%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01530 2026-08-04 cs.CV 新提交 50%

ST-LoRA: Single Trajectory LoRA Ensemble for Uncertainty Aware Agricultural Segmentation

ST-LoRA:用于不确定性感知农业分割的单轨迹LoRA集成

Mohamed Farag, Genc Hoxha, Yahia Maleki, Chris McCool, Ribana Roscher

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn(波恩大学拉马尔机器学习与人工智能研究所) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织(CSIRO))

专题命中 指令微调 :language model(abstract)

AI总结 ST-LoRA结合LoRA与快照集成,从单轨迹构建高效集成,在农业分割任务中,其性能优于多种基线方法,能高效实现不确定性感知。

Comments Submitted to Computers and Electronics in Agriculture (Elsevier). Currently under review (first revision round)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29033 2026-08-03 cs.CV 新提交 50%

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

SAM+D:通过深度路由LoRA与深度移位实现SAM系列模型的参数高效维度提升

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究提出SAM+D框架,通过DRLoRA与DSM两个轻量模块,以仅微调约2.8%(SAM)或3.7%(SAM2)参数的方式,实现2D SAM至3D、SAM2至4D的高效分割,在多个基准上取得具竞争力结果。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28987 2026-08-03 cs.SE 新提交 50%

A Formalism-Aware Reward Loop for Handwritten UML-to-PlantUML Generation

面向手写UML到PlantUML生成的形式化感知奖励循环

Mersedeh Sadeghi, Simon Scholz, Adrian Psoch-Bajraktari

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。

Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 50%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 指令微调 :language model(abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24465 2026-07-28 cs.CV 新提交 50%

Rethinking Expert Training for Model Merging with Prompt Learning

重新思考用于模型合并和提示学习的专家训练

Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno, Simone Calderara, Dimosthenis Karatzas, Joost van de Weijer

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) AImageLab, University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学AImageLab)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究重新思考模型合并的专家训练,提出基于提示自适应的强大基线,引入双调谐专家两阶段训练策略,可减少特定任务参数更新幅度,提升合并性能,组合异构专家集时也有效。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23694 2026-07-28 cs.CV 新提交 50%

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

用于提示驱动手术概念分割的 SAM3 的参数高效适配

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) XGEN Labs(XGEN实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。

Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 50%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23042 2026-07-28 cs.DC 新提交 50%

Application-Driven Architecture Exploration for Cross-Layer Heterogeneous Systems

跨层异构系统的应用驱动架构探索

Yuchen Fan, Minghong Sun, Jikui Ma, Yunpeng Xu, Shunyu Mao, Liu He, Shunan Dong, Jiahao Yang, Yu Zhu, Xinhao Yang, Tianyan Zhong, Haoran Sun, Daoqi Liu, Zongle Huang, Xinyuan Lin, Huazhong Yang, Maokun Li, Yongpan Liu, Yu Wang, Zhenhua Zhu, Hongyang Jia, Shuwen Deng

专题命中 指令微调 :LLM(abstract)

AI总结 研究跨层异构系统设计空间难探索的问题,提出应用驱动框架CHASE,通过分层图表示候选方案,用解耦两级循环避免联合硬件映射搜索难的问题,在稀疏计算和大语言模型工作负载上评估,实现加速并降本降耗。

Comments 20 pages, 15 figures. The first five authors contributed equally. Zhenhua Zhu, Hongyang Jia, and Shuwen Deng are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22331 2026-07-27 hep-ph 新提交 50%

SMEFT-Pheno-Agent: a natural-language-driven AI agent for machine-learning-assisted Standard Model Effective Field Theory phenomenology

SMEFT-现象学智能体:一种由自然语言驱动的人工智能智能体,用于机器学习辅助的标准模型有效场论现象学

Yu-Chen Guo, Jie Wang, Ji-Chong Yang

专题命中 指令微调 :LLM(abstract)

AI总结 介绍SMEFT-现象学智能体这一Python工作流程,由自然语言AI引导,用于高能对撞机的SMEFT现象学研究。它协调多阶段,自动生成参数文件等,委托工具计算,记录相关工件,建立了可重复性和审核可追溯性。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交 50%

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20900 2026-07-24 cs.CV 新提交 50%

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 50%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 50%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 指令微调 :SFT(abstract)

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 指令微调 :language model(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 50%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 指令微调 :post-training(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17987 2026-07-21 cs.SE 新提交 50%

Chiral Analysis of Smart Contracts: Detecting Vulnerabilities from Relational Inconsistencies Across Business Paths

智能合约的手性分析:从业务路径间的关系不一致中检测漏洞

Yue Xue

专题命中 指令微调 :LLM(abstract)

AI总结 研究智能合约因业务路径关系不一致产生的漏洞,提出手性分析,将配对路径视为隐式规范,形式化关系并推导义务。通过ChiralDetector实现,经初步评估能减少候选对、产生去重结果,揭示难用单功能规则表达的漏洞类并控制成本与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 50%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 指令微调 :post-training(abstract)

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16546 2026-07-21 cs.CV 新提交 50%

AffectFuse: Cross-Task Feature Fusion with Temporal Modeling for Multi-Task Affective Behavior Analysis

AffectFuse:用于多任务情感行为分析的具有时间建模的跨任务特征融合

Dipit Saha, Mohammad Raihan Rashid, Shah Mohammad Abdul Mannan, Ahnaf Tahmid, Md. Mehedi Hasan

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对自然环境情感行为识别,提出AffectFuse系统,通过编码器后适配,利用冻结主干提供特征,特定模块选择信号,采用MAE-Face与LoRA及专家路由识别动作单元,消融实验确定配置,有效构建MTL管道且无需训练新基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏