arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 98 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 5 篇

2607.28008 2026-08-17 cs.CL cs.AI 版本更新 88%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03966 2026-08-17 cs.CL 版本更新 70%

HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

HalluTruthQA-4K:面向阿拉伯语幻觉检测与事实验证的细粒度语料库及标注流程

Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli, Mohammed-En-Nadhir Zighem, Abdenour Hadid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HalluTruthQA-4K,这一含4000个阿拉伯语问答实例的细粒度语料库,用于阿拉伯语幻觉检测等任务,为HalluScoring 2026共享任务提供官方数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 67%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: this https URL (https://junwoonlee.github.io/projects/LatentAM/) Code: this https URL (https://github.com/UMich-SSI-Lab/latentam)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08067 2026-08-17 cs.CL cs.AI 版本更新 62%

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

DialectS2S:面向低资源汉语方言的端到端语音对话建模

Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源汉语方言语音数据稀缺及语义不一致问题,提出DialectS2S模型,通过合成流水线与自对齐后训练策略提升方言语音生成质量,开源框架实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11637 2026-08-17 astro-ph.IM 版本更新 50%

Multivariate time series transformer embeddings for light curves of periodic variable stars

用于周期性变星光变曲线的多变量时间序列Transformer嵌入

Gabriel Chiong, Ignacio Becker, Pavlos Protopapas

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究扩展了Astromer框架,提出多波段Transformer架构,在周期性变星分类任务中,其F1分数较单波段模型提升10至23个百分点,展现了多波段模型的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 5 篇

2607.28895 2026-08-17 cs.IR 版本更新 92%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11426 2026-08-17 cs.CL 版本更新 81%

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

收敛是不可避免的吗?将输出同质性追溯至基础模型

Alexandrine Fortier, Hazel Chen, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究指出大语言模型的语义收敛或源于预训练目标,仅靠对齐后干预难缓解,通过实验证实基础模型可被提示诱导类指令式坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31722 2026-08-17 cs.CL 版本更新 57%

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

将基础ASR模型适应于构音障碍语音:案例研究

Christian Huber, Laura Kernahan, Alexander Waibel

机构 * Interactive Systems Lab(交互系统实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL

AI总结 通过个性化微调基础ASR模型,针对构音障碍语音将词错误率降至9.7%,验证了适应方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07366 2026-08-17 cs.CL 版本更新 57%

When Gradient Importance Lies: Adaptive LoRA Rank Allocation Fails Under GRPO

基于GRPO的LoRA秩分配:一项实证研究

Yash Ganpat Sawant

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文探讨LoRA秩分配在强化学习中的有效性,发现GRPO环境下梯度重要性无法预测容量需求,非均匀分配反而降低准确性。

Comments Accepted at the Insights from Negative Results in NLP Workshop, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06142 2026-08-17 cs.CV 版本更新 50%

Learning visual representations for compositional analysis of artworks and photographs

面向艺术品与照片的组合分析学习视觉表征

Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

机构 * KU Leuven University(KU Leuven大学(荷语鲁汶大学))

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究对比了受人类启发的构图分析方法与微调基础模型两种范式,在三类任务上评估性能,发现前者冻结编码器时具竞争力且可解释,后者微调后性能更优但可解释性与泛化性下降。

Comments ECCV workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 7 篇

2608.08904 2026-08-17 cs.CV cs.AI cs.LG 版本更新 84%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 82%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18871 2026-08-17 cs.AI cs.NI 版本更新 81%

Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETs

弥合网络碎片化:一种语义增强的深度强化学习框架用于无人机辅助的VANETs

Gaoxiang Cao, Wenke Yuan, Huasen He, Yunpeng Hou, Xiaofeng Jiang, Shuangwu Chen, Jian Yang

机构 * Department of Automation, University of Science & Technology of China(中国科学技术大学自动化系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出语义增强深度强化学习框架,通过语义推理优化无人机在VANETs中的部署,提升网络连通性与效率。

Comments Revised version. This update includes substantial improvements to the methodology, ablation studies, temporal robustness analysis, and cross-city generalization experiments. Submitted to IEEE Transactions on Cognitive Communications and Networking. 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 79%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 77%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21834 2026-08-17 cs.MA 版本更新 75%

RobustFlow: Towards Robust Agentic Workflow Generation

RobustFlow:面向鲁棒智能体工作流生成

Shengxiang Xu, Jiayi Zhang, Shimin Di, Yuyu Luo, Liang Yao, Hanmo Liu, Jia Zhu, Min-Ling Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对现有智能体工作流生成方法对语义等价不同表述指令鲁棒性不足的问题,提出RobustFlow系统,结合偏好优化与专用基准,在多扰动下鲁棒性得分70%--90%,优于AFlow、ScoreFlow等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03471 2026-08-17 cs.CV 版本更新 50%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 2 篇

2512.10441 2026-08-17 cs.CL 版本更新 70%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13024 2026-08-17 cs.CE 版本更新 67%

TIEM: Temporal Integration of Hypergraph Evidence and Skill Memory for Event-Driven Financial Forecasting

TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架

Wenjin Liu, Shen Pang, Chenxi Wang, Tiesunlong Shen, Zhe Cui, Xiaobao Wu, Anh Tuan Luu, Haoran Luo

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 14 篇

2608.10492 2026-08-17 cs.AI cs.CY 版本更新 92%

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract,comments);large language model(abstract);prompting(abstract)

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01014 2026-08-17 cs.CL cs.AI 版本更新 92%

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何

Yuzhou Liu, Xiyang Hu

专题命中 推理与问题求解 :LLM(title,summary_cn);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。

Comments 14 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-17 cs.DB cs.AI 版本更新 91%

Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang, Shibo Zheng, Haoyu Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12751 2026-08-17 cs.AR cs.AI 版本更新 90%

SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization

SynAct:用于自适应综合优化的推理-行动大语言模型智能体

Fangzhou Liu, Peiyi Han, Jiawei Liu, Yuan Pu, Zhuolun He, Rongliang Fu, Tsung-Yi Ho, Bei Yu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 SynAct是一种自适应闭环LLM推理-行动智能体,通过结合电路状态、工具知识与历史经验发布针对性命令,在14个商用设计实验中将平均WNS降至引导式综合的27%,实现高效自适应逻辑综合优化。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01236 2026-08-17 cs.RO cs.AI 版本更新 90%

LLM-Advisor: An LLM Advisor for Cost-efficient Path Planning across Multiple Terrains

LLM-Advisor: 一种用于多地形高效路径规划的LLM基准

Ling Xiao, Toshihiko Yamasaki

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。

Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-17 cs.AI cs.CL cs.CY 版本更新 90%

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01413 2026-08-17 cs.CL cs.AI 版本更新 89%

Adaptive Stopping for Multi-Turn LLM Reasoning

多轮LLM推理中的自适应停止

Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Augustana College(奥古斯塔纳学院) University of Utah(犹他大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MiCP框架,通过分配不同误差预算实现多轮推理中的自适应停止,同时保证覆盖率,减少轮次、推理成本和预测集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11461 2026-08-17 cs.RO 版本更新 88%

CoViLLM: An Adaptive Human-Robot Collaborative Assembly Framework Using Large Language Models

CoViLLM:一种利用大语言模型的自适应人机协作装配框架

Jiabao Zhao, Jonghan Lim, Hongliang Li, Ilya Kovalenko

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。

Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 86%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09706 2026-08-17 cs.CE cs.LG 版本更新 81%

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

基于无验证器共识选择的CAD生成测试时缩放

Aaron Haag, Altay Kacan, Bertram Fuchs, Oliver Lohse

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08990 2026-08-17 cs.CV 版本更新 67%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏