arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 187 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2603.18048 2026-03-23 cs.AI cs.SD eess.AS 83%

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19744 2026-03-23 cs.CL 77%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 77%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19583 2026-03-23 cs.SE cs.AI 77%

Skilled AI Agents for Embedded and IoT Systems Development

嵌入式与物联网系统开发中的技能型AI代理

Yiming Li, Yuhan Cheng, Mingchen Ma, Yihang Zou, Ningyuan Yang, Wei Cheng, Hai "Helen" Li, Yiran Chen, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出技能型AI代理框架与IoT-SkillsBench基准,通过实测验证,展示结构化专家知识在嵌入式编程中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05710 2026-03-23 q-fin.CP cs.AI 77%

FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation

FinReflectKG -- EvalBench:基于多维评估的金融知识图谱基准测试

Fabrizio Dimino, Abhinav Arun, Bhaskarjit Sarmah, Stefano Pasquali

机构 * New York, US(美国纽约) Gurugram, India(印度古尔冈)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FinReflectKG-EvalBench,通过多维评估框架对金融知识图谱提取进行基准测试,证明基于反思的提取方法在全面性、精度和相关性上表现最佳,同时验证LLM作为评判者在成本效率和结构化错误分析中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV 75%

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19399 2026-03-23 cs.SE 75%

DePro: Understanding the Role of LLMs in Debugging Competitive Programming Code

DePro:理解LLMs在调试竞赛编程代码中的作用

Nabiha Parvez, Tanvin Sarkar Pallab, Mia Mohammad Imran, Tarannum Shaila Zaman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证研究,提出DePro方法,利用测试用例驱动的方式帮助程序员修正现有代码,有效提升调试效率,实验表明其在减少调试次数和时间方面优于人类和零样本LLM。

Comments This paper is accepted in FSE 2026 IVR track!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19237 2026-03-23 cs.DL 75%

Prompt engineering for bibliographic web-scraping

用于文献数据库网络爬取的提示工程

Manuel Blázquez-Ochando, Juan José Prieto-Gutiérrez, María Antonia Ovalle-Perandones

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨如何利用提示工程高效构建数据录入模型,通过ChatGPT-4o实现单次交互生成功能完整的PHP网络爬虫,适用于文献数据库。

Comments 26 pages, 7 Tables, 2 Figures

Journal ref Scientometrics, 2025, 130(7), 3433-3453

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03273 2026-03-23 cs.CL cs.AI cs.HC cs.LG 75%

A Multi-Perspective Benchmark and Moderation Model for Evaluating Safety and Adversarial Robustness

一种多视角基准和评估模型用于评估安全性和对抗鲁棒性

Naseem Machlovi, Maryam Saleki, Ruhul Amin, Mohamed Rahouti, Shawqi Al-Maliki, Junaid Qadir, Mohamed M. Abdallah, Ala Al-Fuqaha

机构 * Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系) College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院) Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GuardEval多视角基准和GGuard模型,通过细粒度标签提升内容审核的准确性和对抗鲁棒性,实验显示GGuard在宏平均F1得分上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15872 2026-03-23 cs.LG 74%

Hidden Breakthroughs in Language Model Training

语言模型训练中的隐藏突破

Sara Kangaslahti, Elan Rosenfeld, Naomi Saphra

机构 * Harvard University(哈佛大学) Google Research(谷歌研究)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文提出POLCA方法,通过分解损失变化来揭示训练过程中的隐藏转折点,通过合成任务验证其在模型能力解读中的潜力。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19615 2026-03-23 cs.SD cs.AI cs.CL 73%

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估

Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo

机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。

Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI 73%

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19426 2026-03-23 cs.CL cs.AI 73%

Is Evaluation Awareness Just Format Sensitivity? Limitations of Probe-Based Evidence under Controlled Prompt Structure

评估意识仅仅是格式敏感性?基于探针的证据在受控提示结构下的局限性

Viliana Devbunova

机构 * Yandex Belgrade(Yandex 布尔加斯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于探针的证据在受控提示结构下的可靠性,发现其主要追踪基准格式而非评估上下文,限制了现有结果的说服力。

Comments 10 pages, 5 tables, 2 figures. Accepted at ICLR 2026 Workshop "I Can't Believe It's Not Better"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19313 2026-03-23 cs.CL cs.AI 73%

Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMs

基于记忆的角色扮演:评估和增强LLM中人设知识的利用

Kai Wang, Haoyang You, Yang Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Macquarie University(麦考瑞大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Memory-Driven Role-Playing框架,通过MREval、MRPrompt和MRBench评估LLM在角色扮演中的记忆能力,验证了小模型能效媲美大模型,并证明上游记忆提升下游响应质量。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19276 2026-03-23 cs.CL cs.AI 73%

From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG

从平面到结构:利用GraphRAG增强自动简答评分

Yucheng Chu, Haoyu Han, Shen Dong, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Joseph Krajcik, Namsoo Shin, Hui Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphRAG框架,通过构建结构化知识图谱解决传统RAG在复杂教育内容中的不足,实验表明其在评估科学与工程实践方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 73%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 73%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 70%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21448 2026-03-23 cs.CR cs.AI cs.DB 70%

The Phish, The Spam, and The Valid: Generating Feature-Rich Emails for Benchmarking LLMs

钓鱼邮件、垃圾邮件与有效邮件:为评估大语言模型生成特征丰富的电子邮件

Rebeka Toth, Tamas Bisztray, Nils Gruschka

机构 * Department of Informatics University of Oslo Oslo, Norway(信息学院奥斯陆大学奥斯陆挪威)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhishFuzzer框架,通过将真实邮件输入大语言模型生成23100种结构一致的电子邮件变体,提供严格三类标签和元数据,评估LLM在不同设置下的可靠性与检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 67%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06858 2026-03-23 cs.SE 67%

Patch Validation in Automated Vulnerability Repair

自动漏洞修复中的补丁验证

Zheng Yu, Wenxuan Shi, Xinqian Sun, Zheyun Feng, Meng Xu, Xinyu Xing

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出PVBench基准测试,揭示现有自动漏洞修复系统在补丁验证中存在显著误差,指出需提升根因分析、规范遵循和开发者意图捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10525 2026-03-23 cs.CL cs.AI cs.LG 67%

LHAW: Controllable Underspecification for Long-Horizon Tasks

LHAW:长周期任务的可控性不足

George Pu, Michael S. Lee, Udari Madhushani Sehwag, David J. Lee, Bryan Zhu, Yash Maurya, Mohit Raghavendra, Yuan Xue, Samuel Marc Denton

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LHAW框架,通过系统性地移除目标、约束、输入和上下文信息,生成可控的不明确任务变体,用于评估自主系统在长周期任务中的澄清行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08453 2026-03-23 cs.SI 67%

Whose Values? Measuring the (Subjective) Expression of Basic Human Values in Social Media

谁的价值?在社交媒体中测量(主观)基本人类价值观的表达

Ziv Epstein, Farnaz Jahanbakhsh, Tiziano Piccardi, Isabel Gallegos, Dora Zhao, Johan Ugander, Michael Bernstein

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文基于Schwartz价值观体系,提出一种规模化测量社交媒体中价值观表达的框架,通过个性化校准注释提升预测准确性,揭示人类价值观测量的新方法。

Comments Proceedings of the International AAAI Conference on Web and Social Media. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23295 2026-03-23 cs.CV 67%

LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis

LED基准:诊断文档布局分析中的结构性布局错误

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出LED基准,用于评估文档布局预测的结构鲁棒性,通过定义八种标准错误类型和三个互补任务,解决传统指标无法检测的结构性错误问题。

Comments This work has been substantially revised, including updates to the title and content. The revised version is available as arXiv:2603.17265

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19849 2026-03-23 cs.CL cs.AI 62%

Semantic Delta: An Interpretable Signal Differentiating Human and LLMs Dialogue

语义delta:一种可解释的信号,区分人类与LLM对话

Riccardo Scantamburlo, Mauro Mezzanzana, Giacomo Buonanno, Francesco Bertolotti

机构 * School of Industrial Engineering Intelligence, Complexity and Technology Lab (ICT Lab)(工业工程智能、复杂性与技术实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种可解释的统计特征,通过语义类别分布差异区分人类和LLM生成的对话,利用语义delta衡量主题集中度,发现LLM生成内容主题更集中,人类对话更广泛平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01183 2026-03-23 cs.CL cs.AI 62%

TempPerturb-Eval: On the Joint Effects of Internal Temperature and External Perturbations in RAG Robustness

TempPerturb-Eval: 关于RAG鲁棒性中内部温度与外部扰动的联合影响

Yongxin Zhou, Philippe Mulhem, Didier Schwab

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了RAG系统中内部温度与外部扰动的交互影响,提出分析框架并展示实验结果,揭示高温度设置加剧扰动敏感性,提出评估基准和调参指南。

Comments LREC 2026, Palma, Mallorca (Spain), 11-16 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG 62%

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20164 2026-03-23 cs.RO cs.AI 57%

The Robot's Inner Critic: Self-Refinement of Social Behaviors through VLM-based Replanning

机器人的内在批评者:通过基于视觉语言模型的重新规划实现社会行为的自我完善

Jiyu Lim, Youngwoo Yoon, Kwanghyun Park

机构 * KwangWoon University(匡文大学) ETRI(电子技术研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出CRISP框架,通过基于视觉语言模型的重新规划,使机器人自主评估并优化其社会行为,提高灵活性和自主性,适用于多种平台。

Comments Accepted to ICRA 2026. 8 pages, 9 figures, Project page: https://limjiyu99.github.io/inner-critic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20014 2026-03-23 cs.LG 57%

AgenticRS-EnsNAS: Ensemble-Decoupled Self-Evolving Architecture Search

AgenticRS-EnsNAS: ensemble-decoupled 自我进化架构搜索

Yun Chen, Moyu Zhang, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出ensemble-decoupled架构搜索框架,通过预测系统级性能降低评估成本,统一了连续和离散pi的解决方案策略,揭示了基础多样性增益和准确增益两种改进机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19831 2026-03-23 eess.AS cs.AI cs.MM 57%

Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?

Gesture2Speech: 手部动作能多大程度上塑造表现性语音?

Lokesh Kumar, Nirmesh Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出Gesture2Speech框架,利用视觉手势线索调节合成语音的语调,通过多模态MoE架构动态融合语言内容和手势特征,提升语音自然度和手势与语调的同步性。

Comments Accepted at The 2nd International Workshop on Bodily Expressed Emotion Understanding (BEEU) at AAAI 2026 [non-archival]

详情

展开后加载摘要…

URL PDF HTML 收藏