arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 312 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2510.22170 2026-07-30 cs.AI 版本更新 81%

Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests

测量所关心的:使用情境判断测试对AI进行心理测量评估

Alexandra Yost, Shreyans Jain, Shivam Raval, Grant Corser, Allen Roush, Nina Xu, Jacqueline Hammack, Ravid Shwartz-Ziv, Amirali Abdullah

机构 * Cedar City PD

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过情境判断测试和多维项目反应理论评估AI行为一致性,发现基于角色的AI行为稳定且可预测,提出更可靠的评估方法。

Comments 100 pages. Code, and link to datasets here: https://github.com/amir-abdullah-thoughtworks/psychometrics_for_LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 80%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26191 2026-07-30 cs.AI cs.CL cs.LG cs.SE 新提交 80%

Position: Evaluation Scores Are Perishable Knowledge Claims

Position: 评估分数是易逝的知识主张

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深度思考解决方案公司) Meta University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。

Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23442 2026-07-30 cs.CL 版本更新 79%

Do LLM Debates Repeat Arguments Differently Across Languages?

大语言模型辩论在不同语言中重复论点的方式是否不同?

Huiqian Lai

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究大语言模型辩论在不同语言中重复论点的差异,用“先验论点相似度”方法,发现在多语言嵌入模型中中文与英文有正向差距,该差距在多种条件下持续,多样性提示未显著缩小差距,建议多语言辩论评估衡量论证发展并报告缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 79%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05710 2026-07-30 physics.ao-ph cs.AI cs.LG 版本更新 79%

The Rise of AI in Weather and Climate Information and its Impact on Global Inequality

人工智能在天气和气候信息中的兴起及其对全球不平等的影响

Amirpasha Mozaffari, Amanda Duarte, Lina Teckentrup, Stefano Materia, Gina E. C. Charnley, Lluis Palma, Eulalia Baulenas Serra, Dragana Bojovic, Paula Checchia, Aude Carreric, Francisco Doblas-Reyes

机构 * Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 人工智能在天气和气候信息中的兴起加剧了全球不平等,需通过数据为中心的发展、气候数字基础设施和知识共生产来解决不平等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26536 2026-07-30 cs.CV 新提交 78%

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

Jinkun Zhao, Kui Zhang, Wenjun Wu

机构 * Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26611 2026-07-30 cs.AI cs.HC 新提交 77%

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

更少澄清,更优代码:评测编码助手的跨会话个性化歧义适应能力

Zijian Xu, Wenshuo Zhang, Zisen Qin, Rui Sheng, Yushi Sun, Huamin Qu, Chuhan Shi

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究提出个性化歧义适应新任务,构建CAPA评测基准,评估12个LLM在有无用户历史下的表现,提出同用户历史门控方法,助力开发减少重复澄清的长期编码助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15715 2026-07-30 cs.AI 版本更新 77%

Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents

信息提取的智能模型行为可控性:从固定工作流程到反思性智能体

Lujia Zhang, Xingzhou Chen, Hongwei Feng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体用于信息提取任务时,反思和记忆等智能组件能否带来改进。通过会议论文数据集提取实验,比较固定工作流程与反思智能体变体,指定优化条件,评估过程行为,明确智能机制对系统行为的影响及如何推动智能体设计优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25635 2026-07-30 cs.SE 版本更新 75%

An Empirical Study of Model Context Protocol Applications

模型上下文协议应用的实证研究

Muhammad Hamza Arshad Majeed, May Mahmoud, Sarah Nadi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究对1723个GitHub上的MCP应用展开大规模研究,先从样本得出分类,再用大语言模型辅助流程刻画服务器集成。结果表明该生态系统部分实践趋同,如多数用文件配置服务器、用官方SDK通信,但配置文件命名无约定,人工监督差异大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03271 2026-07-30 cs.HC 75%

Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI Agents

代理关系伤害:AI代理中关系操纵的基准测试与门控

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对AI代理可能造成的关系操纵风险,提出了一个110提示的基准测试、关系特定标注框架和轻量级后生成策略门控,以评估和缓解代理关系伤害。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23624 2026-07-30 cs.SE cs.AI cs.CL 版本更新 73%

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

代理软件开发中第三方 API 路由器的成本在哪里?

Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 73%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11007 2026-07-30 cs.AI cs.CL 版本更新 73%

AdaMARP: An Adaptive Multi-Agent Interaction Framework for General Immersive Role-Playing

AdaMARP: 一种自适应多智能体交互框架用于通用沉浸式角色扮演

Zhenhua Xu, Dongsheng Chen, Shuo Wang, Jian Li, Chengjie Wang, Meng Han, Yabiao Wang

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 AdaMARP提出了一种自适应多智能体交互框架,通过沉浸式信息格式和显式场景管理器提升角色扮演的沉浸感和适应性,实验表明其在角色一致性、环境基础性和场景转换等方面优于现有系统。

Comments ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 70%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27022 2026-07-30 cs.CL 新提交 70%

Evaluating Regional Bias in LLMs From Abstract Stereotype to Concrete Social Decision-Making

评估大型语言模型(LLMs)中从抽象刻板印象到具体社会决策的区域偏差

Jiayuan Di, Haoyi Yang, Yufei Luo, Jiahui Qu, Yiming Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出S2D框架,评估6个LLMs在34个中国省级行政区的区域偏差,发现其普遍存在且具系统性,推动相关评估与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26652 2026-07-30 cs.LG 新提交 70%

AIGen: Automating AI Bill of Materials Generation Through Hybrid MLOps Integration

AIGen:通过混合MLOps集成实现AI物料清单的自动化生成

Federica Pepe, Daniele Bifolco, Costantino Martignetti, Aureliano D'Amici, Fabiano Izzo, Damian A. Tamburri, Massimiliano Di Penta

机构 * University of Sannio(萨尼奥大学) Smart Shaped s.r.l.(Smart Shaped有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AIGen,一种基于MLflow框架、结合挖掘启发式方法与大语言模型的模块化AIBoM生成器,可生成符合SPDX 3.0标准的AI构件清单,助力AI供应链治理合规。

Journal ref 41st IEEE/ACM International Conference on Automated Software Engineering (ASE26) Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 70%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 70%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26307 2026-07-30 cs.AI cs.SE 新提交 70%

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

TraceCoder:基于位置键代码片段版本控制的可解释可审计代码生成

Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TraceCoder通过三种机制实现可解释可审计代码生成,在30项算法编程任务上Mean Chg%达30%,使自动代码生成的内部叙事可审计复现,保障生产部署的信任与问责。

Comments Submitted Version (version submitted on May deadline to AGENTICS 2026). Version of Record to appear in AGENTICS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26221 2026-07-30 cs.CL 新提交 70%

Characterizing Human-Likeness in AI Generated Poetry: A Zero-shot Classification Study

AI生成诗歌的类人特性表征:一项零样本分类研究

A. N. Biswas, T. Tabassum, A. A. Shohid, R. M. Mou, A. A. Esha, F. Sadeque, A. Ahmed

机构 * BRAC University(BRAC大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出零样本检测流水线,结合人类与AI诗歌数据集,推导影响诗歌分类及误分类的属性,为诗歌可区分性主张提供证据,同时减少训练需求并强化GenAI检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26200 2026-07-30 cs.CL 新提交 70%

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

机构 * Microsoft Responsible AI(微软负责任人工智能部门) Goodfire(古德法尔公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24758 2026-07-30 cs.AI 版本更新 70%

Do Models Fake Alignment Without Clear Consequences?

模型是否会在没有明确后果的情况下假装对齐?

Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。

Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30555 2026-07-30 cs.AI cs.MA 版本更新 70%

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

语言防火墙:多智能体系统路由中的几何防御

Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

机构 * Dvir Alsheich Adar Peleg Ben Hagag Rom Himelstein Amit Levi Avi Mendelson

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ANTAP架构,通过主动能力测试替代间接代理,将性能蒸馏为语义空间中的行为算子,实现非文本代数投影路由,有效防御描述注入和嵌入攻击。

Comments 8 pages (9 more for appendix), 3 figures. Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24894 2026-07-30 cs.DL cs.AI 版本更新 70%

RWGBench: Evaluating Scholarly Positioning in Related Work Generation

RWGBench:评估相关工作生成中的学术定位

Anzhe Xie, Weihang Su, Jiaxin Mao, Yiqun Liu, Min Zhang, Shaoping Ma, Qingyao Ai

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有相关工作生成评估依赖文本相似度、忽略学术定位的问题,提出RWGBench基准,从引用决策角度评估引用选择、上下文适当性、组织和话语,揭示标准评估掩盖的系统性局限。

Comments 10 pages, code and data available at https://github.com/BFTree/RWGBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18600 2026-07-30 cs.LG 版本更新 70%

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

MapTab: MLLMs 是否已准备好在异构图中进行多标准路线规划?

Ziqiao Shang, Ling-Yue Ge, Zian Xu, Zi-Jian Cheng, Shi-Yu Tian, Zhenyu Huang, Wenbo Fu, Weiming Wu, Yang Chen, Xiangwen Zhang, Yulan Hu, Bin Liu, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MapTab基准测试,用于评估多模态大语言模型在多标准路线规划任务中的综合推理能力,发现当前模型在多模态推理方面存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22768 2026-07-30 cs.CL 版本更新 70%

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

ML2B:评估大语言模型跨语言ML流水线生成能力的基准

Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

机构 * HSE University(俄罗斯伏尔加格勒国立大学) Constructor University(Constructor大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ML2B是首个评估大语言模型跨语言ML流水线生成能力的基准,含多领域多语言任务,实验发现跨语言性能退化高度依赖任务,挑战了传统多语言模型能力假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26843 2026-07-30 cs.SE 新提交 67%

When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations

当知识发生变化时:面向RAG系统的变异体态测试

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26083 2026-07-30 cs.SE 新提交 67%

Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms

跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度

Shiqi Cheng, Evelyne Ringoot, Rabab Alomairy, Alan Edelman

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13431 2026-07-30 cs.SD 版本更新 67%

Text2Score: Generating Sheet Music From Textual Prompts

Text2Score:从文本提示生成乐谱

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy, Francesca Ronchini, Emmanouil Benetos, Dorien Herremans, Simon Colton

机构 * Queen Mary University of London(伦敦女王学院) Singapore University of Technology and Design(新加坡科技设计大学) Politecnico di Milano(米兰理工大学) EmotionWave(情绪波)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。

Comments 9 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏