arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 730 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 730 篇

2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 57%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02935 2026-08-05 cs.CL 新提交 57%

Character Iconicity vs. Arbitrariness: An Arabic NLP Perspective

字符象似性与任意性:阿拉伯语自然语言处理视角

Dorieh Alomari, Irfan Ahmad, Maged S. Al-shaibani

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本研究从NLP视角探究阿拉伯语字符形式-功能关系,对比加点、无点及随机重映射的阿拉伯语,发现随机重映射可在降本减存的同时保持良好性能,表明阿拉伯语字符形式-功能关系具任意性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01793 2026-08-04 cs.LG 新提交 57%

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD:用于基于能量的异常检测的整流流预处理

Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 该研究针对统一异常检测中高维token空间EBM训练不稳定问题,提出ReFP-AD方法,经实验在MVTec-AD和VisA数据集上取得优于基线的异常检测性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01414 2026-08-04 cs.AI cs.CR 新提交 57%

No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

无单一失效神经元:针对白盒攻击的分布式安全对齐

Simiao Xie, Chuancheng Shi, Shangze Li, Wenhua Wu, Fei Shen, Ying Zhou, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 57%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00284 2026-08-04 cs.RO cs.AI 新提交 57%

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

基于富有表现力的机器人头部的自适应人机交互混合注意力估计流程

Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

机构 * Technological University of Uruguay(乌拉圭科技大学) Ostfalia University of Applied Sciences(奥斯特法利亚应用科技大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究提出结合几何与语义感知层的混合注意力估计流程,通过有限状态机调节自适应人机交互,经10人40次试验验证其交互启动可靠、暂停行为一致且输出信息非冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29585 2026-08-03 cs.CL 新提交 57%

Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

谄媚行为破坏合作型视觉-语言任务中的认知警觉性

Rupak Sarkar, Neha Srikanth, Saloni Gupta, Claire Bonial, Philip Resnik, Rachel Rudinger

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究针对合作型视觉-语言任务,提出信息不对称的“找不同”任务,发现模型存在谄媚行为破坏认知警觉性的问题,通过学习向量调整模型可减少此类错误,提升模型可靠性。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26391 2026-07-30 cs.LG q-bio.BM 新提交 57%

Q-Steer: Action-Value Guidance for Molecular Policy Optimization

Q-Steer:分子策略优化的动作值引导

Xinyu Wang, Jinbo Bi, Minghu Song

机构 * University of Connecticut(康涅狄格大学) Institute of Health and Medicine, Hefei Comprehensive National Science Center(合肥综合性国家科学中心健康与医学技术研究所)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 Q-Steer 是一种用于分子语言模型的生成时动作值引导原语,通过 PAVS-Q 评分器在固定在线 oracle 预算下提升分子优化性能,在所有测试组合中均取得正增益。

Comments 20 pages, 2 figures, and 25 tables. Includes supplementary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26375 2026-07-30 cs.CL cs.HC 新提交 57%

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

(非)配对编程:编码智能体提升生产力但损害理解能力

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 其他LLM :prompting(abstract);分类 cs.CL

AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24781 2026-07-29 cs.IR cs.AI 新提交 57%

Three Sides of Retrieval: Factorial Evidence for Document-Side, Query-Side, and Answer-Side Complementarity in RAG

检索的三个方面:RAG中文档侧、查询侧和答案侧互补性的因子证据

Ng S. T. Chong

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 研究RAG系统中检索问题,提出目录引导的页面检索新算法,通过实验发现该算法对答案质量有显著影响,与答案侧验证结合优于查询侧分解+验证,证明文档、查询、答案侧增强互补,且默认设置接近最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24187 2026-07-28 cs.AI 新提交 57%

Myopia Prevention and Control 3.0: Artificial Intelligence--Driven Risk Stratification, Proactive Monitoring, and Personalized Intervention

近视防控3.0:人工智能驱动的风险分层、主动监测和个性化干预

Tieniu Wang, Cangzhu Huang, Qianhui Li

机构 * Shanghai Nile Intelligent Technology Co., Ltd.(上海尼罗智能科技有限公司) Beijing Tanyuan Academy of Intelligent Sensing(北京潭渊智能传感研究院)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 研究借助人工智能、数字传感等技术推动近视防控从被动变主动精准模式。通过多模态数据机器学习预测风险、可穿戴等监测及个性化干预形成闭环。评估各阶段证据,讨论相关挑战并给出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23845 2026-07-28 cs.AI 新提交 57%

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

视觉特征能否改善他人发起的修复检测?一种二元多模态方法

Anh Ngo, Nicolas Rollet, Catherine Pelachaud, Chloé Clavel

机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分院) ISIR, Sorbonne University Paris(巴黎索邦大学信息学、系统与机器人研究所) Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS Paris(巴黎电信学院、巴黎高等理工学院SES系、巴黎综合理工学院I3 - 法国国家科学研究中心) CNRS(法国国家科学研究中心) LTCI, Institut Polytechnique de Paris(巴黎综合理工学院LTCI实验室)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 研究他人发起的修复检测问题,提出结合视觉特征的二元多模态模型,通过在两个语料库上评估,证明视觉信息能提升检测性能,提供跨模态特征贡献见解。

Comments Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23676 2026-07-28 cs.AI 新提交 57%

SpecAHD: Localize to Specialize for Automated Heuristic Design in Large-Scale Routing Problems

SpecAHD:在大规模路由问题中定位以专门化自动启发式设计

Kezhao Lai, Yutao Lai, Hai-Lin Liu

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 针对大规模路由问题,提出耦合双层框架SpecAHD,上层搜索确定修复区域,下层为修复任务开发启发式方法,目标具单调次模性可贪婪选择,实验表明其相比基线大幅降低成本,性能更优。

Comments 9 pages, 1 figure, and 3 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22534 2026-07-27 cs.CV cs.AI cs.RO 新提交 57%

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

SM4RT:学习用于4D重建的结构化运动几何

Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, Yuqi Wu, Jie Zhou, Jiwen Lu

机构 * Intelligent Vision Group, Tsinghua University(清华大学智能视觉组)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 针对将单目3D重建能力扩展到4D动态理解的挑战,提出SM4RT,通过引入运动结构表示场景动态,利用并行运动几何编码器和解码器,从单目RGB视频中联合推断相关信息,实现强大运动重建性能并保留场景运动几何结构。

Comments Code is available at: https://github.com/wzzheng/SM4RT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 57%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 57%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16214 2026-07-21 cs.CV cs.AI 新提交 57%

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?

是什么让语言表征成为人类大脑中高级视觉感知的良好模型?

Anna Bavaresco, Ina Klarić, Raquel Fernández, Marie-Francine Moens

机构 * European Commission, Joint Research Centre (JRC)(欧盟委员会,联合研究中心 (JRC))

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 研究语言模型图像描述对人类大脑高级视觉感知的预测性,考虑六种字幕类型和五种语言模型,发现机器生成字幕表现优,文本嵌入器优于自回归语言模型,大脑预测性和行为一致性在中间网络深度达峰值,确立字幕嵌入为研究工具。

Comments Supplementary Materials in the public GitHub repository referenced in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17388 2026-07-21 math.FA cs.AI 新提交 57%

Mathematical Discovery in the Wild: AI-Guided Proofs in Banach Space Theory

野生环境中的数学发现:巴拿赫空间理论中的人工智能引导证明

Antonio Acuaviva, Pablo Acuaviva

机构 * School of Mathematical Sciences, Fylde College, Lancaster University, LA1 4YF, United Kingdom(数学科学学院,兰卡斯特大学) Institute of Computer Science, University of Bern, Neubrückstrasse 10, 3012 Bern, Switzerland(计算机科学研究所,伯尔尼大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 研究当前语言模型对数学研究的贡献,在巴拿赫空间理论中,AI系统生成关键思想和证明,经人类验证完善,还开发自动化系统搜索开放问题并尝试解决,展现了语言模型潜力与专家验证的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14580 2026-07-17 cs.CV cs.LG 新提交 57%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 其他LLM :LLM(abstract);分类 cs.LG

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14575 2026-07-17 cs.CY cs.CL 新提交 57%

Penny: Transition Network Analysis of Learner-Chatbot Interactions in Scaffolded EFL Writing

佩妮:支架式外语写作中学习者与聊天机器人交互的转换网络分析

Steve Woollaston, Brendan Flanagan, Yuko Toyokawa, Hiroaki Ogata

机构 * Academic Center for Computing and Media Studies, Kyoto University, Japan(京都大学计算与媒体研究室) College of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程学院)

专题命中 其他LLM :LLM(abstract);分类 cs.CL

AI总结 研究借助转换网络分析,以日本外语学习者与写作聊天机器人“佩妮”的交互为对象,发现两个行为循环,揭示外语水平对交互的显著影响,表明人工智能辅助写作是对话过程,强调需差异化设计聊天机器人以促进学习者认知参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14491 2026-07-17 cs.SI cs.CL 新提交 57%

Manufactured Divisiveness: Decomposing the Hostile Content of Seven Social Media Influence Operations

人为制造的分裂:剖析七种社交媒体影响行动中的恶意内容

Emilio Ferrara

机构 * Department of Computer Science University of Southern California(计算机科学系 美国南加州大学)

专题命中 其他LLM :LLM(abstract);分类 cs.CL

AI总结 研究推特中七种政府认定活动推文里的恶意内容,通过双提示大语言模型检测器和可审计规则区分仇恨与其他分裂形式,发现将所有相关内容计为仇恨会高估,有助于重新定义影响活动及在线话语中仇恨的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12823 2026-07-15 cs.AI 新提交 57%

Human-AI Agent Interaction as a Neuroplastic Training Environment

作为神经可塑性训练环境的人类与人工智能代理交互

Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd

机构 * Old Dominion University(奥多明尼昂大学) AI Motion Labs(人工智能运动实验室) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Accenture Technology Labs(埃森哲技术实验室) GSI Scandinavia AB(GSI斯堪的纳维亚公司) Lithuanian University of Health Sciences(立陶宛健康科学大学) Department of Psychiatry and Neurobehavioral Sciences, University of Virginia School of Medicine(弗吉尼亚大学医学院精神病学和神经行为科学系) Blanchfield Army Community Hospital(布兰奇菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 研究人类与AI代理交互这一日常活动,发现其是神经可塑性训练环境。提出利用此环境产生相反效果的框架,通过三层观察和两种应用模式实现,以生成图像提示为例展示该框架能使观察与否行为相同但神经学相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10593 2026-07-14 cs.LG 新提交 57%

AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating

AutoNorm:通过可微门控理解Transformer中的自适应归一化

Piyush Kaushik Bhattacharyya, Divyanshu Rai, Swastik Singh, Kumar Aakash, Ayush Ranjan, Krutika Verma

机构 * KIIT(卡林加工业技术学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 研究Transformer中归一化策略选择问题,通过实验发现不同任务中静态与自适应归一化的表现差异,提出AutoNorm-S训练策略,通过门控冻结计划减轻优化不稳定性,在多基准测试中取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10508 2026-07-14 cs.DB cs.AI 新提交 57%

Confining Nondeterminism: AI-Driven Research Systems as DBMSs for Reliable, Non-Wasteful, Transparent, and Collaborative Research [Vision]

限制非确定性:作为数据库管理系统的人工智能驱动研究系统,实现可靠、无浪费、透明和协作式研究 [愿景]

Kyoungmin Kim, Anastasia Ailamaki

机构 * EPFL(瑞士联邦理工学院)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 研究指出大语言模型代理在研究中存在不可信问题,根源是代理循环的随机调用无法检查内部状态。借鉴数据库经验,建议用确定性带版本的数据流引擎组织研究项目,大语言模型作查询编译器,五条设计规则确保研究可靠、透明且协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 57%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08652 2026-07-10 cs.AI 新提交 57%

Formal Mechanisms for Market Stability in Self-Interested Agent Societies: A Marketplace Simulation Study

自利代理社会中市场稳定性的形式机制:市场模拟研究

Eugene Ng Yi Sheng, Bingquan Shen

机构 * DSO National Laboratories(国防科技研究院) National University of Singapore(新加坡国立大学)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 研究自利代理社会中市场稳定性的形式机制,通过多智能体市场模拟实验,比较八种机制,发现调解机制最佳,对其进行对抗性红队测试,结果表明该机制具有对抗鲁棒性,能在攻击下维持市场稳定。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07521 2026-07-09 cs.HC cs.AI 新提交 57%

Creativity from Friction: Human-AI Interaction for Exploratory Structural Design

摩擦产生创造力:用于探索性结构设计的人机交互

Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady

机构 * Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院) IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 探讨当前生成式AI目标与结构设计师等创作者需求的偏差,提出允许受限人机共同创作的系统设计维度,通过试点设计界面和专家研究,展示其对设计空间探索的支持及设计师看法。

Comments Accepted at ICML 2026, Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05999 2026-07-08 cs.AI 新提交 57%

AgoraSim: A Hybrid Agent-Based Modeling Framework

AgoraSim:一个基于混合智能体的建模框架

Chung-Chi Chen

机构 * Human-Agent Ally Lab (HAA Lab)(人机协作实验室(HAA实验室)) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 针对大语言模型智能体模拟输出易被过度解读及难与社会动态比较的问题,提出AgoraSim框架,能将文本等解析为可编辑配置,运行混合智能体群体并比较场景,通过多种接口公开,助用户检查轨迹、比较假设及识别需验证的案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05769 2026-07-08 cs.CV cs.AI 新提交 57%

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

LEGATO 2:迈向多模态乐谱识别与理解

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 LEGATO 2提出从乐谱图像提取符号与语义知识的新流程,结合系统级分割和自回归视觉语言模型,能生成含文本的符号转录,在多数据集上优于现有技术,还能补充语言模型视觉输入,提升乐谱理解水平。

Comments 23 pages. Equal contribution: Guang Yang and Brian Siyuan Zheng

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05666 2026-07-08 cs.SE cs.AI 新提交 57%

What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests

人工智能代理实际改变了什么?性能改进拉取请求中突变模式的实证分类法

Illia Dovhoshliubnyi, Nima Soroush, Ashkan Sami, Alexander Brownlee

机构 * Edinburgh Napier University(爱丁堡纳皮尔大学) University of Stirling(斯特林大学)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 研究聚焦人工智能编码代理这一黑箱,通过对33596个代理拉取请求中1254个性能相关差异块进行分类,发现主导的三类突变模式,揭示代理身份和目标策略对缩小基于搜索的软件工程操作空间有参考价值。

详情

展开后加载摘要…

URL PDF HTML 收藏