arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 273 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 74 篇

2604.15859 2026-04-20 cs.LG cs.AI 90%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI 89%

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15460 2026-04-20 cs.HC cs.AI 89%

The Crutch or the Ceiling? How Different Generations of LLMs Shape EFL Student Writings

支点还是天花板?不同世代的LLM如何塑造EFL学生的写作

Hengky Susanto, David James Woo, Chingyi Yeung, Stephanie Wing Yan Lo-Philip, Chi Ho Yeung

机构 * Education University of Hong Kong(教育大学(香港)) Everwrite Limited(Everwrite有限公司) International Christian School(国际基督教学校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨LLM在辅助EFL学生写作中的作用及局限,发现高级LLM虽提升评分和词汇多样性,但可能掩盖真实能力,建议教学应关注学习过程而非仅输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25897 2026-04-20 cs.CL cs.AI cs.CY 88%

RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity

RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准

Jisu Shin, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15368 2026-04-20 cs.CR 88%

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

LogJack:通过云日志间接提示注入攻击大语言模型调试代理

Harsh Shah

专题命中 评测与基准 :LLM(title,summary_cn);foundation model(abstract)

AI总结 研究通过云日志内容对LLM调试代理进行间接提示注入攻击,提出LogJack基准测试集,并评估8个基础模型在不同提示条件下的表现,发现部分模型在主动条件下可执行命令,而防护措施大多失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 88%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 88%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15001 2026-04-20 cs.AI 87%

COEVO: Co-Evolutionary Framework for Joint Functional Correctness and PPA Optimization in LLM-Based RTL Generation

COEVO:用于LLM基于RTL生成中功能正确性与PPA优化的联合进化框架

Heng Ping, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Shukai Duan, Xiaole Zhang, Paul Bogdan

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出COEVO框架,通过联合优化功能正确性与PPA,在单个进化循环中统一两者目标,提升RTL生成效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15329 2026-04-20 cs.HC cs.AI cs.CL 87%

Evaluating LLMs as Human Surrogates in Controlled Experiments

评估LLMs在受控实验中作为人类替代品的效用

Adnan Hoq, Tim Weninger

机构 * University of Notre Dame(诺特达姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较LLM生成数据与人类数据,探讨在准确性感知实验中LLM能否作为人类替代品,发现LLM能复现部分人类效应,但效果大小和调节模式因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16115 2026-04-20 cs.CV 87%

From Articles to Canopies: Knowledge-Driven Pseudo-Labelling for Tree Species Classification using LLM Experts

从文章到树冠:基于知识的伪标注用于利用LLM专家的树种分类

Michał Romaszewski, Dominik Kopeć, Michał Cholewa, Katarzyna Kołodziej, Przemysław Głomb, Jan Niedzielko, Jakub Charyton, Justyna Wylazłowska, Anna Jarocińska

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所) University of Lodz(卢布林大学) University of Warsaw, Faculty of Geography and Regional Studies, Department of Geoinformatics, Cartography and Remote Sensing(华沙大学地理与区域研究学院,地理信息学、制图与遥感系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合多传感器地球观测数据和生态知识的半监督深度学习方法,通过生物启发的伪标注提升树种分类精度,实验显示比最佳参考方法提升5.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 86%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19312 2026-04-20 cs.LG cs.AI cs.CL cs.HC stat.ML 86%

FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users

FSPO:少样本优化合成偏好以个性化真实用户

Anikait Singh, Sheryl Hsu, Kyle Hsu, Eric Mitchell, Stefano Ermon, Tatsunori Hashimoto, Archit Sharma, Chelsea Finn

机构 * Stanford University(斯坦福大学) OpenAI Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。

Comments Website: https://fewshot-preference-optimization.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16270 2026-04-20 cs.CL cs.AI 85%

From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

从基准测试到推理:一个双视角、大规模评估LLMs在越南法律文本上的表现

Van-Truong Le

机构 * University of Science, VNUHCM(越南国家大学科学大学) Vietnam National University(越南国家大学) Hanoi Open University(河内开放大学) Ho Chi Minh, Vietnam(胡志明市,越南)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双视角评估框架,评估四种LLM在越南法律文本的准确性、可读性和一致性,发现Grok-1在可读性和一致性上表现优异但法律准确性不足,而Claude 3 Opus高准确性掩盖了推理错误,揭示当前LLM在法律推理上的核心挑战。

Comments 7 pages, 2 figures. Accepted at the FISU Joint Conference on Artificial Intelligence (FJCAI 2026), Vietnam

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20689 2026-04-20 cs.AI cs.CL 85%

WiseMind: a knowledge-guided multi-agent framework for accurate and empathetic psychiatric diagnosis

WiseMind: 一种基于知识的多智能体框架,用于准确且富有同理心的精神病诊断

Yuqi Wu, Guangya Wan, Jingjing Li, Shengming Zhao, Lingfeng Ma, Tianyi Ye, Ion Pop, Yanbo Zhang, Jie Chen

机构 * College of Biomedical Engineering(生物医学工程学院) Fudan University(复旦大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Alberta(阿尔伯塔大学) University of Virginia(弗吉尼亚大学) McIntire School of Commerce(麦金尼商学院) School of Data Science(数据科学学院) Department of Psychiatry(精神病学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 WiseMind通过整合理性与情感智能体,结合DSM-5知识图谱,提升了精神病诊断的准确性与同理心,其在1206次模拟对话和180次真实交互中达到85.6%的诊断准确率,超越了单智能体方法。

Comments Accepted at npj Digital Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16241 2026-04-20 cs.CL cs.AI 84%

BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

BAGEL:语言模型中动物知识专精的基准测试

Jiacheng Shen, Masato Hagiwara, Milad Alizadeh, Ellen Gilsenan-McMahon, Marius Miron, David Robinson, Emmanuel Chemla, Sara Keen, Gagan Narula, Mathieu Laurière, Matthieu Geist, Olivier Pietquin

机构 * Earth Species Project(地球物种项目) NYU Center for Data Science(纽约大学数据科学中心;纽约大学上海) NYU Shanghai(纽约大学上海数据科学中心;纽约大学-复旦大学数学科学研究所) NYU Shanghai Center for Data Science NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 BAGEL基准测试评估语言模型在动物知识方面的专精能力,结合多个来源生成封闭式问题对,涵盖分类学、形态学、栖息地等多个方面,旨在提升语言模型在生物多样性应用中的可靠性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 83%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15547 2026-04-20 cs.CL cs.AI 82%

Consistency Analysis of Sentiment Predictions using Syntactic & Semantic Context Assessment Summarization (SSAS)

基于语法与语义上下文评估总结的语义一致性分析

Sharookh Daruwalla, Nitin Mayande, Shreeya Verma Kathuria, Nitin Joglekar, Charles Weber

机构 * Tellagence Inc.(Tellagence公司) Villanova School of Business, Villanova University(维拉文纳大学商学院) Maseeh College of Engineering and Computer Science, Portland State University(波特兰州立大学Maseeh工程与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSAS框架,通过上下文评估提升情感预测的一致性,实验表明其能有效提高数据质量,减少噪声和分析方差。

Comments 27 pages, 2 figures. arXiv admin note: text overlap with arXiv:2604.12049

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 82%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05638 2026-04-20 cs.CV 82%

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

SurgMotion: 一种用于外科视频通用理解的视频原生基础模型

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei

机构 * Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑) Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国) Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 SurgMotion通过引入视频原生基础模型,将学习范式从像素级重建转向潜在运动预测,通过三种关键技术改进提升外科视频理解能力,实验表明其在手术流程识别、动作三元组识别和技能评估等任务中均取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15549 2026-04-20 cs.CL 81%

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

WildFeedback: 对齐大语言模型与实时用户交互与反馈

Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

机构 * Microsoft Corporation(微软公司) Purdue University(普渡大学) Texas A&M University(德克萨斯农工大学) University of California San Diego(加州大学圣地亚哥分校) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。

Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15827 2026-04-20 cs.IR cs.CL 81%

UsefulBench: Towards Decision-Useful Information as a Target for Information Retrieval

UsefulBench: 向信息检索的目标——决策有用的信息

Tobias Schimanski, Stefanie Lewandowski, Christian Woerle, Nicola Reichenau, Yauheni Huryn, Markus Leippold

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) score4more GmbH(score4more公司) Climate+Tech Think Tank(Climate+Tech智库) Swiss Finance Institute (SFI)(瑞士金融研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出UsefulBench,通过专业标注区分信息相关性与实用性,揭示传统相似性检索与LLM在领域问题中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15760 2026-04-20 cs.AI cs.GT 81%

KWBench: Measuring Unprompted Problem Recognition in Knowledge Work

KWBench:测量知识工作中无提示的问题识别

Ankit Maloo

机构 * Clio AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KWBench是首个评估大语言模型无提示问题识别能力的基准,通过223个专业任务测试模型能否从原始输入中识别情境结构,揭示模型在问题识别与应用间的差异。

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15709 2026-04-20 cs.AI 81%

Bilevel Optimization of Agent Skills via Monte Carlo Tree Search

通过蒙特卡洛树搜索优化代理技能

Chenyi Huang, Haoting Zhang, Jingxu Xu, Zeyu Zheng, Yunduan Lin

机构 * Department of Mathematics(数学系) National University of Singapore(国立新加坡大学) Department of Industrial Engineering and Operations Research(工业工程与运营管理系) University of California at Berkeley(加州大学伯克利分校) Department of Decision, Operation and Technology(决策、运营与技术系) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过蒙特卡洛树搜索优化代理技能的双层优化框架,提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10262 2026-04-20 cs.CL cs.AI eess.AS 81%

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

MTR-DuplexBench:面向全双工语音语言模型多轮对话全面评估的综合评测

He Zhang, Wenqian Cui, Haoning Xu, Xiaohui Li, Lei Zhu, Haoli Bai, Shaohua Ma, Irwin King

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MTR-DuplexBench,用于评估全双工语音语言模型在多轮对话中的表现,涵盖对话质量、指令遵循和安全性等关键方面,揭示现有模型在多轮对话中的一致性问题。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16128 2026-04-20 cs.CR 80%

PolicyGapper: Automated Detection of Inconsistencies Between Google Play Data Safety Sections and Privacy Policies Using LLMs

PolicyGapper:利用LLMs自动检测Google Play数据安全部分与隐私政策之间的不一致之处

Luca Ferrari, Billel Habbati, Meriem Guerar, Mariano Ceccato, Luca Verderame

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出PolicyGapper,一种基于LLM的方法,用于自动检测Google Play数据安全部分与隐私政策之间的不一致之处,通过四个阶段处理330款应用,发现2689处遗漏披露,验证精度达75%。

Comments Submitted for consideration to the Journal of Information Security and Applications (JISA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03056 2026-04-20 cs.CL cs.AI cs.LG 80%

Reading Between the Lines: The One-Sided Conversation Problem

在话语之间阅读:单侧对话问题

Victoria Ebert, Rishabh Singh, Tuochao Chen, Noah A. Smith, Shyamnath Gollakota

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Allen Institute for Artificial Intelligence(阿伦人工智能研究所) Hearvana AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出单侧对话问题,研究如何从单侧对话中重建缺失发言和生成摘要,发现未来发言和发言长度信息有助于重建,而高质量摘要无需重建。

Comments 8 pages, 6 figures, 4 tables. Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15332 2026-04-20 cs.HC cs.AI cs.CV cs.SE 79%

Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts

利用视觉-语言模型自动化生成碰撞图:多车道环形交叉口的案例研究

Xiao Lu, Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab, College of Engineering University of Georgia Athens(智能移动与基础设施实验室,工程学院,佐治亚大学亚特兰大分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究利用视觉-语言模型自动化生成碰撞图,针对多车道环形交叉口这一挑战性案例,提出三步提示框架和10项评估指标,发现GPT-4o在空间推理和数据对齐方面表现最佳,为生成式AI在工程可视化中的应用奠定基础。

Comments 16 pages, 5 figures, 3 tables

Journal ref Applied Computing and Intelligence, 2026, 6(1): 38-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05552 2026-04-20 cs.CL cs.AI 79%

Context-Agent: Dynamic Discourse Trees for Non-Linear Dialogue

上下文代理:非线性对话的动态 discourse 树

Junan Hu, Shudan Guo, Wenqi Liu, Jianhua Yin, Yinwei Wei

机构 * Shandong University(山东大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 Context-Agent 框架,通过动态树结构建模对话历史,解决非线性对话中的上下文管理问题,并引入 NTM 评估基准,提升多轮对话任务完成率和效率。

Comments 14 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15849 2026-04-20 cs.SD 78%

TinyMU: A Compact Audio-Language Model for Music Understanding

TinyMU:一种用于音乐理解的紧凑音频-语言模型

Xiquan Li, Aurian Quelennec, Slim Essid

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI, Télécom Paris, Institut Polytechnique de Paris) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出TinyMU,一种轻量级音乐语言模型,通过MusicSkills-3.5M数据集训练,实现与大规模LALMs相当的性能,同时保持高效紧凑,适用于边缘设备。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09371 2026-04-20 eess.AS 78%

Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models

基于语言模型的多音轨音乐源分离的离散标记建模

Pengbo Lyu, Xiangyu Zhao, Chengwei Liu, Haoyin Yan, Xiaotao Liang, Hongyu Wang, Shaofei Xue

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出一种生成框架,将多轨音乐源分离任务转化为条件离散标记生成问题,结合Conformer编码器、双路径音频编解码器和语言模型,实现音频标记的自回归生成,提升语音轨的NISQA评分。

Comments 5 pages, 2 figures, 3 tables. Submitted to INTERSPEECH 2026. Demo page: https://anonymous.4open.science/w/mss-demo-page-2F80/

详情

展开后加载摘要…

URL PDF HTML 收藏