arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-27 至 2026-03-27 共收录 46 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 46 篇

2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 90%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24846 2026-03-27 cs.CV cs.AI cs.LG 90%

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

NeuroVLM-Bench:评估用于神经系统疾病临床推理的视觉增强大语言模型

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika Simjanoska Misheva, Kostadin Mishev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了视觉增强大语言模型在神经疾病临床推理中的性能,通过多模态模型在MRI和CT数据集上进行基准测试,发现影像属性基本解决,但诊断推理仍具挑战性。

Comments 53 pages, 12 figures. Manuscript submitted to the BMC Medical Informatics and Decision Making journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 89%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25674 2026-03-27 cs.CL cs.AI cs.CY 86%

Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors

衡量重要性——或者便利性?:基于LLM的评分系统对无关因素的鲁棒性

Cole Walsh, Rodica Ivan

机构 * Acuity Insights Inc.(Acuity Insights公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于LLM的评分系统在面对无关因素时的鲁棒性,发现其在处理无意义填充文本、拼写错误等时表现稳健,但对偏离主题的回答惩罚较重,为未来设计更相关的LLM评分系统提供了支持。

Comments Shortened version of this paper accepted to AIED 2026; experiment 3 was omitted from accepted paper due to space restrictions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24943 2026-03-27 cs.AI cs.CL 86%

FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol

FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试

Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin Zhang, Lifan Guo, Feng Chen, Yong Liu, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) YINGMI Wealth Management(盈米财富管理) Soochow University(苏州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI 85%

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25176 2026-03-27 cs.CL 85%

Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models

基于LLM-as-a-Judge和混合模型的提示攻击检测

Hieu Xuan Le, Benjamin Goh, Quy Anh Tang

机构 * GovTech, Singapore(新加坡政府科技局)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨轻量级通用LLM在真实生产环境中作为安全判断者的可靠性,通过结构化推理过程检测提示攻击,实验表明Gemini-2.0-Flash-Lite-001等模型可有效用于实时防护,同时评估混合模型对攻击检测的提升效果。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02606 2026-03-27 cs.SI cs.AI cs.CY 85%

Gender Dynamics and Homophily in a Social Network of LLM Agents

社交网络中LLM代理的性别动态与同性倾向

Faezeh Fadaei, Jenny Carla Moran, Taha Yasseri

机构 * School of Mathematics and Statistics, University College Dublin(都柏林大学数学与统计学院) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin and Technological University Dublin(人类与机器社会学中心(SOHAM),都柏林圣三一学院与都柏林理工大学) Trinity Long Room Hub, Trinity College Dublin(都柏林圣三一学院长厅中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM代理在社交网络中的性别表现动态及同性倾向,发现尽管个体性别表现随时间变化,网络仍表现出强性别同质性,揭示文化影响下的性别排序机制。

Comments Under Review

Journal ref Philosophical Transactions A. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25092 2026-03-27 cs.IR 85%

AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation

AuthorityBench: 评估LLM权威感知以实现可靠的检索增强生成

Zhihui Yao, Hengran Zhang, Keping Bi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AuthorityBench基准,通过三个数据集评估LLM权威感知能力,发现ListJudge和PairJudge方法与真实权威最相关,且权威感知对检索增强生成的准确性有显著提升。

Comments 11 pages, 4 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11687 2026-03-27 cs.CL cs.AI 84%

SemBench: A Universal Semantic Framework for LLM Evaluation

SemBench:一种通用的语义框架用于LLM评估

Mikel Zubillaga, Naiara Perez, Oscar Sainz, German Rigau

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SemBench通过字典词义定义和句子编码器自动生成合成基准,评估LLM的语义能力,无需人工 curated 例句,实现跨语言、多资源的高效评估。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI 83%

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 82%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25105 2026-03-27 cs.CL 81%

OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs

OMIND:面向心理健康大语言模型的知识引导微调与多轮对话基准框架

Suraj Racha, Prashant Harish Joshi, Utkarsh Maurya, Nitin Yadav, Mridul Sharma, Ananya Kunisetty, Saranya Darisipudi, Nirmal Punjabi, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出OMIND框架,通过结构化知识检索、模型剪枝和人工审核生成高质量多任务SFT数据集,并引入oMind-Chat多轮对话基准,验证了其在核心能力和对话任务上的优越性能。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI 79%

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 79%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25253 2026-03-27 cs.CL cs.AI 79%

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准

Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24066 2026-03-27 hep-ph 78%

OmniLearned: A Foundation Model Framework for All Tasks Involving Jet Physics

OmniLearned:适用于所有涉及喷注物理任务的基础模型框架

Wahid Bhimji, Chris Harris, Vinicius Mikuni, Benjamin Nachman

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出OmniLearned框架,通过改进模型架构、使用超大规模喷注数据集及提供完整软件工具,提升喷注物理任务的发现潜力,展现其在顶夸克喷注标记、底夸克标记和异常检测中的领先性能。

Comments 12 pages, 5 figures

Journal ref Phys.Rev.D 113 (2026) 3, 032020

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 77%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25250 2026-03-27 cs.CV cs.AI cs.LG 76%

Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models

激活至关重要:基于视觉语言模型的测试时激活负标签用于分布外检测

Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 本文提出测试时激活负标签(TANL)方法,通过动态评估激活水平和测试批次内的激活信息,提升分布外检测的性能和鲁棒性,实验表明其在ImageNet基准上显著降低FPR95。

Comments CVPR 2026 main track, Codes are available at https://github.com/YBZh/OpenOOD-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25393 2026-03-27 cs.CR 75%

ALPS: Automated Least-Privilege Enforcement for Securing Serverless Functions

ALPS:用于安全无服务器函数的自动最小特权执行

Changhee Shin, Bom Kim, Seungsoo Lee

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ALPS通过静态分析和大语言模型生成安全策略,有效提升无服务器环境的最小特权执行,实现高覆盖率和性能优化。

Comments Accepted at IEEE INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 74%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25226 2026-03-27 cs.SE cs.AI cs.CL cs.MA 73%

WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing

WebTestBench: 评估面向端到端自动化网页测试的计算机使用代理

Fanheng Kong, Jingyuan Zhang, Yang Yue, Chenxi Sun, Yang Tian, Shi Feng, Xiaocui Yang, Daling Wang, Yu Tian, Jun Du, Wenchong Zeng, Han Li, Kun Gai

机构 * Northeastern University(东北大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WebTestBench基准,用于评估端到端自动化网页测试能力,揭示现有方法在测试完整性、检测瓶颈和长周期交互可靠性方面的不足。

Comments 24 pages, code: https://github.com/friedrichor/WebTestBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI 73%

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 73%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25501 2026-03-27 cs.CL 70%

An Experimental Comparison of the Most Popular Approaches to Fake News Detection

对检测虚假新闻最流行方法的实验比较

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro

机构 * Dipartimento di Ingegneria dell'Informazione, University of Pisa(比萨大学信息工程系) Dipartimento di Informatica, University of Pisa(比萨大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文对比了12种主流虚假新闻检测方法,评估了不同数据集下的分类性能,发现领域内模型表现良好但泛化能力差,跨领域架构和LLM在零样本学习中表现突出。

Journal ref Dell'Oglio, P., Bondielli, A., Marcelloni, F., and Passaro, L. C. (2026). An experimental comparison of the most popular approaches to fake news detection. Information Sciences, Article 123407

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25227 2026-03-27 cs.CL 70%

Comparing Natural and Synthetic Structured Data: A Study of the Passive Verb Alternation in French and Italian

比较自然与合成结构数据:法语和意大利语中被动语动词交替的研究

Giuseppe Samo, Paola Merlo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究比较自然与合成数据对大语言模型训练与评估的影响,探讨法语和意大利语中被动语动词交替的处理能力,发现自然数据训练模型在自然和合成测试中表现更稳健。

Comments 13 pages, 8 figures, paper accepted at the Workshop on Structured Linguistic Data and Evaluation (SLiDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 70%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25146 2026-03-27 cs.SE cs.AI 70%

Factors Influencing the Quality of AI-Generated Code: A Synthesis of Empirical Evidence

影响人工智能生成代码质量的因素:一项经验证据的综合分析

Vehid Geruslu, Zulfiyya Aliyeva, Eray Tüzün

机构 * Queen’s University Belfast(贝尔法斯特女王大学) Azerbaijan Technical University(阿塞拜疆技术大学) MilliSoft MMC Corporation(MilliSoft MMC公司) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究综合现有经验证据,分析影响人工智能生成源代码质量的因素,并探讨这些因素在不同评估情境下的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08371 2026-03-27 cs.CL 70%

ViGoEmotions: A Benchmark Dataset For Fine-grained Emotion Detection on Vietnamese Texts

ViGoEmotions:面向越南语文本细粒度情感检测的基准数据集

Hung Quang Tran, Nam Tien Pham, Son T. Luu, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息科技大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ViGoEmotions数据集,包含20664条越南语社交媒体评论,细粒度情感分类为27种。通过评估不同预处理策略,发现将表情符号转为文本能提升基线模型性能,而保留表情符号对ViSoBERT和CafeBERT效果最佳。

Comments Accepted as main paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11703 2026-03-27 cs.DB cs.AI 70%

A Comprehensive Survey on Vector Database: Storage and Retrieval Technique, Challenge

向量数据库的全面综述:存储与检索技术、挑战

Le Ma, Ran Zhang, Yikun Han, Shirui Yu, Zaitian Wang, Zhiyuan Ning, Jinghan Zhang, Ping Xu, Pengjiang Li, Ziyue Qiao, Wei Ju, Chong Chen, Dongjie Wang, Kunpeng Liu, Pengyang Wang, Pengfei Wang, Yanjie Fu, Chunjiang Liu, Yuanchun Zhou, Chang-Tien Lu

机构 * Sichuan University(四川大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Science Library (Chengdu), Chinese Academy of Sciences(中国科学院成都科学图书馆) University of Chinese Academy of Sciences(中国科学院大学) Portland State University(波特兰州立大学) Great Bay University(大湾大学) Terminus Group(Terminus集团) University of Kansas(堪萨斯大学) University of Macau(澳门大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了向量数据库的核心设计与算法,分析了存储与检索技术的演变,比较了主流架构并探讨了与大语言模型整合的新兴方向,为研究者提供系统参考。

详情

展开后加载摘要…

URL PDF HTML 收藏