arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2601.12164 2026-07-01 cs.CY cs.CL 版本更新 89%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-06-30 cs.CL econ.GN q-fin.EC 89%

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28061 2026-06-29 cs.CR cs.AI 新提交 89%

ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents

ToolPrivacyBench: 对使用工具的LLM代理进行目的绑定隐私基准测试

Shijing Hu, Liang Liu, Zhu Meng, Zhicheng Zhao

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有评估忽略多工具轨迹中目的绑定信息流的问题,提出ToolPrivacyBench基准,通过策略知识库审计工具参数和后端日志,评估任务完成与隐私过度披露,发现成功执行任务可能伴随不必要的隐私泄露。

Comments 24 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21844 2026-06-23 cs.CL cs.CY 新提交 89%

Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

逆图灵基准:评估语言模型作为人类与AI对话的裁判

William Hager, Ishika Rathi, Masum Hasan, Cameron Jones

机构 * University of Rochester(罗切斯特大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);prompting(abstract);分类 cs.CL

AI总结 提出逆图灵基准,评估LLM区分人类与AI多轮对话的能力,发现GPTZero、Claude Opus-4.6和GPT-5.5准确率最高,统计方法有语义盲点而语义方法易受角色提示影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04266 2026-06-19 cs.CL 版本更新 89%

ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents

ShoppingBench:面向LLM智能体的真实世界意图导向购物基准

Jiangyuan Wang, Kejun Xiao, Qi Sun, Huaipeng Zhao, Tao Luo, Jian Dong Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 评测与基准 :LLM(title,title_cn);language agent(abstract);分类 cs.CL

AI总结 提出ShoppingBench基准,包含多层级真实购物意图任务,通过模拟环境和250万商品评估LLM智能体,发现GPT-4.1成功率低于50%,并提出轨迹蒸馏策略提升小模型性能。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11976 2026-06-11 cs.SE cs.AI 新提交 89%

Exploration Structure in LLM Agents for Multi-File Change Localization

LLM代理中的探索结构用于多文件变更定位

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11625 2026-06-11 cs.LG 新提交 89%

TimeRouter: Efficient and Adaptive Routing of Time-Series Foundation Models

TimeRouter: 时间序列基础模型的高效自适应路由

Kanghui Ning, Yushan Jiang, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

机构 * University of Connecticut(康涅狄格大学) Salesforce AI Research JP Morgan AI Research(摩根大通人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.LG

AI总结 提出TimeRouter框架,通过轻量判别路由、选择性门控和集成回退实现时间序列基础模型的自适应选择,无需LLM推理,在GIFT-EVAL榜单取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09979 2026-06-10 cs.CL 版本更新 89%

GhazalBench: Evaluating LLM Understanding and Canonical Surface-Form Access in Persian Ghazals

GhazalBench: 评估大语言模型对波斯抒情诗的理解与规范表层形式访问

Ghazal Kalhor, Yadollah Yaghoobzadeh

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰理工大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GhazalBench基准,评估LLM在波斯抒情诗中的诗意理解与规范表层形式访问能力,发现模型普遍能理解诗意但难以生成精确诗句,而识别任务缩小差距,英语表现更好,表明训练数据差异是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03641 2026-06-03 cs.AI cs.CY 89%

Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Urgency

LLM医疗分诊中的性别依赖性诊断替代:相同症状,不同紧急程度

Qi Han Wong

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型在相同神经症状下,仅因患者性别和年龄不同而产生不同的分诊建议,发现年轻女性被系统性低估紧急程度,机制为诊断替代。

Comments 7 pages, 3 tables. Multi-model replication across Gemini, Claude, and GPT. Code and data: https://github.com/wongqihan/ai-behavioral-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31381 2026-06-03 cs.CL 89%

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

LLM 法官在安全标准和危害类别上不一致地存在分歧

Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij, Isar Nejadgholi

机构 * National Research Council, Canada(加拿大国家研究理事会) IMDA, Singapore(新加坡信息通信技术发展局)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。

Comments 8 pages plus appendices, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02215 2026-06-02 cs.CL cs.SI 89%

Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes

经验更优:用于证据基础健康社区笔记的自进化LLM智能体

Zihang Fu, Fanxiao Li, Jianyang Gu, Haonan Wang, Preslav Nakov, Bryan Hooi, Min-Yen Kan, Jiaying Wu

机构 * National University of Singapore(国立新加坡大学) Yunnan University(云南大学) The Ohio State University(俄亥俄州立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EvoNote框架,通过自进化经验记忆和细粒度信用分配,在健康社区笔记生成中实现证据获取、分析与撰写,显著提升笔记质量并缩短生成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10234 2026-06-02 cs.HC cs.AI 89%

InFerActive: Interactive Tree-Based Exploration of LLM Sampling for Safety Evaluation

InFerActive: 基于交互式树的安全评估中LLM采样探索

Junhyeong Hwangbo, Soohyun Lee, Hyeon Jeon, Kyochul Jang, Minsoo Cheong, Youngjae Yu, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出InFerActive系统,通过广度优先采样构建可导航短语树,提升LLM安全评估中低概率有害输出的覆盖率和效率,相比随机采样减少5倍样本量。

Comments v2: Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30804 2026-06-01 cs.CL 89%

Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit

将LLM性别偏见锚定人类基线:跨语言审计

Jiwoo Choi, Seonwoo Ahn, Tongxin Zhang, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST, South Korea(数字人文与计算社会科学学院,韩国韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过HEXACO-100人格量表,跨英语、韩语、中文和日语审计六种大语言模型的性别刻板印象,发现其偏见幅度是人类跨国差异的2.5倍,并引入四模式框架(一致性、抑制、重组、放大)描述跨语言行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15778 2026-06-01 cs.CL 89%

*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation

*-PLUIE:使用大语言模型改进评估的可个性化度量

Quentin Lemesle, Léane Jourdan, Daisy Munson, Pierre Alain, Jonathan Chevelu, Arnaud Delhay, Damien Lolive

机构 * Univ Rennes, CNRS, IRISA, EXPRESSION(里尔大学、法国国家科学研究中心、IRISA、EXPRESSION) Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N、UMR 6004) Univ Rennes, CNRS, IRISA, SOTERN(里尔大学、法国国家科学研究中心、IRISA、SOTERN) Univ of South Brittany, CNRS, IRISA, ARCHIMEDIA(布列塔尼南部大学、法国国家科学研究中心、IRISA、ARCHIMEDIA)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL

AI总结 提出*-PLUIE,一种基于困惑度的可个性化LLM评判度量,通过任务特定提示变体实现与人类判断的更强相关性,同时保持低计算成本。

Comments Accepted at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29468 2026-05-29 cs.CR cs.AI 89%

SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing

SciIntBench: 衡量大语言模型在对抗性框架下对科研诚信规范的遵从度

Almene De Meran Meguimtsop, Maria Leonor Pacheco, Daniel E. Acuna

机构 * Department of Computer Science University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SciIntBench对抗性基准,通过810个提示评估16个LLM在10个RCR类别中的框架敏感拒绝与帮助行为,发现模型对显性不当行为拒绝可靠,但对隐性违规(尤其是压力驱动的捷径)拒绝不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21739 2026-05-29 cs.AI 89%

AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence

AttuneBench: 基于对话的LLM情商基准测试

Kate M. Lubrano, Faisal Sayed, Ankita Rathod, Akshansh, Craver Corbyn Thomas-Smith, Mark E. Whiting, Karina Nguyen

机构 * Pareto Thoughtful University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出AttuneBench基准,基于200个真实多轮人机对话,评估LLM在情绪识别、行为分类、偏好预测和响应质量等方面的情商能力,发现这些能力相互独立且偏好对齐和响应质量更具区分性。

Comments v2: Updated def_18 and def_20 supplemental figures to cover all 11 evaluated models (previously 9). Removed redundant supplemental figures. Corrected select captions (color descriptions, chance baselines, figure-content mismatches). No changes to experimental results, numerical claims, or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22884 2026-05-29 cs.AI 89%

InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Data Agents

InsightEval:用于评估LLM驱动数据代理洞察发现能力的专家策划基准

Zhenghao Zhu, Yuanfeng Song, Xin Chen, Chengzhong Liu, Yakun Cui, Caleb Chen Cao, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港理工大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有洞察发现基准InsightBench的缺陷,提出数据整理流程构建新基准InsightEval,并引入新指标衡量代理的探索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27210 2026-05-27 quant-ph cs.AI 89%

Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation

Qiskit QuantumKatas: 为LLM评估改编微软的量子计算练习

Juan Cruz-Benito, Ismael Faro

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文将微软的QuantumKatas量子计算课程从Q#移植到Qiskit,并构建评估框架,用于系统评估大型语言模型在量子计算任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23950 2026-05-26 cs.AI cs.SE 89%

Stop Comparing LLM Agents Without Disclosing the Harness

停止比较 LLM Agent 而不公开其执行框架

Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

机构 * Tulane University(Tulane 大学) Rutgers University(Rutgers 大学) Independent Researcher(独立研究者) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文论证在长周期任务中,Agent 执行框架(Harness)比底层模型更能决定性能,并提出框架感知的评估标准与方差分解协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17588 2026-05-19 cs.IR cs.CL 89%

From Isolated Scoring to Collaborative Ranking: A Comparison-Native Framework for LLM-Based Paper Evaluation

从孤立评分到协作排名:一种基于LLM的论文评估比较原生框架

Pujun Zheng, Jiacheng Yao, Jinquan Zheng, Chenyang Gu, Guoxiu He, Jiawei Liu, Yong Huang, Tianrui Guo, Wei Lu

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院) School of Information Management, Wuhan University(武汉大学信息管理学院) China Academic Degrees & Graduate Education Development Center(中国学位与研究生教育发展中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CNPE框架,通过整合比较机制于数据构建和模型学习,提升论文评估的相对质量判断,实验显示比DeepReview-14B平均提升21.8%。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08556 2026-05-12 cs.LG 89%

Can Revealed Preferences Clarify LLM Alignment and Steering?

揭示偏好能否澄清大语言模型对齐与引导?

Khurram Yamin, Jingjing Tang, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出一种经验方法,通过估计LLM在决策任务中的隐含偏好,评估模型是否一致地追求目标,是否能描述其目标,以及提示是否能可靠引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 89%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 89%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract)

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01292 2026-05-05 cs.CL 89%

Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach

缓解孟加拉语虚假新闻检测中的数据稀缺问题:一种基于大语言模型的数据集增强方法

Ahmed Alfey Sani, Kazi Akib Zaoad, Shefayat E Shams Adib, Md Abdul Muqtadir, Ajwad Abrar

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于大语言模型的数据集增强框架,通过生成合成新闻文章提升孟加拉语虚假新闻分类性能,实验表明高增益率随机采样可将F1分数提升至0.88,同时公开发布4545个合成样本以支持低资源领域研究。

Comments Accepted in 15th ACM ICSCA, 2026 in Langkawi, Malaysia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25149 2026-04-29 cs.AI 89%

Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models

语义层用于可靠的LLM驱动数据分析:在三个前沿模型上准确性和幻觉的配对基准测试

Michael Rumiantsau, Ivan Fokeev

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过在三个前沿LLM上测试语义层对自然语言查询准确性的影响,发现添加语义描述可显著提升性能,且模型选择对结果影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22764 2026-04-28 cs.CY cs.AI cs.IR 89%

Implicit Humanization in Everyday LLM Moral Judgments

日常LLM道德判断中的隐性人性化

Hoda Ayad, Tanu Mitra

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究探讨了日常LLM在道德判断中隐性人性化倾向的影响,通过分析四个主流LLM的响应,发现其强化了隐性人性化假设,可能加剧过度依赖或信任风险,呼吁未来研究需考虑用户侧隐性人性化并设计解决方案。

Comments 6 pages, 3 figures, Published in CHIIR '26

Journal ref Proceedings of the 2026 Conference on Human Information Interaction and Retrieval (CHIIR '26), pages 497-502, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00688 2026-04-22 cs.CL eess.AS 89%

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice:迈向多语言零样本文本到语音的扩散语言模型

Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

机构 * Xiaomi Corp.(小米公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 OmniVoice是一种支持600多种语言的零样本文本到语音模型,采用新型非自回归架构直接将文本映射到多代码本音频标记,通过全代码本随机掩码策略和预训练LLM初始化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18607 2026-04-22 cs.NE cs.AI 89%

TurboEvolve: Towards Fast and Robust LLM-Driven Program Evolution

TurboEvolve:迈向快速且稳健的LLM驱动程序进化

Yang Yang, Zining Zhong, Jindong Li, Jiemin Wu, Kaishen Yuan, Wenshuo Chen, Menglin Yang, Yutao Yue

机构 * Artificial Intelligence Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 TurboEvolve通过多岛屿进化框架提升样本效率和鲁棒性,在固定评估预算下实现更可靠的程序进化进展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17008 2026-04-21 cs.CL 89%

BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories

BIASEDTALES-ML:一个多语言数据集用于分析LLM生成故事中的叙述属性分布

Yuxuan Ouyang, yingfeng luo, JingBo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(NiuTrans研究院,中国沈阳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出BiasedTales-ML数据集,通过多语言生成分析叙述属性分布,揭示跨语言生成模式的差异,强调英语中心评估的局限性。

Comments Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12108 2026-04-15 cs.SE cs.AI 89%

LLM-Based Automated Diagnosis Of Integration Test Failures At Google

基于LLM的谷歌集成测试故障自动诊断

Celal Ziftci, Ray Liu, Spencer Greene, Livio Dalloro

机构 * GoogleUSA(美国谷歌)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Auto-Diagnose工具,利用LLM高效诊断集成测试故障,通过分析日志生成摘要并集成至代码审查系统,实验证明其高准确率和用户认可。

详情

展开后加载摘要…

URL PDF HTML 收藏