arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 66 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2603.18898 2026-03-20 cs.IR 90%

Comparative Analysis of Large Language Models in Generating Telugu Responses for Maternal Health Queries

大型语言模型在生成母体健康问题Telugu回应中的比较分析

Anagani Bhanusree, Sai Divya Vissamsetty, K VenkataKrishna Rao, Rimjhim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究比较了ChatGPT-4o、GeminiAI和Perplexity AI在母体健康问题中的Telugu回应表现,通过语义相似性指标和专家评估发现Gemini在准确性与连贯性上表现最佳,Perplexity在Telugu提示下表现良好,ChatGPT需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02951 2026-03-20 cs.CL cs.AI 90%

SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models

SQLBench: 一种全面评估大型语言模型文本到SQL能力的综合评估

Bin Zhang, Yuxiao Ye, Guoqing Du, Xiaoru Hu, Zhishuai Li, Chi Harold Liu, Zhiwei Xu, Guoliang Fan, Rui Zhao, Ziyue Li, Hangyu Mao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) SenseTime Research(商汤科技研究院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SQLBench,通过构建新数据集和五个评估任务,全面评估不同模型在文本到SQL任务中的性能差异,并提出针对各任务的最优上下文学习方案。

Comments 25pages, 10figures, 14tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19195 2026-03-20 eess.AS cs.CL cs.SD 89%

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

LLM骨干中的听觉知识如何塑造音频语言模型:全面评估

Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang, Chih-Kai Yang, Yi-Cheng Lin, Chi-Yuan Hsiao, Wenze Ren, En-Pei Hu, Yu-Han Huang, An-Yu Cheng, Cheng-Han Chiang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * National Taiwan University, Taiwan(国立台湾大学) NVIDIA Academia Sinica, Taiwan(台湾“学术院”)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究比较不同LLM在文本仅和音频基础设置下的表现,揭示听觉知识在不同家族间差异显著,文本结果与音频性能强相关。

Comments Project website: https://kehanlu.github.io/AKB

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18765 2026-03-20 cs.CL 89%

Implicit Grading Bias in Large Language Models: How Writing Style Affects Automated Assessment Across Math, Programming, and Essay Tasks

大语言模型中的隐性评分偏见:写作风格如何影响数学、编程和作文任务的自动评估

Rudra Jadhav, Janhavi Danve, Sonalika Shaw

机构 * Department of Computer Science(计算机科学系) Savitribai Phule Pune University(萨维特里·巴伊·普内大学) Dr. D. Y. Patil School of Science and Technology(D.Y.帕提尔科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在内容正确性不变时,写作风格对评分的隐性偏见,发现作文任务存在显著偏见,而数学和编程任务则无显著偏见。

Comments 7 pages, 5 figures, 2 tables, 11 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18469 2026-03-20 cs.CL 89%

GAIN: A Benchmark for Goal-Aligned Decision-Making of Large Language Models under Imperfect Norms

GAIN:在不完美规范下评估大语言模型目标对齐决策的基准

Masayuki Kawarada, Kodai Watanabe, Soichiro Murakami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 GAIN基准通过模拟现实商业场景,评估大语言模型在规范与目标冲突下的决策平衡能力,揭示影响决策的关键因素。

Comments We are working towards releasing the code in April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06265 2026-03-20 cs.CL 89%

Large Language Models Hallucination: A Comprehensive Survey

大语言模型幻觉:全面调查

Aisha Alansari, Hamzah Luqman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文全面调查大语言模型中的幻觉现象,分析其成因、检测与缓解方法,探讨现有评估指标及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18007 2026-03-20 cs.CL cs.AI 88%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16746 2026-03-20 cs.CY cs.AI 88%

Beyond Partisan Leaning: A Comparative Analysis of Political Bias in Large Language Models

超越党派倾向:对大型语言模型中政治偏见的比较分析

Tai-Quan Peng, Kaiqi Yang, Sanguk Lee, Hang Li, Yucheng Chu, Yuping Lin, Hui Liu

机构 * Michigan State University(密歇根州立大学) Texas Christian University(德克萨斯基督教大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。

Journal ref Journal of Information Technology & Politics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 87%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18530 2026-03-20 cs.CL cs.AI cs.CY cs.LG 87%

When Names Change Verdicts: Intervention Consistency Reveals Systematic Bias in LLM Decision-Making

当名称改变裁决:干预一致性揭示LLM决策中的系统性偏差

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度阿勒颇理工学院,阿勒颇(IIITA)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所(NIELIT))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过干预一致性测试检测LLM对虚假特征的依赖,发现权威偏见和框架偏见显著高于人口偏见,并展示结构化分解方法可大幅降低偏差,通过迭代提示修复实现78%的偏见减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11599 2026-03-20 cs.AI cs.CL cs.CY 86%

SynBullying: A Multi LLM Synthetic Conversational Dataset for Cyberbullying Detection

SynBullying:一个多语言模型合成对话数据集用于网络欺凌检测

Arefeh Kazemi, Hamza Qadeer, Joachim Wagner, Hossein Hosseini, Sri Balaaji Natarajan Kalaivendan, Brian Davis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SynBullying通过多语言模型生成对话数据,提供可扩展且伦理安全的网络欺凌检测研究方法,包含多轮对话结构、上下文感知标注和细粒度标签,评估了五个维度并测试了其作为训练数据和增强源的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18074 2026-03-20 cs.LG cs.AI cs.IR stat.AP 86%

Lightweight Adaptation for LLM-based Technical Service Agent: Latent Logic Augmentation and Robust Noise Reduction

轻量级适应用于基于LLM的技术服务代理:潜在逻辑增强与鲁棒噪声消除

Yi Yu, Junzhuo Ma, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Guangquan Hu, Jianfeng Liu, Weiting Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University, Shanghai, China(复旦大学数学科学学院,上海,中国) Shanghai Center for Mathematical Sciences, Fudan University, Shanghai, China(复旦大学上海数学中心,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, Shanghai, China(脑启发式智能科学技术研究院,复旦大学,上海,中国) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University, Shanghai, China(应用数学中心及上海当代应用数学重点实验室,复旦大学,上海,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出轻量级适应框架,通过潜在逻辑增强和鲁棒噪声消除提升技术服务代理的稳定性和性能,同时采用混合奖励机制降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02768 2026-03-20 eess.AS cs.CL cs.SD 85%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18171 2026-03-20 cs.CL 85%

Modeling the human lexicon under temperature variations: linguistic factors, diversity and typicality in LLM word associations

在温度变化下建模人类词汇库:LLM词关联中的语言因素、多样性与典型性

Maria Andueza Rodriguez, Marie Candito, Richard Huyghe

机构 * University of Fribourg(弗里堡大学) LLF (Université Paris Cité / CNRS)(LLF(巴黎Cité大学/国家科学研究中心)) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过比较人类与LLM生成的词关联,探讨模型对人类词汇模式的捕捉准确性,发现大模型倾向于生成典型但变量小的响应,而小模型则更变量但典型性低,温度设置影响这一平衡。

Comments 11 pages, 12 figures, to appear in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18433 2026-03-20 cs.CR 85%

Prompt Control-Flow Integrity: A Priority-Aware Runtime Defense Against Prompt Injection in LLM Systems

提示控制流完整性:一种优先级感知的运行时防御,用于对抗LLM系统中的提示注入

Md Takrim Ul Alam, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Jungpil Shin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Prompt Control-Flow Integrity,一种优先级感知的运行时防御机制,通过结构化组合系统、开发者、用户和检索文档片段来防范提示注入攻击,实现零误报率和低开销。

Comments 4 Figures, 3 Tables, Submitted to the International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18018 2026-03-20 cs.CL cs.DB 84%

An Agentic System for Schema Aware NL2SQL Generation

一种基于模式的代理系统用于自然语言到SQL生成

David Onyango, Naseef Mansoor

机构 * Project Path Minnesota State University Mankato(明尼苏达州立大学曼科托分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出一种基于模式的代理系统,利用小型语言模型作为主要代理,结合选择性LLM回退机制,降低计算成本,实验显示在BIRD基准上实现90%以上的成本节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 83%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18557 2026-03-20 cs.CL 83%

Cross-Lingual LLM-Judge Transfer via Evaluation Decomposition

跨语言LLM判断转移 via 评估分解

Ivaxi Sheth, Zeno Jonke, Amin Mantrach, Saab Mansour

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于通用标准集的评估框架,通过分解方法实现跨语言LLM判断转移,无需目标语言标注即可在多种语言和模型上提升评估性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 82%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18102 2026-03-20 cs.AR 82%

HWE-Bench: Can Language Models Perform Board-level Schematic Designs?

HWE-Bench: 语言模型能否进行电路板级原理图设计?

Weibo Qiu, Yinhao Xiao, Runyu Pan

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出HWE-Bench评估框架,用于测试语言模型在电路板级原理图设计任务中的能力,通过300个任务和2914个IC数据表评估模型在物理直觉和动态行为验证上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19082 2026-03-20 cs.CL 81%

A Dataset and Resources for Identifying Patient Health Literacy Information from Clinical Notes

一种用于从临床笔记中识别患者健康素养信息的数据集和资源

Madeline Bittner, Dina Demner-Fushman, Yasmeen Shabazz, Davis Bartels, Dukyong Yoon, Brad Quitadamo, Rajiv Menghrajani, Leo Celi, Sarvesh Soni

机构 * National Library of Medicine(国家医学图书馆) Massachusetts Institute of Technology(麻省理工学院) Yonsei University College of Medicine(延世大学医学院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) NYC Health + Hospitals - Lincoln(纽约市卫生局-林肯医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出HEALIX数据集,通过社会工作者笔记采样、关键词过滤和LLM主动学习方法,标注了589个临床笔记的健康素养信息,验证了其在不同大语言模型上的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18813 2026-03-20 cs.AI 79%

Can LLM generate interesting mathematical research problems?

大语言模型能否生成有趣的数学研究问题?

Xiaoyang Chen, Xiang Jiang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文探讨大语言模型能否生成有价值的前沿数学研究问题,通过生成665个微分几何问题并经人类验证,发现许多问题对专家而言尚属未知且具有独特研究价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18678 2026-03-20 cs.SD cs.CL 79%

Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models

词语游戏:评估大型音频-语言模型在音频双关语理解中的基准测试

Yuchen Su, Shaoxin Zhong, Yonghua Zhu, Ruofan Wang, Zijian Huang, Qiqi Wang, Na Zhao, Diana Benavides-Prado, Michael Witbrock

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) School of Statistics and Data Science, Nankai University(南开大学统计与数据科学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出APUN-Bench,首个评估大型音频语言模型音频双关语理解能力的基准,包含4434个音频样本,分析10种先进模型,揭示识别、定位和解释双关语的性能差距及挑战。

Comments The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18390 2026-03-20 cs.CL 79%

AutoScreen-FW: An LLM-based Framework for Resume Screening

AutoScreen-FW:基于大语言模型的简历筛选框架

Zhelin Xu, Shuhei Yamamoto, Atsuyuki Morishima

机构 * Institute of Library, Information Media Science University of Tsukuba Tsukuba, Ibraki, Japan

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出AutoScreen-FW框架,利用开源大语言模型自动筛选简历,通过选取代表性样本提升模型判断性能,实验证明其在效率和准确性上优于商业模型。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 79%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18300 2026-03-20 cs.HC cs.AI cs.CY cs.IR cs.LG 79%

Auditing Preferences for Brands and Cultures in LLMs

对LLM中品牌和文化偏好的审计

Jasmine Rienecker, Katarina Mpofu, Naman Goel, Siddhartha Datta, Jun Zhao, Oscar Danielsson, Fredrik Thorsen

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChoiceEval框架,用于审计LLM中品牌和文化偏好,通过生成多样化查询和量化偏好指标,揭示模型在不同主题上的系统性偏好差异。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18161 2026-03-20 cs.CL cs.AI 79%

How LLMs Distort Our Written Language

大语言模型如何扭曲我们的书面语言

Marwa Abdulhai, Isadora White, Yanming Wan, Ibrahim Qureshi, Joel Leibo, Max Kleiman-Weiner, Natasha Jaques

机构 * UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Zaytuna College(扎亚图纳学院) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18010 2026-03-20 cs.CL cs.AI cs.CY 79%

Agentic Framework for Political Biography Extraction

政治传记提取的代理框架

Yifei Zhu, Songpo Yang, Jiangnan Zhu, Junyan Jiang

机构 * Department of Politics and Public Administration, The University of Hong Kong(政治与公共行政系,香港大学) School of International Studies, Peking University(国际关系学院,北京大学) Department of Political Science, Columbia University(政治学系,哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段的合成-编码框架,利用大语言模型自动化提取多维精英传记,提升政治科学研究的效率和准确性。

Comments 70 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10294 2026-03-20 cs.CV q-bio.TO 78%

MIPHEI-ViT: Multiplex Immunofluorescence Prediction from H&E Images using ViT Foundation Models

MIPHEI-ViT:基于H&E图像的多重免疫荧光预测方法

Guillaume Balezo, Roger Trullo, Albert Pla Planas, Etienne Decenciere, Thomas Walter

机构 * Digital R&D, Sanofi(桑福数字研发部) Center for Computational Biology (CBIO) Mines Paris - PSL(计算生物学中心(CBIO)巴黎 Mines-PSL) Center for Statistics and Images (STIM) Mines Paris - PSL(统计与图像中心(STIM)巴黎 Mines-PSL) Institut Curie, INSERM, U1331(curie研究所,INSERM,U1331) InstaDeep

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出MIPHEI-ViT模型,利用预训练的ViT基础模型从H&E图像预测多重免疫荧光信号,通过丰富的预训练表示实现细胞类型分类,验证结果在多个数据集上均优于基线模型。

Comments Accepted manuscript, 24 pages, 9 figures, 5 tables. Published in Computers in Biology and Medicine (DOI: https://doi.org/10.1016/j.compbiomed.2026.111564)

Journal ref Computers in Biology and Medicine, vol. 206, 2026, 111564

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18465 2026-03-20 cs.CV 78%

MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling

MedQ-UNI: 向通过视觉-语言建模实现医学图像质量评估与修复的统一迈进

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出MedQ-UNI,一种统一的视觉-语言模型,通过先评估再修复的范式,利用医学图像质量评估指导医学图像修复,实现了跨模态和降质类型的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏