arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 74 篇

2604.15873 2026-04-20 cs.CL 94%

How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models

你的LLM裁判有多虚伪?大型语言模型在语用能力中的听众-说话人不对称性

Judith Sieker, Sina Zarrieß

机构 * Computational Linguistics, Department of Linguistics(计算语言学系,语言学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在语用能力中的听众与说话人角色差异,发现模型在作为听众判断语言输出适当性时表现优于作为说话人生成语用恰当语言,揭示了当前LLM在语用判断与生成方面的弱关联性。

Comments Accepted at ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19363 2026-04-20 cs.AI cs.LG stat.ME stat.ML 92%

Large Language Models for Market Research: A Data-augmentation Approach

用于市场研究的大型语言模型:一种数据增强方法

Mengxin Wang, Dennis J. Zhang, Heng Zhang

机构 * Naveen Jindal School of Management, The University of Texas at Dallas(内维恩·金达管理学院,德克萨斯大学达拉斯分校) Olin School of Business, Washington University in St. Louis(奥林商学院,圣路易斯华盛顿大学) W. P. Carey School of Business, Arizona State University(W.P.凯里商学院,亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据增强方法,结合LLM生成数据与真实数据,提升市场研究中联合分析的统计稳健性,减少误差并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03746 2026-04-20 cs.CL 92%

Whose Facts Win? LLM Source Preferences under Knowledge Conflicts

谁的事实获胜?在知识冲突下LLM的来源偏好

Jakob Schuster, Vagrant Gautam, Katja Markert

机构 * Heidelberg University(海德堡大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了LLM在知识冲突中的来源偏好,发现其更倾向于机构证实的信息,但可通过重复低可信度来源信息逆转。提出方法减少重复偏差,同时保持大部分偏好。

Comments Data and code: https://github.com/JaSchuste/llm-source-preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02497 2026-04-20 cs.SE cs.AI quant-ph 92%

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

面向增强基于LLM的量子代码生成的PennyLane数据集

Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * Center for Quantum and Topological Systems (CQTS)(量子与拓扑系统中心(CQTS)) NYUAD Research Institute(纽约大学阿布扎克研究院) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PennyLang数据集,通过系统化方法提升LLM生成量子代码的性能,验证了RAG框架在增强量子代码生成中的有效性。

Comments 8 pages, 6 figures, 8 tables. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15588 2026-04-20 cs.CL cs.AI cs.HC cs.LG 90%

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

请问,我可以发言吗... CoLabScience,一种用于生物医学发现和LLM专家协作的主动AI助手

Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(沃斯特理工大学) University of California, Davis(加州大学戴维斯分校) Jiangsu University(江苏大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoLabScience,一种主动AI助手,通过及时的上下文感知干预提升生物医学领域AI与人类专家的协作效率,PULI框架在流式科学讨论中实现精准干预,实验表明其在干预精度和协作任务实用性上优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15508 2026-04-20 cs.CY cs.AI 90%

LLMbench: A Comparative Close Reading Workbench for Large Language Models

LLMbench: 一种用于大型语言模型的比较性近距离阅读工作台

David M. Berry

机构 * University of Sussex(苏塞克斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 LLMbench通过可视化工具分析大型语言模型输出的生成结构,提供概率分布、文本可能性等分析,用于批判性研究生成式AI模型。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13846 2026-04-20 cs.CL 90%

Beyond Static Personas: Situational Personality Steering for Large Language Models

超越静态人设:面向大语言模型的情境性人格引导

Zesheng Wei, Mengxiang Li, Zilei Wang, Yang Deng

机构 * University of Science and Technology of China(中国科学技术大学) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出IRIS框架,通过分析人设神经元揭示情境依赖性,实现无训练的神经元引导方法,在PersonalityBench和SPBench上验证了其在复杂情境下的泛化与鲁棒性。

Comments Accepted to Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03699 2026-04-20 cs.CL 90%

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

RedBench:用于大型语言模型全面红队测试的通用数据集

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * Knovel Engineering Lab(Knovel工程实验室) Knovel Engineering Singapore(Knovel工程新加坡) VNU University of Science(越南科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 RedBench通过整合37个基准数据集,提供标准化的风险分类和领域框架,用于系统评估大型语言模型的安全性,促进鲁棒性比较和未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13061 2026-04-20 cs.CL cs.AI 90%

Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction

令牌统计揭示多轮LLM交互中的对话漂移

Wael Hafez, Amir Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过令牌频率统计监测对话一致性,提出Bipredictability指标,验证其在多轮交互中的有效性,显示结构监控可补充语义评估。

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15859 2026-04-20 cs.LG cs.AI 90%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI 89%

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15460 2026-04-20 cs.HC cs.AI 89%

The Crutch or the Ceiling? How Different Generations of LLMs Shape EFL Student Writings

支点还是天花板?不同世代的LLM如何塑造EFL学生的写作

Hengky Susanto, David James Woo, Chingyi Yeung, Stephanie Wing Yan Lo-Philip, Chi Ho Yeung

机构 * Education University of Hong Kong(教育大学(香港)) Everwrite Limited(Everwrite有限公司) International Christian School(国际基督教学校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨LLM在辅助EFL学生写作中的作用及局限,发现高级LLM虽提升评分和词汇多样性,但可能掩盖真实能力,建议教学应关注学习过程而非仅输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25897 2026-04-20 cs.CL cs.AI cs.CY 88%

RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity

RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准

Jisu Shin, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15368 2026-04-20 cs.CR 88%

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

LogJack:通过云日志间接提示注入攻击大语言模型调试代理

Harsh Shah

专题命中 评测与基准 :LLM(title,summary_cn);foundation model(abstract)

AI总结 研究通过云日志内容对LLM调试代理进行间接提示注入攻击,提出LogJack基准测试集,并评估8个基础模型在不同提示条件下的表现,发现部分模型在主动条件下可执行命令,而防护措施大多失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 88%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 88%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15001 2026-04-20 cs.AI 87%

COEVO: Co-Evolutionary Framework for Joint Functional Correctness and PPA Optimization in LLM-Based RTL Generation

COEVO:用于LLM基于RTL生成中功能正确性与PPA优化的联合进化框架

Heng Ping, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Shukai Duan, Xiaole Zhang, Paul Bogdan

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出COEVO框架,通过联合优化功能正确性与PPA,在单个进化循环中统一两者目标,提升RTL生成效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15329 2026-04-20 cs.HC cs.AI cs.CL 87%

Evaluating LLMs as Human Surrogates in Controlled Experiments

评估LLMs在受控实验中作为人类替代品的效用

Adnan Hoq, Tim Weninger

机构 * University of Notre Dame(诺特达姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较LLM生成数据与人类数据,探讨在准确性感知实验中LLM能否作为人类替代品,发现LLM能复现部分人类效应,但效果大小和调节模式因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16115 2026-04-20 cs.CV 87%

From Articles to Canopies: Knowledge-Driven Pseudo-Labelling for Tree Species Classification using LLM Experts

从文章到树冠:基于知识的伪标注用于利用LLM专家的树种分类

Michał Romaszewski, Dominik Kopeć, Michał Cholewa, Katarzyna Kołodziej, Przemysław Głomb, Jan Niedzielko, Jakub Charyton, Justyna Wylazłowska, Anna Jarocińska

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所) University of Lodz(卢布林大学) University of Warsaw, Faculty of Geography and Regional Studies, Department of Geoinformatics, Cartography and Remote Sensing(华沙大学地理与区域研究学院,地理信息学、制图与遥感系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合多传感器地球观测数据和生态知识的半监督深度学习方法,通过生物启发的伪标注提升树种分类精度,实验显示比最佳参考方法提升5.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 86%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19312 2026-04-20 cs.LG cs.AI cs.CL cs.HC stat.ML 86%

FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users

FSPO:少样本优化合成偏好以个性化真实用户

Anikait Singh, Sheryl Hsu, Kyle Hsu, Eric Mitchell, Stefano Ermon, Tatsunori Hashimoto, Archit Sharma, Chelsea Finn

机构 * Stanford University(斯坦福大学) OpenAI Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。

Comments Website: https://fewshot-preference-optimization.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16270 2026-04-20 cs.CL cs.AI 85%

From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

从基准测试到推理:一个双视角、大规模评估LLMs在越南法律文本上的表现

Van-Truong Le

机构 * University of Science, VNUHCM(越南国家大学科学大学) Vietnam National University(越南国家大学) Hanoi Open University(河内开放大学) Ho Chi Minh, Vietnam(胡志明市,越南)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双视角评估框架,评估四种LLM在越南法律文本的准确性、可读性和一致性,发现Grok-1在可读性和一致性上表现优异但法律准确性不足,而Claude 3 Opus高准确性掩盖了推理错误,揭示当前LLM在法律推理上的核心挑战。

Comments 7 pages, 2 figures. Accepted at the FISU Joint Conference on Artificial Intelligence (FJCAI 2026), Vietnam

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20689 2026-04-20 cs.AI cs.CL 85%

WiseMind: a knowledge-guided multi-agent framework for accurate and empathetic psychiatric diagnosis

WiseMind: 一种基于知识的多智能体框架,用于准确且富有同理心的精神病诊断

Yuqi Wu, Guangya Wan, Jingjing Li, Shengming Zhao, Lingfeng Ma, Tianyi Ye, Ion Pop, Yanbo Zhang, Jie Chen

机构 * College of Biomedical Engineering(生物医学工程学院) Fudan University(复旦大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Alberta(阿尔伯塔大学) University of Virginia(弗吉尼亚大学) McIntire School of Commerce(麦金尼商学院) School of Data Science(数据科学学院) Department of Psychiatry(精神病学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 WiseMind通过整合理性与情感智能体,结合DSM-5知识图谱,提升了精神病诊断的准确性与同理心,其在1206次模拟对话和180次真实交互中达到85.6%的诊断准确率,超越了单智能体方法。

Comments Accepted at npj Digital Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16241 2026-04-20 cs.CL cs.AI 84%

BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

BAGEL:语言模型中动物知识专精的基准测试

Jiacheng Shen, Masato Hagiwara, Milad Alizadeh, Ellen Gilsenan-McMahon, Marius Miron, David Robinson, Emmanuel Chemla, Sara Keen, Gagan Narula, Mathieu Laurière, Matthieu Geist, Olivier Pietquin

机构 * Earth Species Project(地球物种项目) NYU Center for Data Science(纽约大学数据科学中心;纽约大学上海) NYU Shanghai(纽约大学上海数据科学中心;纽约大学-复旦大学数学科学研究所) NYU Shanghai Center for Data Science NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 BAGEL基准测试评估语言模型在动物知识方面的专精能力,结合多个来源生成封闭式问题对,涵盖分类学、形态学、栖息地等多个方面,旨在提升语言模型在生物多样性应用中的可靠性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 83%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15547 2026-04-20 cs.CL cs.AI 82%

Consistency Analysis of Sentiment Predictions using Syntactic & Semantic Context Assessment Summarization (SSAS)

基于语法与语义上下文评估总结的语义一致性分析

Sharookh Daruwalla, Nitin Mayande, Shreeya Verma Kathuria, Nitin Joglekar, Charles Weber

机构 * Tellagence Inc.(Tellagence公司) Villanova School of Business, Villanova University(维拉文纳大学商学院) Maseeh College of Engineering and Computer Science, Portland State University(波特兰州立大学Maseeh工程与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSAS框架,通过上下文评估提升情感预测的一致性,实验表明其能有效提高数据质量,减少噪声和分析方差。

Comments 27 pages, 2 figures. arXiv admin note: text overlap with arXiv:2604.12049

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 82%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05638 2026-04-20 cs.CV 82%

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

SurgMotion: 一种用于外科视频通用理解的视频原生基础模型

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei

机构 * Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑) Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国) Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 SurgMotion通过引入视频原生基础模型,将学习范式从像素级重建转向潜在运动预测,通过三种关键技术改进提升外科视频理解能力,实验表明其在手术流程识别、动作三元组识别和技能评估等任务中均取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15549 2026-04-20 cs.CL 81%

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

WildFeedback: 对齐大语言模型与实时用户交互与反馈

Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

机构 * Microsoft Corporation(微软公司) Purdue University(普渡大学) Texas A&M University(德克萨斯农工大学) University of California San Diego(加州大学圣地亚哥分校) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。

Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15827 2026-04-20 cs.IR cs.CL 81%

UsefulBench: Towards Decision-Useful Information as a Target for Information Retrieval

UsefulBench: 向信息检索的目标——决策有用的信息

Tobias Schimanski, Stefanie Lewandowski, Christian Woerle, Nicola Reichenau, Yauheni Huryn, Markus Leippold

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) score4more GmbH(score4more公司) Climate+Tech Think Tank(Climate+Tech智库) Swiss Finance Institute (SFI)(瑞士金融研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出UsefulBench,通过专业标注区分信息相关性与实用性,揭示传统相似性检索与LLM在领域问题中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏