arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 107 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 107 篇

2603.27504 2026-03-31 cs.CV 90%

Transferring Physical Priors into Remote Sensing Segmentation via Large Language Models

通过大语言模型将物理先验转移到遥感分割中

Yuxi Lu, Kunqi Li, Zhidong Li, Xiaohan Su, Biao Wu, Chenya Huang, Bin Liang

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出PriorSeg模型,利用物理先验提升遥感图像分割的准确性与物理合理性,通过构建物理中心知识图谱和异构数据集Phy-Sky-SA,无需重新训练即可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09938 2026-03-31 cs.CL 89%

Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions

大语言模型时代下的模型合并:方法、应用与未来方向

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯(中国))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28374 2026-03-31 cs.CY 89%

Using Games to Learn How Large Language Models Work

通过游戏学习大语言模型的工作原理

Allison Chen, Isabella Pu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出两款游戏,通过游戏化方式展示大语言模型的工作原理与数据使用方法,旨在提升AI素养。

Comments CHI Conference on Human Factors in Computing Systems Workshop on Data Literacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26142 2026-03-31 cs.HC 89%

Simulating Novice Students Using Machine Unlearning and Relearning in Large Language Models

利用机器去学习和再学习在大语言模型中模拟新手学生

Jiajia Song, Zhihan Guo, Jionghao Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于机器去学习的知识级模拟方法,通过转换知识丰富的LLM为新手级AI学生,评估其通过教学对话重新学习知识的能力,揭示了学生行为随时间的变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM 88%

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28698 2026-03-31 cs.CL 88%

EpiScreen: Early Epilepsy Detection from Electronic Health Records with Large Language Models

EpiScreen:利用电子健康记录中的大型语言模型进行早期癫痫检测

Shuang Zhou, Kai Yu, Zaifu Zhan, Huixue Zhou, Min Zeng, Feng Xie, Zhiyi Sha, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) College of Science and Engineering, University of Minnesota(明尼苏达大学科学与工程学院) Department of Neurology, University of Minnesota(明尼苏达大学神经病学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出EpiScreen方法,通过微调大型语言模型实现早期癫痫检测,其在MIMIC-IV数据集和明尼苏达大学私有队列中分别达到0.875和0.980的AUC,临床合作中帮助神经科医生提高诊断准确率。

Comments 24 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 88%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27806 2026-03-31 cs.CL cs.CY 88%

Understanding Teacher Revisions of Large Language Model-Generated Feedback

理解大型语言模型生成反馈的教师修订

Conrad Borchers, Luiz Rodrigues, Newarney Torrezão da Costa, Cleon Xavier, Rafael Ferreira Mello

机构 * Carnegie Mellon University(卡内基梅隆大学) Federal Technological University of Paraná – UTFPR(巴拉那联邦理工大学) Instituto Federal Goiano – IF Goiano(戈亚斯联邦学院) Federal Rural University of Pernambuco – UFRPE(伯南布哥联邦农村大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨教师如何修订AI生成的反馈,发现80%的反馈未修改,编辑反馈通常更长且被缩短,机器学习模型能预测修订决策,修订常简化反馈内容,使其更简洁纠正性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 88%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27662 2026-03-31 cs.CV 88%

A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos

一种评估开源视频大语言模型在新闻视频自动字幕生成中性能的基准方法

David Miranda Paredes, Jose M. Saavedra, Marcelo Pizarro

机构 * Universidad de los Andes, Chile(智利洛斯安第斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出评估开源视频大语言模型在自动新闻视频字幕生成中的方法,使用两个基准数据集评估八种最新模型,发现传统指标在新闻视频字幕生成中表现有限,提出新的主题和实体忠实度指标,结果显示Gemma~3在两个数据集和多数评估维度上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 88%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);SLM(abstract)

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05150 2026-03-31 cs.CL 87%

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

希腊MMLU:用于评估希腊语言模型多任务基准的原生来源基准

Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

机构 * LIX, Ecole Polytechnique(巴黎综合理工学院LIX实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) National Technical University of Athens(雅典国家技术大学) University of Ioannina(约阿尼纳大学) University of Peloponnese(伯罗奔尼撒大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 希腊MMLU是一个包含45个学科领域的21805道多选题的希腊多任务评估基准,所有题目均源自希腊学术、专业和政府考试,旨在评估语言模型在希腊语言中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 86%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 评测与基准 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 86%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26830 2026-03-31 cs.LG cs.AI cs.SE 86%

A Regression Framework for Understanding Prompt Component Impact on LLM Performance

用于理解提示组件对LLM性能影响的回归框架

Andrew Lauziere, Jonathan Daugherty, Taisa Kushner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出回归框架分析提示特征对LLM性能的影响,通过回归模型解释提示部分对模型表现的解释力,发现错误示例会阻碍模型解决算术问题,正负指令对模型性能有矛盾影响。

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 86%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26351 2026-03-31 cs.LG 86%

LLM-Assisted Emergency Triage Benchmark: Bridging Hospital-Rich and MCI-Like Field Simulation

基于大语言模型的急救分级基准:连接医院丰富与MCI类现场模拟

Joshua Sebastian, Karma Tobden, KMA Solaiman

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个开放的急救分级基准,通过大语言模型辅助构建,解决现有基准不可用的问题,涵盖医院环境和MCI模拟两种场景,提升临床AI数据集的可重复性和可访问性。

Comments Submitted to GenAI4Health@NeurIPS 2025. This was the first version of the LLM-assisted emergency triage benchmark dataset and baseline models. A related but separate benchmark-focused study on emergency triage under constrained sensing has been accepted at the IEEE International Conference on Healthcare Informatics (ICHI) 2026 (see arXiv:2602.20168)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27949 2026-03-31 cs.CL 85%

EnsemJudge: Enhancing Reliability in Chinese LLM-Generated Text Detection through Diverse Model Ensembles

EnsemJudge: 通过多样化模型集成提升中文LLM生成文本检测的可靠性

Zhuoshang Wang, Yubing Ren, Guoyu Zhao, Xiaowei Zhu, Hao Li, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EnsemJudge框架,通过定制策略和集成投票机制,有效检测中文LLM生成文本,优于基线方法并在NLPCC2025任务中取得第一,验证了其可靠性。

Comments Accepted by NLPCC 2025 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 85%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09701 2026-03-31 cs.SE 85%

An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation

多轮人-大语言模型协作代码生成中交互恶臭的实证研究

Binquan Zhang, Li Zhang, Lin Shi, Song Wang, Yuwei Qian, Linhui Zhao, Fang Liu, An Fu, Yida Ye

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过分析真实用户-大语言模型交互数据,揭示多轮协作代码生成中的交互恶臭现象,提出InCE框架以提升交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27127 2026-03-31 cs.CR 85%

Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction

Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互

Tran Vy Khang, Nguyen Dang Nguyen Khang, Nghi Hoang Khoa, Do Thi Thu Hien, Van-Hau Pham, Phan The Duy

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26942 2026-03-31 cs.HC 85%

The Observability Gap: Why Output-Level Human Feedback Fails for LLM Coding Agents

可观性缺口:为何输出级人类反馈在LLM编码代理中失效

Yinghao Wang, Cheng Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究发现,LLM编码代理在缺乏预定义功能的情况下,通过轻量级人类反馈构建可重用函数库时,输出反馈无法有效识别根因,导致持续失败模式。

Comments Accepted to CHI 2026 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27694 2026-03-31 cs.CL 84%

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

大语言模型能否超越行为模仿模拟人类认知?

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文通过217位AI研究者纵向研究轨迹构建基准,评估LLM是否能模拟人类认知,提出多维认知对齐指标,系统评估最新LLM及增强技术,探讨其模拟人类认知的能力及提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23362 2026-03-31 cs.CL cs.AI 84%

Dual-Space Smoothness for Robust and Balanced LLM Unlearning

双空间平滑性用于鲁棒且平衡的LLM反学习

Han Yan, Zheyuan Liu, Meng Jiang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28005 2026-03-31 cs.CL 83%

Rethinking Atomic Decomposition for LLM Judges: A Prompt-Controlled Study of Reference-Grounded QA Evaluation

重新思考用于LLM裁判的原子分解:一种受参考影响的问答评估的提示控制研究

Xinran Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了参考导向问答评估中原子分解与整体裁判的性能差异,发现整体裁判在多数基准中表现更优,尤其在部分支持案例中表现突出,且参考质量下降对两种裁判方式均产生显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17290 2026-03-31 cs.CL 83%

Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation

爱沙尼亚WinoGrande数据集:大型语言模型在人工和机器翻译上的比较分析

Marii Ojastu, Hele-Andra Kuulmets, Aleksei Dorkin, Marika Borovikova, Dage Särg, Kairit Sirts

机构 * TartuNLP, Institute of Computer Science(塔尔图大学计算机科学研究所TartuNLP实验室) Department of Translation Studies, Institute of Foreign Language and Cultures(塔尔图大学外语与文化研究所翻译研究系) Institute of Genomics(塔尔图大学基因组学研究所) University of Tartu(塔尔图大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了爱沙尼亚本地化和文化适应的WinoGrande测试集翻译,评估了专有和开源模型在人工翻译基准上的表现,并探讨了通过整合人工翻译过程的见解来设计详细提示以实现高质量机器翻译的可行性。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27630 2026-03-31 cs.AR cs.LG 83%

RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning

RTLSeek: 通过多阶段多样性导向强化学习提升基于LLM的RTL生成

Xinyu Zhang, Zhiteng Chao, Yonghao Wang, Bin Sun, Tianyun Ma, Tianmeng Yang, Jianan Mu, Jing Justin Ye, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) CASTEST Co., Ltd.(中科芯测科技有限公司)

专题命中 评测与基准 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 RTLSeek通过多阶段多样性导向强化学习提升基于LLM的RTL生成,结合专家知识与EDA反馈,改进RTL的正确性和多样性,实验表明其在RTLLM基准上优于现有方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27539 2026-03-31 cs.MA cs.AI cs.CE 83%

Toward Reliable Evaluation of LLM-Based Financial Multi-Agent Systems: Taxonomy, Coordination Primacy, and Cost Awareness

迈向可靠的LLM基于金融多智能体系统评估:分类学、协调优先性与成本意识

Phat Nguyen, Thang Pham

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种四维分类法,探讨多智能体系统中协调优先性对交易决策质量的影响,并识别五种评估失效现象,提出协调平衡收益指标以评估多智能体协调的真实价值。

Comments Accepted at the DMO-FinTech Workshop, PAKDD 2026, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15392 2026-03-31 cs.CL 83%

Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations

理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法

Yiming Huang, Biquan Bie, Zuqiu Na, Weilin Ruan, Songxin Lei, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。

Comments Accepted by the HCAIR workshop of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 82%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏