arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2509.03463 2026-07-07 cs.SE 版本更新 85%

The Impact of Critique on LLM-Based Model Generation from Natural Language: The Case of Activity Diagrams

批判对基于大语言模型的自然语言模型生成的影响:以活动图为例

Parham Khamsepour, Mark Cole, Ish Ashraf, DaYuan Tan, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型从自然语言描述自动化生成模型,提出LADEX流程,经批判-改进循环,设计变体研究其影响,用两种匹配器评估,实验表明循环可提升结构有效性等,算法结构检查更能实现结构一致性。

Comments Accepted in the Empirical Software Engineering (EMSE) Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20878 2026-07-07 cs.CR 版本更新 85%

Supporting Students in Navigating LLM-Generated Insecure Code

支持学生应对大语言模型生成的不安全代码

Jaehwan Park, Seonhye Park, Kyungchan Lim, Hyoungshick Kim, Doowon Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成不安全代码的问题,提出Bifröst框架,通过对抗配置的代码生成模型、VS Code扩展和自动化漏洞报告,为教师提供反馈,助于引导讨论,经学生实验观察到该框架能改变学生对不安全代码的态度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01827 2026-07-07 cs.SE 版本更新 85%

PSearch: Search-based Patch Generation in the Era of LLM-based Automated Program Repair

PSearch:基于大语言模型的自动程序修复时代中基于搜索的补丁生成

Haichuan Hu, Ye Shang, Weifeng Sun, Quanjun Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有基于大语言模型的自动程序修复方法靠试错生成补丁、难以有效评估搜索方向潜力和分配预算的问题,提出Psearch框架,以迭代补丁评估和优化为核心,能集成不同搜索算法,实验证明其有效性。

Comments accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 85%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 85%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22028 2026-06-12 cs.CV cs.RO 版本更新 85%

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

从看见到体验:通过强化学习扩展导航基础模型

Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Coco Robotics(Coco机器人)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 提出S2E框架,结合离线视频预训练和模拟环境强化学习,通过锚点引导分布匹配和残差注意力模块,提升导航基础模型的交互性和安全性。

Comments 27 pages, 20 figures, 9 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25420 2026-08-17 cs.CL cs.AI cs.CY 版本更新 84%

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究人员)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。

Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 84%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新 84%

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07673 2026-07-22 cs.LG 版本更新 84%

How Benchmark Prediction from Fewer Data Misses the Mark

从较少数据进行基准预测如何失准

Guanhua Zhang, Florian E. Dorner, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型基准预测方法,通过对11种方法在19个基准上评估,发现现有方法依赖模型相似性,新模型出现时效果不佳。提出受增强逆倾向加权启发的新方法,虽能改进但提升有限,揭示基准预测在评估前沿失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 84%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06622 2026-07-07 cs.CL 版本更新 84%

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

UnpredictaBench:评估大语言模型分布随机性的基准

Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UnpredictaBench基准,通过KS@N指标评估LLM从目标分布(统计分布、随机程序、自然语言场景)采样的能力,发现模型表现差异大且无模型超过40%准确率,表明分布采样能力仍有显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 84%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10485 2026-07-03 cs.CR cs.LG cs.SE 版本更新 84%

From Lab to Reality: A Practical Evaluation of Deep Learning Models and LLMs for Vulnerability Detection

从实验室到现实:深度学习模型与LLM在漏洞检测中的实用评估

Chaomeng Lu, Bert Lagaisse

机构 * DistriNet Group-T, KU Leuven(DistriNet集团-T,根特大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 系统评估深度学习模型和大型语言模型在真实世界漏洞检测中的表现,发现它们在分布外数据集上性能急剧下降,揭示了学术基准与现实部署之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01338 2026-06-19 cs.CL 版本更新 84%

Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

在生物制药制造中本地LLM的自然语言到SQL查询基准测试:消费级硬件上的实证基准

Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya, Gaurav Kumar Gupta, Ambika Baniya Bhandari

机构 * Department of Computer Science, University of the Cumberlands(大学的计算机科学系) Department of Computer Science, DePaul University(德保罗大学计算机科学系) Youngstown State University(亚当斯州立大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了四种本地部署的开源大语言模型在生物制药制造数据库上的自然语言到SQL生成性能,发现代码调优的通用模型优于领域特定模型,但当前性能仍需人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02904 2026-06-18 cs.HC cs.CL q-bio.NC 版本更新 84%

ScholaWrite: A Dataset of End-to-End Scholarly Writing Process

ScholaWrite: 端到端学术写作过程数据集

Khanh Chi Le, Linghe Wang, Minhwa Lee, Ross Volkov, Luan Tuyen Chau, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ScholaWrite数据集,通过Chrome扩展记录Overleaf上的按键,捕捉从初稿到终稿的多月写作过程,包含5篇计算机科学预印本的近6.2万次文本修改及认知写作意图标注,揭示人类写作与LLM辅助之间的差距。

Comments Equal contribution: Khanh Chi Le, Linghe Wang, Minhwa Lee | project page: https://minnesotanlp.github.io/scholawrite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22119 2026-06-16 cs.AI 版本更新 84%

Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework

AI中涌现的策略推理风险:基于分类法的评估框架

Tharindu Kumarage, Lisa Bauer, Yao Ma, Dan Rosen, Yashasvi Raghavendra Guduri, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊诺瓦负责任人工智能)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ESRRSim框架,基于7类20子类的风险分类法,通过双评估标准自动评估LLM的策略推理风险,发现检测率在14.45%-72.72%之间,且模型代际提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07294 2026-06-12 cs.CE cs.AI 版本更新 84%

Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings

Fin-RATE:面向SEC文件的金融分析与追踪评估基准

Yidong Jiang, Junrong Chen, Eftychia Makri, Jialin Chen, Peiwen Li, Ali Maatouk, Leandros Tassiulas, Eliot Brenner, Bing Xiang, Rex Ying

机构 * Tongji University(同济大学) University of California, San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Goldman Sachs(高盛集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM在金融领域分析复杂监管文件的需求,提出基于SEC文件的Fin-RATE基准,通过三种任务路径评估模型,发现跨文档和跨时间分析时性能显著下降。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26498 2026-06-09 cs.LG q-bio.QM 版本更新 84%

Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction

大模型真的在药物发现中胜出吗?AI驱动的分子性质和活性预测中模型规模的基准评估

Jinjiang Guo, Sheng Ding

机构 * Global Health Drug Discovery Institute(全球健康药物发现研究所) School of Pharmaceutical Sciences(药学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文通过26个ADME、毒性及生物活性端点评估,发现传统机器学习在多数任务中表现最佳,大模型在部分困难分割中竞争力有限,模型性能依赖于任务与验证场景的适配性,而非单纯规模。

Comments Improved benchmark design and reproducibility, replaced restricted datasets with public benchmarks in primary analyses, and added sensitivity analyses supporting the interpretation of model scaling and evaluation protocol effects in molecular prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05583 2026-06-09 cs.CL math.OC 版本更新 84%

Toward automatic generation of control structures for process flow diagrams with large language models

面向工艺流程图控制结构自动生成的大语言模型方法

Edwin Hirtreiter, Lukas Schulze Balhorn, Artur M. Schweidtmann

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出一种基于Transformer的端到端方法,将控制结构预测视为翻译任务,利用SFILES 2.0表示PFD拓扑,通过预训练和微调实现自动生成,在生成数据上达到74.8%-89.2%的Top-5准确率。

Journal ref AIChE Journal, Volume 70, Issue 1, January 2024, e18259

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25577 2026-08-17 eess.AS cs.AI cs.CL 版本更新 84%

Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models

语音迷失在发声中:语音质量变化作为语音基础模型的评估维度

Harm Lameris, Shree Harsha Bokkahalli Satish, Joakim Gustafson, Éva Székely

机构 * Department of Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VQ-Bench评估套件,发现语音基础模型(SFMs)对发声类型的解释存在性能差距,还会反映或放大人类社会偏见,为确保基于语音的AI的副语言解释责任性建立了可复现框架。

Comments 5 pages, 2 figures, 3 tables, accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16941 2026-08-11 cs.LG cs.AI 版本更新 84%

FoMoH: A clinically meaningful foundation model evaluation for structured electronic health records

FoMoH:针对结构化电子健康记录的具有临床意义的基础模型评估

Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

机构 * Department of Biomedical Informatics Columbia University(生物医学信息学系 哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建含14项临床预测任务的基准,评估6种EHR基础模型,发现其在标注数据有限时区分性能更优、群体公平性更好,但低患病率场景表现差、跨机构可迁移性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07322 2026-08-06 cs.CL cs.AI 版本更新 84%

FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation

FinRpt:用于权益研究报告生成的数据集、评估系统及基于大语言模型的多智能体框架

Song Jin, Shuqi Li, Shukun Zhang, Rui Yan

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文首次明确权益研究报告生成任务,推出含数据集、评估系统的FinRpt基准,提出多智能体框架FinRpt-Gen,实验验证其有效性,相关代码与数据集公开。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22774 2026-08-04 cs.LG cs.AI cs.HC 版本更新 84%

CogAdapt: Adapting Clinical ECG Foundation Models for Wearable Cognitive Load Assessment

CogAdapt: 通过导联适应将临床心电图基础模型迁移至可穿戴认知负荷评估

Amir Mousavi, Erfan Nourbakhsh, Mohammad Sadegh Sirjani, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles

机构 * Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校) Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出CogAdapt框架,通过可学习适配器LeadBridge将3导联可穿戴信号转换为12导联表示,并结合渐进微调策略ProFine,实现临床心电图基础模型向可穿戴认知负荷评估的迁移,在跨受试者验证中显著优于从头训练的基线模型。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 84%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05554 2026-07-22 cs.CL cs.AI 版本更新 84%

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

提示鲁棒性取决于任务:在大语言模型评估中比较客观和信念风格问题

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Sagnik Ray Choudhury, Atriya Sen

机构 * Oklahoma State University(俄克拉荷马州立大学) University of North Texas(北德克萨斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示鲁棒性,比较客观与主观问题,在多个数据集上评估四个模型家族,通过多种提示更改及特定方程分析,发现提示鲁棒性取决于问题类型、提示变化和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 84%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 84%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(title);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10029 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出

Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han

机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) Guangzhou University(广州大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08803 2026-07-16 q-bio.QM cs.AI cs.LG 版本更新 84%

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

TheBioCollection:用于生物学的统一预训练规模语言模型语料库

Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

机构 * Trillion Labs KAIST(韩国科学技术院) SK Biopharmaceuticals Co., Ltd.(SK生物制药公司) Lunit Inc.(Lunit公司) AIGEN Sciences Inc.(AIGEN科学公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 为满足生物学大语言模型训练需求,提出TheBioCollection语料库,整合异构生物资源并丰富记录、引入新任务,配对TheBioCollection-Eval评估,固定架构训练后模型在各领域表现提升,语言能力基本不变。

详情

展开后加载摘要…

URL PDF HTML 收藏