arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 117 篇

2607.24573 2026-07-28 cs.AI 新提交 92%

LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

LLM - 足球竞技场:在体育领域的现实世界预测中对大语言模型进行基准测试

Jonas Schröder, Jonas Schweisthal, Oliver Müller, Markus Weinmann, Stefan Feuerriegel

机构 * MCML & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) Paderborn University(帕德博恩大学) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在评估大语言模型预测现实世界体育赛事的能力,核心方法是引入LLM - 足球竞技场这一前瞻性实时基准,通过对2026年世界杯的评估,详细分析模型性能各维度表现,为LLMs预测性能提供新证据及开源平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 92%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23088 2026-07-28 cs.CR cs.AI 新提交 91%

Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性

Lixun Ma, Ruolong Ma, Bei Wang, Feng Wei, Zhenguang Liu, Lorenzo Cavallaro, Wentao Chen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22969 2026-07-28 cs.IR 新提交 91%

When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness

少样本提示何时起作用?跨模型规模、架构和输出解析鲁棒性的样本数量效应的系统实证研究

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究少样本提示中样本数量与模型规模、架构及输出格式合规性对分类性能的影响。通过对五个LLM在六种样本数量配置下研究,发现样本数量与分类性能关系非单调、非普遍且不能仅由模型规模预测,还纠正了影响Llama 3.3 70B性能的解析工件。

Comments 12 pages, 4 figures, 8 tables. Code available at https://github.com/a-dwivedi/few-shot-prompting-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23344 2026-07-28 cs.CL cs.LG 新提交 91%

BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

基于BERT的模型与大语言模型在低资源命名实体识别中的比较研究:以马拉地语为例

Hariom Ingle, Ronit Ghode, Ishwari Gondkar, Jidnyasa Harad, Raviraj Joshi

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs(L3Cube实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究比较基于BERT的模型与大语言模型在马拉地语低资源命名实体识别中的表现,通过在MahaNER数据集上微调MahaBERT-v2并与基线及通用模型对比,发现特定任务模型效果更佳,凸显专用架构对低资源语言处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23765 2026-07-28 cs.LG cs.AI 新提交 90%

WISERouter: LLM Routing with Workload Budget Constraint

WISERouter:具有工作负载预算约束的大语言模型路由

Yifei Li, Zihui Gao, Laks V. S. Lakshmanan

机构 * The University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模使用LLMs成本高的问题,将LLM路由建模为约束上下文多臂老虎机问题,提出WISERouter框架,支持离线和在线学习。证明WR-Online有次线性遗憾界,实验表明WR-Offline性能超基线且更守预算,WR-Online用较少探索数据达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23121 2026-07-28 cs.IR cs.CL cs.LG 新提交 90%

SMART: LLM-Augmented Hybrid Retrieval for Dynamic Product Ads

SMART:用于动态产品广告的大语言模型增强混合检索

Congfei Zhang, Jingxiao Ma, Xiaodong Liu, Hsiang-wei Chao, Siman Wang, Ge Liu, Shantanu Aggarwal, Vincent Zhang, Meghana Missula, Rachel Liao, Zichu Li, Xiao Bai, Yunzhi Zhou, Yajun Wang, Zhe Liu, Jinchao Li, Yu Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究动态产品广告中重定向和开拓新客户的平衡问题,提出SMART方法,通过规则与LLM生成查询结合及质量门控管理成本,经实验验证,该方法有效提升广告转化率,降低LLM成本。

Comments To be published in the 20th ACM Conference on Recommender Systems (recsys'26), September 27 - October 2, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00918 2026-07-28 cs.CL cs.AI cs.LG 版本更新 90%

LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models

LIBMoE:一种用于大规模语言模型混合专家全面基准测试的库

Nam V. Nguyen, Thong T. Doan, Luong Tran, Van Nguyen, Quang Pham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LibMoE为大规模语言模型混合专家提供统一框架,通过全面分析路由动态、初始化影响及训练模式差异,推动MoE研究标准化与创新。

Comments 40 pages

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23538 2026-07-28 cs.CL 新提交 89%

Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Khan Md Hasib, Jubayer Al Mahmud, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) The University of New South Wales(新南威尔士大学) Jashore University of Science and Technology(贾绍尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)

AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17636 2026-07-28 cs.CL 版本更新 89%

Measuring Negative Campaigning across Languages with Large Language Models: A Study of 18 Million Tweets in 19 Countries

使用大语言模型衡量跨语言的负面竞选活动:对19个国家1800万条推文的研究

Victor Hartman, Petter Törnberg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 该研究利用大语言模型对19个国家1800万条推文进行分析,评估其用于负面竞选跨语言分类的可行性。通过此方法进行跨国研究,基于战略激励框架得出不同类型政党负面竞选程度不同的结论,为相关研究提供新证据并展示了大语言模型的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 88%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 88%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11586 2026-07-28 cs.CL cs.CY 88%

Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models

调查回应生成:利用大语言模型生成闭合式调查回应

Georg Ahnert, Anna-Carolina Haensch, Barbara Plank, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学学院公园分校) GESIS Cologne(科隆社会研究所) CSH Vienna(维也纳认知科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了不同调查回应生成方法对模拟调查回应的影响,发现受限生成方法效果最佳,推理输出不总能提升对齐度。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17052 2026-07-28 cs.CL 版本更新 88%

PReSS: An Automated Black-Box Framework for Evaluating Political Stance Stability in LLMs

PReSS:通过论证压力评估LLM中政治立场稳定性的黑盒框架

Shariar Kabir, Kevin Esterling, Yue Dong

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of California Riverside(加州大学河滨分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PReSS通过评估LLM在不同话题下的立场稳定性,揭示了模型政治立场的动态变化,为理解和干预政治敏感行为提供新视角。

Comments 13 pages, 8 figures

Journal ref In Proceedings of the 3rd Workshop on Natural Language Processing for Political Sciences (PoliticalNLP 2026) @ LREC 2026 (pp. 234-247)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22883 2026-07-28 cs.SE cs.AI cs.LG 新提交 88%

Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

评估和减轻大语言模型生成单元测试中错误代码的误导效应

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型生成单元测试时错误代码的误导效应,提出新指标衡量,分析其双重影响,引入基于规范的单元测试生成范式,有效减少误导性测试,增加有效测试,改善测试生成管道,适用于各类代码。

Comments 24 pages, 7 figures, 12 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA113

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21344 2026-07-28 cs.CL cs.AI cs.CV cs.LG cs.MA 88%

Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

超越单图:多图表问答的基准测试

Azher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PolyChartQA数据集,用于评估多图表问答性能,通过九种先进多模态语言模型测试,发现人类生成问题的LLM准确率下降27.4%,而本文提出的提示方法提升了5.39%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22653 2026-07-28 cs.AI 新提交 87%

Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation

语言模型会收敛到自身吗?递归自精炼作为文本松弛

Xuening Wu, Qianya Xu, Yanlan Kang, Zeping Chen, Yubin Liu, Shenqin Yin

机构 * Pfizer(辉瑞公司) University of California San Diego(加利福尼亚大学圣地亚哥分校) Institute for Medical Philosophy and Future Artificial Intelligence(医学哲学与未来人工智能研究所) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 研究大语言模型递归自精炼工作流程的长期动态。通过生成精炼轨迹并分析多种指标,发现轨迹迅速饱和,编辑多在前几次迭代,确定性解码表现更好,平均编辑幅度呈指数松弛,收敛摘要有多种优势,支持动态系统观点并推动停止标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 87%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22949 2026-07-28 cs.IR 新提交 87%

Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction

超越精确匹配:评估方法如何在基于大语言模型的产品属性提取中主导模型选择

Ayush Dwivedi, Ashvi Soni

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于大语言模型的产品属性提取中评估方法的影响,通过在MAVE基准上对比两种模型的四种提示策略,用精确和模糊匹配评估预测并审计标签,发现评估方法产生的方差远超模型和提示策略选择,且基准有一定噪声率,得出评估方法和数据质量主导模型选择等结论。

Comments 9 pages, 3 figures, 8 tables. Preprint under review. Code available at https://github.com/a-dwivedi/llm-product-attribute-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10400 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 87%

Designing Service Systems from Textual Evidence

从文本证据设计服务系统

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PP-LUCB算法,通过结合LLM代理评分与逆倾向加权残差,有效解决服务系统配置选择中的偏见问题,实现高置信度与低成本审计的平衡。

Comments This submission is withdrawn because it duplicates arXiv:2601.21471 by the same authors. The expanded manuscript was submitted as a new entry instead of as a replacement, so the same paper is now indexed twice. No results, proofs, or data are retracted. The current version is maintained as a replacement of arXiv:2601.21471, which readers should cite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24174 2026-07-28 cs.CR 新提交 87%

Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection

只是测试,继续前进:通过提示注入规避基于大语言模型的系统日志解释

Max Landauer, Florian Skopik, Markus Wurzenberger, Franciszek Górski, Mateusz Krzysztoń

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的系统日志解释中提示注入攻击问题,提出评估框架,利用真实攻击日志痕迹创建对抗示例,证明攻击可致恶意日志误分类,且LLMs解释含对抗指标可用于检测攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交 87%

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21799 2026-07-28 cs.CL cs.CY 版本更新 86%

Agentic Evaluation of Copyright Law Compliance

版权法合规性的智能体评估

Zheng Hui, Doni Bloomfield, Noam Kolt

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24688 2026-07-28 cs.DB cs.CL cs.LG 新提交 86%

Beyond Scale and Generation: Understanding Language Model-based Entity Matching

超越规模和生成:理解基于语言模型的实体匹配

Zeyu Zhang, Xue Li, Iacer Calixto, Paul Groth, Sebastian Schelter

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究基于语言模型的实体匹配,通过控制因子研究Qwen3家族的多种架构、变体和大小,评估跨数据集可迁移性与计算成本,明确模型变体对双编码器的关键作用,以及不同匹配器架构性能差异因素,推动相关研究与基准设计发展。

Comments 12 pages, 6 figures, 7 tables. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24339 2026-07-28 cs.AI cs.CL 新提交 86%

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证

Dushyant Sharma

机构 * Gubernaut Research(Gubernaut研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。

Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23710 2026-07-28 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

The Illusion of Secure LLM Code: Closing the Security Gap via Iterative Reprompting

安全大语言模型代码的幻觉:通过迭代重新提示缩小安全差距

Ishpuneet Singh, Shreyas Mahajan, Gurjot Singh, Maninder Singh

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型集成到软件开发中自主生成安全认证代码的能力,通过双模式评估框架结合四种提示策略评估五个AI编码助手,发现当前助手不能默认生成安全应用,企业部署需转向持续、标准驱动的验证管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交 85%

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22898 2026-07-28 cs.SE cs.CL 新提交 85%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 85%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23505 2026-07-28 cs.NE 新提交 85%

Benchmarking Zero-Shot LLM-Generated Parent Selection in Genetic Programming for Symbolic Regression

用于符号回归的遗传编程中零样本大语言模型生成的亲本选择基准测试

Hengzhe Zhang, Qi Chen, Bing Xue, Wolfgang Banzhaf, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究符号回归遗传编程中零样本大语言模型生成亲本选择算子,在标准框架内对八个模型进行基准测试,比较不同模型生成算子在多个回归基准上的表现,发现Claude Sonnet~4.6和Gemini~3.1 Pro表现出色,证明零样本合成是可行方法。

Comments Accepted at PPSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏