arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 17 篇

2603.07053 2026-07-22 cs.AI cs.SY eess.SY 版本更新 90%

Animating Petascale Time-varying Data on Commodity Hardware with LLM-assisted Scripting

在消费级硬件上利用LLM辅助脚本动画化exascale时变数据

Ishrat Jahan Eliza, Xuan Huang, Aashish Panta, Alper Sahistan, Zhimin Li, Amy A. Gooch, Valerio Pascucci

机构 * University of Utah(犹他大学) Vanderbilt University(范德比大学) ViSOAR LLC

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个用户友好的框架,用于在消费级工作站上生成exascale时变数据的3D动画,通过通用动画描述符、高效数据访问、定制渲染系统和LLM辅助交互接口,使非可视化专家科学家能快速生成高质量动画。

Comments ©2026 IEEE. Personal use of this material is permitted. 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. N.B. Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the original PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15176 2026-07-22 cs.AI cs.CL cs.HC 版本更新 88%

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

用于科学可视化素养的多模态大语言模型基准测试

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究对六个多模态大语言模型进行科学可视化素养基准测试,涵盖多种技术和任务类型。通过封闭世界协议评估闭源和开源模型,与人类参与者数据对比。发现模型表现不均,Gemini最强,开源模型低于人类基线,明确SciVis素养对评估多模态AI系统的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17384 2026-07-22 cs.AI cs.LG cs.LO cs.MA 版本更新 88%

Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift

量化思维多样性:加权大语言模型集成提升的预测定律

Junade Ali

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究量化思维多样性在大语言模型集成中提升效果的预测定律,通过原理推导得出计算提升的启发式方法及相关指标,经多基准测试验证,该方法能有效预测集成性能,且准确性调整后的指标表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22324 2026-07-22 cs.LG cs.MA 版本更新 85%

Automatic Construction of Clinical Scoring Systems with LLM Agents

基于LLM代理的临床评分系统自动构建

Silas Ruhrberg Estévez, Christopher Chiu, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.LG

AI总结 提出AgentScore方法,利用大语言模型进行语义引导的规则搜索与验证,自动构建符合临床部署约束的加权评分系统,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18302 2026-07-22 cs.LG 新提交 83%

A Better Start for Language Models: Domain-Conditional Position Offsets

语言模型的更好开端:领域条件位置偏移

Ye Qiao

专题命中 领域大模型 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究针对自回归语言模型序列开头冷启动惩罚问题,提出领域条件位置偏移方法,通过添加单个学习向量减少困惑度,在多模型上效果显著,且具有轻量级、可热切换特点,能改善检索重排等,是短域内评分和校准的有效工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17467 2026-07-22 cs.CR cs.CL 版本更新 83%

PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents

PARSE: 面向专业领域LLM Agent的溯源感知检索净化

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL

AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24302 2026-07-22 cs.CL 版本更新 83%

ScienceMeter: Tracking Scientific Knowledge Updates in Language Models

科学计量器:追踪语言模型中的科学知识更新

Yike Wang, Shangbin Feng, Yulia Tsvetkov, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型科学知识易过时问题,引入科学计量器框架,定义知识保留、获取、预测三个指标,通过主张判断和生成任务,在十个领域数据集上评估五种知识更新方法,发现提升科学知识更新机制关键且具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19181 2026-07-22 cs.CL cs.AI cs.LG 新提交 81%

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

翻译前推理:用结构化推理增强法律机器翻译

Aixiu An, Michael Jungo, Eloi Eynard, Mark Drenhaus, Andreas Fischer, Jean Hennebert, Sébastien Rumley

专题命中 领域大模型 :SFT(abstract,comments);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究法律领域神经机器翻译难题,通过比较多种方法,评估小型语言模型在不同再训练范式下的表现,以瑞士法律系统为测试平台,发现强化学习效果好,增强小型模型接近前沿推理模型,再训练范式随模型规模收益递减。

Comments Code available at https://github.com/aixiuxiuxiu/Legal-MT-SFT-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18825 2026-07-22 cs.CL cs.AI cs.IR 新提交 73%

AILQA: Evaluating AI-Driven Legal Question Answering Systems for the Indian Legal System

AILQA:评估适用于印度法律体系的人工智能驱动的法律问答系统

Shubham Kumar Nigam, Shubham Kumar Mishra, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

机构 * Indian Institute of Technology(印度理工学院) Symbiosis Law School(共生法学院) Indian Institute of Science Education and Research(印度科学教育与研究学院) University of Birmingham(伯明翰大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对印度法律体系开发AILQA系统,利用多种模型应对挑战,通过严格评估强调RAG范式提升答案质量,评估其在标准化测试中的表现,讨论挑战并给出未来研究方向,为增强法律决策支持系统助力。

Comments Accepted in AI and Law Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18725 2026-07-22 cs.CL cs.AI cs.CR 新提交 73%

Find Before You Fine-Tune: A Diagnostic Study of Small LLMs for Cybersecurity QA

在微调之前进行评估:针对网络安全问答的小型语言模型诊断研究

Shaswata Mitra, Subash Neupane, Trisha Chakraborty, Himanshu Tripathi, Sudip Mittal, Aritran Piplai, Shahram Rahimi

机构 * The University of Alabama(阿拉巴马大学) Meharry Medical College(梅哈里医学院) Mississippi State University(密西西比州立大学) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全问答选择小型语言模型难的问题,提出FiT诊断框架,从三方面刻画模型。通过对五个模型在两种微调模式下研究发现微调利弊因模式而异,预微调FiT分数可预测变化,能筛选模型、避免不必要微调,支持安全部署。

Comments 8 pages, 5 figures, 4 tables, IEEE ICMLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18460 2026-07-22 q-bio.NC cs.AI 新提交 70%

Competitive and Complementary Tools

竞争与互补工具

David C. Krakauer

机构 * Santa Fe Institute(圣菲研究所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人类将思维外化于工具的现象,把智能体、工具和任务建模为动力系统,探讨能力与依赖的共同进化及双稳态,经多数据集测试,结果重塑了工具构建、人工智能部署及抗工具教育的方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19075 2026-07-22 math.OC cs.AI cs.CY 新提交 70%

From Operations to Elderly Care Outcomes: A Thematic Review of Industrial Engineering and Decision-Support Approaches

从运营到老年护理结果:工业工程与决策支持方法的主题综述

Shayan Farhang Pazhooh, Fereshteh Parvaresh

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 全球老龄化给医疗带来挑战,本文对运筹学与老年护理交叉研究综述,指出方法从静态向动态随机演变,存在转化差距,提出概念框架,强调利用新兴技术弥合理论与患者健康结果差距。

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18519 2026-07-22 cs.AR 新提交 67%

A Progressive Approach to Synthesizable RTL Design Generation Using LLMs

一种使用大语言模型生成可综合 RTL 设计的渐进式方法

Xiangfei Kong, Tasnim Tabassum, Marwan Abdelwahab, Hao Zheng

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究利用大语言模型从自然语言规范生成RTL设计时的问题,提出VeriRefine方法,将规范细化为明确描述并审核,生成代码后分类修复模拟失败,提升功能正确性,使可合成性成为结构属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19234 2026-07-22 cs.LG 新提交 57%

In-Context Time Series Classification with Random Convolutional Features

基于随机卷积特征的上下文时间序列分类

Joscha Cüppers, Jilles Vreeken

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 研究时间序列分类,提出MASHT方法,结合MultiRocket和Hydra特征与预训练表格基础模型,绕过特定任务模型训练,在单变量任务中匹配最先进基线,多变量数据集上竞争力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18828 2026-07-22 cs.AI 新提交 57%

Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety

在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性

Koyar Afrasyab

机构 * Kinvectum AB(金维图姆公司)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。

Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17719 2026-07-22 cs.AI cs.MA 版本更新 57%

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation

SR-Agent:一种用于电子商务推荐中排序后策略优化的经验驱动智能框架

Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

机构 * Kuaishou Technology(快手科技)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 电商推荐系统中,后排序策略因环境变化需优化,以往方式存在问题。本文提出SR-Agent框架,统一用户模拟、分析和策略优化组件,经快手平台测试,能提升订单量、浏览深度和点击类别多样性,还缩短优化周期、降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10895 2026-07-22 cs.HC cs.RO 版本更新 50%

Teaching Robots to Interpret Social Interactions through Lexically-guided Dynamic Graph Learning

通过词法引导的动态图学习教授机器人解读社交互动

Tongfei Bian, Mathieu Chollet, Tanaya Guha

机构 * University of Glasgow(格拉斯哥大学)

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出了一种名为SocialLDG的多任务学习框架,通过动态图学习建模状态之间的动态关系,实现了在人类-机器人社交交互数据集上的最佳性能,并支持任务扩展和时间影响分析。

Comments We have expanded on this study further, and a new paper covering all the findings will be published shortly

详情

展开后加载摘要…

URL PDF HTML 收藏