Evaluating Text Summaries Generated by Large Language Models Using OpenAI's GPT
专题命中 其他LLM :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 5 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 其他LLM :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 5 figures
专题命中 其他LLM :language model(title,abstract);large language model(title)
专题命中 其他LLM :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
Comments arXiv admin note: text overlap with arXiv:2402.01817 (v2 add creative commons attribution to Figure 2 graphic)
Journal ref Annals of The New York Academy of Sciences; March 2024
专题命中 其他LLM :language model(title,abstract);large language model(title)
Comments Accepted in the New Ideas and Emerging Results Track at ICSE 2024
专题命中 其他LLM :language model(title,abstract);small language model(title)
专题命中 其他LLM :language model(title,abstract);large language model(title)
专题命中 其他LLM :large language model(title);language model(title);LLM(abstract)
Comments CHI LBW 2022
分析多模态大语言模型代理在城市感知中生成解释的角色效应
机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) ; University of Toronto(多伦多大学)
专题命中 其他LLM :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。
Comments 17 pages, 9 figures
我们要玩一场游戏吗?用于开放式兵棋推演的语言模型
专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。
Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)
HELIOS:一个由大语言模型驱动的自主间接轨迹优化智能体
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究低推力轨迹优化面临的问题,提出基于大语言模型的HELIOS智能体,能自主进行PMP符号推导等。其创新包括约束自适应推导框架等,实验表明可解决多种轨迹优化问题,验证了模型无关架构及模型规模与推导能力的正相关。
用于保护大语言模型生成的C代码的工具引导检索增强修复
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。
CityBehavEx:一个可扩展且经过实证验证的基于大语言模型的城市模拟平台
机构 * UTFPR(巴拉那联邦理工大学) ; Inria(法国国家信息与自动化研究所) ; University of Toronto(多伦多大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 CityBehavEx平台针对基于大语言模型的城市模拟器扩展成本高和验证薄弱问题,结合人类出行模型与交叉编码器,实现大规模模拟,能生成更贴合现实的出行模式,还允许用户进行多种操作及验证。
Comments 10 pages, 3 figures
用于前端设计中电子设计自动化的大语言模型:挑战与机遇
机构 * Chair of Electronic Design Automation, Technical University of Munich(电子设计自动化教授团,慕尼黑技术大学) ; Resource-Efficient AI Group, Technical University of Ilmenau(高效人工智能小组,伊门豪技术大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 探讨芯片前端设计瓶颈下,大语言模型在电子设计自动化中的潜力,回顾其在前端设计关键任务及流程中的进展,讨论集成大语言模型到EDA面临的挑战与限制,概述未来机遇,为相关研究提供系统视角。
Comments Invited paper at the ACM/IEEE DAC 2026 Special Research Session, 5 pages, 9 figures
通过多格式训练提升语言模型的跨格式鲁棒性
机构 * Ant Group(蚂蚁集团) ; International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))
专题命中 其他LLM :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL
AI总结 提出FormatMix方法,通过将部分训练数据扩展为多种等价格式,显著提升大语言模型在不同答案格式下的一致性,仅需30%数据即可接近全格式训练效果。
LLM单词工厂内部
机构 * Stein Faculty of Computer and Information Science(Stein计算机与信息科学学院)
专题命中 其他LLM :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 通过激活修补实验,定位Llama2-7B中英语去分词化过程为第1层的两阶段机制:注意力传递非最终子词的令牌特定信号,MLP将其与局部嵌入组合。该结构泛化至八族十二模型,但深度取决于位置编码类型。
Comments 17 pages, 12 figures. Under review at EMNLP 2026
是什么让两个语言模型思考相似?
机构 * UNICOG ; CNRS(法国国家科学研究中心) ; INSERM(法国国家健康与医学研究院) ; CEA(法国原子能委员会) ; Paris-Saclay University(巴黎-萨克雷大学) ; LSCP(语言科学研究中心) ; EHESS(高等科学研究所) ; ENS(巴黎高等师范学校) ; PSL University(巴黎科学哲学大学)
专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本文研究了语言模型表示和处理语言的方式是否受架构和训练差异影响,提出了一种新的方法来量化模型间相似性和差异性,并发现模型相似性主要由发布日期和模型家族决定。
Comments 25 pages, 13 figures
历史锚点:先前行为如何引导大语言模型走向不安全行为
机构 * Independent Researcher(独立研究员)
专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI
AI总结 研究通过100个高风险领域场景,探讨先前有害行为对LLM决策的影响,发现添加特定指令可显著增加不安全选择比例,揭示了代理部署中轨迹可被篡改的风险。
Comments 12 pages, 3 figures
重新思考基于LLM的软件工程代理生成测试的价值
机构 * Singapore Management University(新加坡管理大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究探讨了LLM软件工程代理生成测试的有效性,发现测试主要作为反馈渠道,而非提升问题解决效果。
Once4All: 基于骨架引导的SMT求解器模糊测试与LLM合成生成器
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Once4All通过LLM合成生成器生成可重用的逻辑表达式,解决传统模糊测试中生成公式语法无效和计算开销大的问题,有效发现SMT求解器中的43个已确认bug。
Comments Accepted at ASPLOS 2026
分析用于LLM辅助3D场景操作的多模态交互策略
机构 * University of Cambridge(剑桥大学) ; Coburg University of Applied Sciences(科堡应用科学大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过实证研究揭示LLM辅助3D场景编辑系统中的交互模式与关键障碍,提出改进自然语言界面的设计建议,证明LLM辅助交互系统在沉浸环境中的有效性。
Comments Published in the IEEE VR (IEEE Conference on Virtual Reality and 3D User Interfaces) 2025 Proceedings
关于基于LLM的程序修复中故障定位上下文的作用
机构 * York University(约克大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究探讨了LLM基于程序修复中故障定位上下文的影响,发现文件级上下文对修复性能提升显著,而元素级和行级上下文效果不一,LLM检索优于传统方法。
Comments 30 pages, 8 figures
对冲与非肯定:量化大语言模型在人权问题上的对齐
机构 * Google Deepmind(谷歌DeepMind) ; Massachusetts Institute of Technology(麻省理工学院) ; Independent Researcher(独立研究员) ; Google(谷歌) ; AI Accountability Lab, Trinity College Dublin(都柏林圣三一学院人工智能问责实验室)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究通过系统框架量化LLM在不同群体身份上的对冲与非肯定行为,发现群体身份是主要影响因素,通过引导和正交化技术可有效缓解偏差。
Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型
机构 * FNii-Shenzhen(FNii-深圳) ; SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) ; Meshy AI
专题命中 其他LLM :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。
TRACE-Bot:通过隐式语义表示和AIGC增强的行为模式检测新兴的LLM驱动社交机器人
机构 * Sichuan University(四川大学) ; Peking University(北京大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出TRACE-Bot框架,通过联合建模隐式语义表示和AIGC增强的行为模式,有效检测新兴LLM驱动社交机器人,实验表明其在两个公开数据集上达到98.46%和97.50%的准确率。
无偏语言模型以不自然的方式学习:LLM如何无法区分可能与不可能
机构 * Tel Aviv University(特拉维夫大学) ; Ecole Normale Supérieure(巴黎高等师范学院) ; Earth Species Project(地球物种项目) ; EHESS, PSL University, CNRS(法国社会科学高等研究院、巴黎文理研究大学、法国国家科学研究中心)
专题命中 其他LLM :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
AI总结 研究发现GPT-2在学习自然语言和不可能语言时表现相似,反驳了LLM具备区分能力的假设,表明其学习过程无系统性区分。
Comments 15 pages, 4 figures
大语言模型能否像语言学家一样识别口音?
机构 * Department of Computer Science, University of Bonn(波恩大学计算机科学系) ; Research Center Deutscher Sprachatlas, Marburg University(马尔堡大学德语语言地图研究中心) ; Bonn-Aachen International Center for Information Technology, University of Bonn(波恩大学波恩-亚琛国际信息技术中心) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究大语言模型在识别口音方面的能力,对比了LLM与HuBERT等模型的性能,并提供LLM和人类语言学家的基线方法。
Comments Accepted to DialRes Workshop @ LREC 2026
将LLM嵌入用于人类基因组的变异
机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) ; Division of Cancer Epidemiology and Genetics, National Cancer Institute(美国国家癌症研究所癌症流行病学与遗传学部门) ; Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院生物统计学系)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文首次系统性地生成全人类基因组层面的遗传变异嵌入,利用FAVOR、ClinVar和GWAS Catalog的注释,构建了89亿可能变异的功能文本描述,并生成三种尺度的嵌入,用于基因组变异的结构化表示和风险预测。
TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他LLM :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG
AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。
Comments CVPR2026
AI生成的代码不可重复(尚且):对基于LLM的编码代理依赖差距的实证研究
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文实证研究了基于LLM的编码代理生成代码的可重复性,发现仅68.3%的项目能在干净环境中成功执行,且不同语言存在显著差异,同时发现依赖项存在显著隐藏依赖。
基于大语言模型的智能体是否表现出参与机制?信息负荷、描述性规范和流行度线索的受控测试
机构 * Department of Communication, Michigan State University(密歇根州立大学通讯系) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过社交媒体信息负荷和描述性规范的受控实验,探讨基于大语言模型的智能体参与机制,发现参与度受信息负荷和规范影响,流行度线索的敏感性因情境而异,强调方法论对模拟通信研究的影响。