arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5898 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1404 篇

2506.08359 2026-07-14 cs.CL 版本更新 90%

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

REAL:在语言模型引导中读取Transformer激活以进行精确定位

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究旨在在不改变LLM参数的情况下引导其响应,核心挑战是识别关键内部模块。提出REAL框架,通过训练VQ - AE划分潜在空间,量化模块行为相关性来指导模块选择与引导强度。实验表明该方法能有效干预,提升真实性引导效果且具零样本泛化能力。

Comments need full paper rebuilding

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17476 2026-07-09 cs.CL 版本更新 90%

Zoom In Disparities in Healthcare LLM Q&A

放大医疗保健语言模型问答中的差异

Ipek Baris Schlicht, Burcu Sayin, Zhixue Zhao, Frederik M. Labonté, Cesare Barbera, Marco Viviani, Paolo Rosso, Lucie Flek

机构 * Universitat Politècnica de València(瓦伦西亚理工大学) University of Trento(特伦托大学) University of Sheffield(谢菲尔德大学) Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息科技国际中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) University of Pisa(比萨大学) University of Milano-Bicocca(米兰-比可卡大学) ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言医疗保健问答中LLM的跨语言差异,构建多语言数据集,分析覆盖范围与响应对齐,通过案例研究发现差异显著,非英语维基百科上下文摘录可改善事实对齐,为构建公平多语言医疗AI系统提供途径。

Comments It is accepted to NLDB 2026: The paper can be accessed at https://link.springer.com/chapter/10.1007/978-3-032-29532-3_12

Journal ref NLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02509 2026-07-07 cs.CL 版本更新 90%

When Rating Scales Fall Short: LLM-Assisted Discovery of ADHD Signals in Turkish Teacher Narratives

当评分量表不足时:LLM辅助发现土耳其教师叙述中的ADHD信号

Baris Karacan, Irem Aktar Songur, Ahmet Ozaslan, Elvan Iseri

机构 * Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Department of Child and Adolescent Psychiatry, Gazi University(加齐大学儿童与青少年精神病学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析土耳其教师评估表中的结构化评分和开放式叙述,利用大语言模型辅助的主题发现方法,揭示了叙述文本中未被结构化量表捕捉的ADHD互补信号。

Comments 15 pages. Accepted to CLPsych 2026. Camera-ready author version. The final version will appear in the ACL Anthology

Journal ref In Proceedings of the 10th Workshop on Computational Linguistics and Clinical Psychology (CLPsych 2026), pages 368-382, San Diego, California, USA, 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 90%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00804 2026-06-25 cs.CR cs.AI cs.DB 版本更新 90%

Epistemic Bias Injection: Manipulating LLM Opinion via Selective Context Retrieval

认知偏见注入:通过选择性上下文检索操纵LLM观点

Hao Wu, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过检索增强生成(RAG)数据库注入事实正确但认知偏见的段落,以操纵LLM输出立场,并提出基于几何度量的攻击与防御方法BiasDef。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16131 2026-06-24 cs.CL 版本更新 90%

SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

SciZoom:面向LLM时代的大规模层次化科学摘要基准

Han Jang, Junhyeok Lee, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University Hospital(首尔国立大学医院) Seoul National University College of Medicine(首尔国立大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对LLM时代科学摘要的多粒度需求,构建了包含2020-2025年四大ML顶会44946篇论文的基准,提供摘要、贡献和TL;DR三层摘要,压缩比达600:1,并揭示LLM辅助写作导致短语模式剧变和修辞风格同质化。

Comments 14 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21438 2026-06-23 cs.CL 版本更新 90%

PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

PROMPT2BOX: 揭示LLM提示间的蕴含结构

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang

机构 * CICS, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机信息科学中心) Amazon AWS AI(亚马逊AWS人工智能) A10 Networks(A10网络)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PROMPT2BOX方法,通过盒嵌入空间捕捉提示间的特异性关系,并开发降维技术,在层次聚类中比向量基线多发现8.9%的LLM弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08552 2026-06-19 cs.DB cs.AI 版本更新 90%

Automated Standardization of Legacy Biomedical Metadata Using an Ontology-Constrained LLM Agent

使用本体约束的LLM代理自动化标准化遗留生物医学元数据

Josef Hardi, Martin J. O'Connor, Marcos Martinez-Romero, Jean G. Rosario, Stephen A. Fisher, Mark A. Musen

机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25652 2026-06-17 cs.CL cs.CY 版本更新 90%

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

LLM评审员与律师协会考官对泰国律师资格考试自由回答论文的两阶段稳定性研究

Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

机构 * VISAI AI(VISAI人工智能)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 通过泰国律师资格考试的自由回答论文评估,研究LLM评审员与人类考官在评分一致性上的不对称性,发现LLM评审员倾向于多数人类阅读而无法复制少数人类阅读。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04574 2026-06-17 cs.CL 版本更新 90%

FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback

FeedEval: 面向教学法的LLM生成作文反馈评估

Seongyeub Chu, Jongwoo Kim, Munyong Yi

机构 * Graduate School of Data Science, KAIST(数据科学研究生院,韩国科学技术院) Department of Industrial & Systems Engineering, KAIST(工业与系统工程系,韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出FeedEval框架,沿特异性、帮助性和有效性三个教学维度评估LLM生成的作文反馈,通过专用评估器筛选高质量反馈,提升下游评分和修订效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18003 2026-06-17 cs.CR cs.AI cs.CY 版本更新 90%

BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?

BadScientist: 研究代理能否写出令人信服但不严谨的论文来欺骗LLM审稿人?

Fengqing Jiang, Yichen Feng, Yuetai Li, Luyao Niu, Basel Alomair, Radha Poovendran

机构 * University of Washington(华盛顿大学) King Abdulaziz City for Science and Technology(卡布斯科学与技术城) HUMAIN

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BadScientist框架,通过无需真实实验的呈现操纵策略生成造假论文,揭示LLM审稿系统存在系统性漏洞,造假论文接受率高达一定水平,且审稿人存在“担忧-接受冲突”,当前检测方法效果有限。

Comments ACL 2026; Project Page at https://bad-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 90%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01365 2026-06-16 cs.AI 版本更新 90%

Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability

多智能体LLM系统中浪费计算资源的早期诊断:基于故障感知的可观测性

Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种故障感知的可观测性框架,通过在线轨迹信号诊断多智能体LLM系统中的浪费计算,并在GAIA验证集上评估,揭示不同故障机制及其与资源消耗的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06143 2026-06-16 cs.CL 版本更新 90%

RoSE: Round-robin Synthetic Data Evaluation for Selecting LLM Generators without Human Test Sets

RoSE: 循环合成数据评估,无需人工测试集选择LLM生成器

Jan Cegin, Branislav Pecher, Ivan Srba, Jakub Simko

机构 * Kempelen Institute of Intelligent Technologies(凯姆佩尔智能技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出RoSE方法,通过训练小模型在候选生成器输出上,并在其他LLM合成样本上评估,以选择最佳LLM生成器,无需人工测试集,在多个语言和任务中优于其他内在启发式方法。

Comments 16 pages; EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01463 2026-06-15 cs.RO cs.AI cs.HC 版本更新 90%

Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Language Feedback for Users with Paralysis

基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人

Keshav Shankar, Dan Ding, Wei Gao

机构 * Electrical and Computer Engineering(电气与计算机工程) Rehabilitation Science and Technology(康复科学与技术)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。

Comments Accepted to IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18636 2026-06-11 cs.SE cs.AI 版本更新 90%

LaQual: An Automated Framework for LLM App Quality Evaluation

LaQual: 一种用于LLM应用质量评估的自动化框架

Yan Wang, Xinyi Hou, Junjun Si, Yanjie Zhao, Weiguo Lin, Haoyu Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LaQual自动化框架,通过静态指标筛选和动态场景评估,实现LLM应用质量评估,与人类判断高度一致,可减少66.7%-81.3%候选应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21816 2026-06-09 cs.LG 版本更新 90%

Nonparametric LLM Evaluation from Preference Data

基于偏好数据的非参数化LLM评估

Dennis Frauen, Athiya Deviyani, Mihaela van der Schaar, Stefan Feuerriegel

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出非参数统计框架DMLRank,通过去偏机器学习从偏好数据中比较和排名大语言模型,引入广义平均排名分数,具有统计高效、兼容黑箱方法、结合预训练评估器和优化数据收集策略等优势。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04874 2026-06-08 cs.CL 版本更新 90%

Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

Agent规划基准:LLM Agent规划能力的诊断框架

Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Skywork AI University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01120 2026-06-08 cs.AI 版本更新 90%

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

诊断基于RAG的事实核查中LLM对证据前认知状态的仲裁行为

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PAVE测试平台,通过将LLM验证器分为四种认知状态,评估其在检索增强生成事实核查中仲裁参数知识与检索证据的能力,发现不可靠且高度依赖模型的仲裁行为,并提出轻量级JSD测试时仲裁方法。

Comments Accepted to ACL-2026 Findings (voluntarily withdraw)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09403 2026-06-08 cs.CL 版本更新 90%

LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation

LLM作为元评判者:用于NLP评估指标验证的合成数据

Lukáš Eigler, Jindřich Libovický, David Hurych

机构 * Faculty of Mathematics and Physics, Charles University(数学与物理系,查尔斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出LLM作为元评判者框架,通过控制语义退化生成合成数据替代人工判断,验证NLG评估指标,在多语言问答中元相关性超过0.9。

Comments 16 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17219 2026-07-31 cs.CL cs.AI quant-ph stat.ME 版本更新 90%

Auditing Question-Order Effects in Large Language Models with the QQ Equality: Mechanism Characterization and a Saturation Caveat

用QQ等式审计大语言模型中的问题顺序效应:机制表征与饱和警告

Pilsung Kang

机构 * Dankook University(韩国檀国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中问题顺序效应,将QQ等式发展为审计标准,理论上表征满足该等式的机制类别,方法上开发审计管道,实验发现强制二元下一个token对数概率不适用于分布级QQ审计,建议进行饱和诊断。

Comments v2: major revision. Five restructured findings separating order sensitivity, QQ imbalance, and residual contextuality; two-layer discriminant table; pipeline figure and per-item joint table; envelope pooling and certified Gamma bounds specified; retrospective batch-1 G3 re-validation (all verdicts preserved). No new pilot measurements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25094 2026-07-30 cs.CL cs.AI 版本更新 90%

Evaluating Communicative Belief Updates in Large Language Models via Implicature Recognition and Cancellation

通过含义识别和取消评估大语言模型中的交际信念更新

Cesare Spinoso-Di Piano, Verna Dankers, Marius Mosbach, Jackie Chi Kit Cheung

机构 * Mila - Quebec AI Institute & McGill University(米拉 - 魁北克人工智能研究所和麦吉尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过创建首个专家注释的含义取消数据集,评估大语言模型识别和理解潜在信念及更新的能力,发现其落后于人类,成功可能源于依赖先验信念,失败取决于类型和形式,表明当前LLMs未达人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01925 2026-07-24 cs.CL cs.AI 版本更新 90%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 90%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22411 2026-06-23 cs.CL cs.AI 版本更新 90%

NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models

NeedleChain: 测量大型语言模型的完整上下文理解能力

Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对现有基准高估LLM上下文理解能力的问题,提出NeedleChain基准,通过全相关上下文测试模型整合所有证据的能力,并引入ROPE收缩策略提升全上下文整合。

Comments ACL2026 - findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31514 2026-06-12 cs.CL cs.AI cs.CY 版本更新 90%

If LLMs Have Human-Like Attributes, Then So Does Age of Empires II

如果LLM具有类人属性,那么《帝国时代II》也具有

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过训练简单神经网络于《帝国时代II》,论证LLM的拟人属性在经验上非唯一,提出应假设LLM非独特性而非拟人属性来设计实验。

Comments Fixed corollary 1, added stat sig

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15727 2026-06-09 cs.LG cs.CL 版本更新 90%

Towards Automated Kernel Generation in the Era of LLMs

面向LLM时代的自动化内核生成

Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Cornell University(康奈尔大学) Beijing Jiaotong University(北京交通大学) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了利用大语言模型(LLM)和智能体系统自动化生成与优化GPU内核的方法,系统梳理了现有方法、数据集和基准,并指出了未来研究方向。

Comments In IJCAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17326 2026-08-20 cs.HC 版本更新 89%

Procedural Collapse: A Structural Account of Disengagement in LLM-Assisted Writing

程序崩溃:大语言模型辅助写作中脱离的结构解释

JaeWon Kim, Katelyn X. Mei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文针对学生使用LLM写作时脱离的问题,提出结构层面解释,指出当前界面引发程序崩溃,给出分解式交互等设计方向以支持AI辅助写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29894 2026-08-19 quant-ph 版本更新 89%

LLM-Guided Evolutionary Search for Algebraic T-Count Optimization

基于LLM的引导进化搜索在代数T计数优化中的应用

Daniil Fisher, Valentin Khrulkov, Mikhail Saygin, Ivan Oseledets, Stanislav Straupe

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出VarTODD方法,通过分离代数重写系统与搜索策略,利用LLM引导的进化算法优化T计数,提升量子电路编译效率。

Comments 13 pages, 5 figures, 2 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07519 2026-08-18 cs.CY 版本更新 89%

From Survey Personas to LLM Agents: A Generative Agent-based Simulation of Mobility Policy Preference Dynamics

从调查画像到大语言模型智能体:基于生成式智能体的流动性政策偏好动态模拟

Ali Torkayesh, Julia Offermann, Regina Gimpel, Linda Engelmann, Katrin Arning, Martina Ziefle, Sandra Venghaus

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于调查的生成式智能体建模框架,将德国514名调查受访者转化为LLM智能体,模拟公众对淘汰新型内燃机汽车的政策偏好动态,以助力行为实验。

详情

展开后加载摘要…

URL PDF HTML 收藏