arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 704 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 704 篇

2607.23037 2026-07-28 cs.CL 新提交 86%

Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating

语音信号补充大语言模型用于预测速配中的人际吸引力

Yuriko Kikuchi, Takato Hayashi, Ryusei Kimura, Naoya Inoue, Ryo Ishii, Shogo Okada

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院) NTT, Inc.(日本电报电话公司)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究利用日语速配对话,结合仅基于转录本的LLM预测与语音预测器预测来估计参与者对约会对象的喜好,发现语音能补充LLM预测,二者结合可提高两两排序准确率,且互补性有条件,还明确了语音预测价值及互补性出现的情况。

Comments Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026). 16 pages total, including a 7-page supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17948 2026-07-21 cs.AI cs.MA 新提交 86%

Towards Agentic Agent-based Models: Feasibility, Performance, and Statistical Model Checking

迈向基于智能体的智能体模型:可行性、性能和统计模型检查

Stefano Blando, Emanuele Guerrazzi, Riccardo Porcedda, Giuseppe Squillace, Max Tschaikowski, Andrea Vandin

机构 * Sant’Anna School of Advanced Studies Pisa(比萨圣安娜高等研究学校) Sapienza University of Rome(罗马第一大学) DTU Technical University of Denmark(丹麦技术大学) University of Pisa(比萨大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究引入大语言模型驱动决策对基于智能体模型模拟的影响,以Mesa ABM模型为对象,扩展谢林隔离模型,通过统计模型检查进行分析,实验表明较小本地服务LLM有问题,较大模型通过初步检查,还探讨了统计模型检查的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16249 2026-07-21 physics.geo-ph cs.AI 新提交 86%

An Agentic Interface for End-to-End Probabilistic Seismic Hazard and Risk Analysis

用于端到端概率地震危险性和风险分析的智能体接口

Sreenath Vemula, Pierre Jehel, Fabrice Cotton, Filippo Gatti

机构 * Université Paris-Saclay, CentraleSupélec, ENS Paris-Saclay, CNRS, LMPS — Laboratoire de Mécanique Paris-Saclay(巴黎-萨克莱大学、中央超导学院、巴黎-萨克莱高等师范学院、国家科学研究中心、LMPS——巴黎-萨克莱力学实验室) GFZ Helmholtz Centre for Geosciences(德国地球科学霍普夫兹中心) University of Potsdam, Institute of Geosciences(波茨坦大学、地球科学学院)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对概率地震危险性和风险分析专家化问题,提出通过开源服务器及MCP构建智能体接口,利用LLM与OpenQuake引擎等协作计算,实现多功能分析,结果与官方值匹配度高且计算快,还能接受自定义GMM并添加新功能,设计层可拓展。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11250 2026-07-14 cs.MA cs.AI 新提交 86%

Multi-Agent LLMs Fail to Explore Each Other

多智能体语言模型无法相互探索

Hyeong Kyu Choi, Jiatong Li, Wendi Li, Xin Eric Wang, Sharon Li

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多智能体系统中LLM智能体相互探索的问题,提出轻量级框架MACE,通过结构化同伴选择促进探索,改善了探索行为和任务性能,凸显当前LLM智能体局限,强调明确引导探索对多智能体自主性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02121 2026-07-03 cs.CR cs.AI 新提交 86%

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

拒绝背后:通过行为监控确定护栏激活

William Hackett, Peter Garraghan

机构 * Mindgard Lancaster University(兰卡斯特大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。

Comments 19 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24667 2026-06-24 cs.CL 新提交 86%

DREAM: Dense Retrieval Embeddings via Autoregressive Modeling

DREAM:通过自回归建模的密集检索嵌入

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DREAM方法,利用冻结LLM的自回归预测损失训练密集检索器,通过注意力机制注入查询-文档相似度,在BEIR和RTEB上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09700 2026-06-23 cs.CR cs.HC cs.LG 新提交 86%

What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks

眼睛所见,大语言模型所不见:利用人类感知进行对抗性文本攻击

Qin Yang, Lu Malloy, Joshua Lee, Xiaohan Chang, Meisam Mohammady, Doowon Kim, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Tennessee(田纳西大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Iowa State University(爱荷华州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM内容审核系统忽视人类视觉线索的缺陷,提出人类可感知对抗攻击(HPAA),通过排版操纵嵌入有害内容,在仅三次查询下实现86%人类识别率而机器检测率低于1%。

Comments This work has been accepted for publication at USENIX Security 2026. This paper includes examples of harmful, hateful, or abusive language for research purposes. Reader discretion is advised

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18154 2026-06-17 cs.AI 新提交 86%

Learning Cardiac Electrophysiology Digital Twins Through Agentic Discovery of Hybrid Structure

通过智能体发现混合结构学习心脏电生理数字孪生

Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,实现个性化心脏电生理数字孪生构建,优于人工设计和其他LLM方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18124 2026-06-17 cs.CL 新提交 86%

Unintended Effects of Geographic Conditioning in Large Language Models

大型语言模型中地理条件化的意外效应

Naz Col, David M. Chan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 本研究评估了大型语言模型在接收地理中立提示时,因用户元数据中的位置信息导致的地理泄露现象,并发现位置占位符“Unknown”本身也会引发泄露,揭示了用户档案框架的生成条件化效应。

Comments To appear at the Second Workshop on Customizable NLP (CustomNLP4U) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17234 2026-06-17 cs.CL 新提交 86%

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

自评之言:论大语言模型在机器翻译中的口头化置信度

Ali Marashian, Alexis Palmer, Katharina von der Wense

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究设计了五种无需内部信号的口头化方法提取LLM逐词置信度,并与内部确定性信号比较,发现两者在细粒度错误检测和校准上表现相似但相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17174 2026-06-17 cs.CL cs.CY cs.MA 新提交 86%

From Parasocial Scripts to Dyadic Persistence in Autonomous AI-Agent Communities

从准社会脚本到自主AI智能体社区中的二元持久性

Mohammadsadegh Abolhasani, Hamid Reza Firoozfar, Reza Mousavi, Paul Jen-Hwa Hu

机构 * University of Utah(犹他大学) University of Virginia(弗吉尼亚大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究自主AI智能体社区中是否存在准社会互动(PSI)线索,通过关键词匹配、少样本LLM标注等方法分析帖子与评论,发现PSI线索与OP再参与及互惠回复结构强相关,并通过二元持久性测试验证了互动层面的PSI脚本与重复二元模式的一致性。

Comments Submitted for review in ARR for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15024 2026-06-16 cs.MA cs.AI cs.SY eess.SY 新提交 86%

Resilient Consensus in Agentic AI

智能体AI中的弹性共识

Sribalaji C. Anand, George J. Pappas

机构 * KTH(瑞典皇家理工学院) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体在多智能体系统中的共识问题,发现经典弹性共识理论在LLM智能体中失效,但结合经典滤波器可改善一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07502 2026-06-08 cs.CL cs.IR 新提交 86%

Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings

你的解嵌入矩阵实际上是文本嵌入的特征透镜

Songhao Wu, Zhongxin Chen, Yuxuan Liu, Heng Cui, Cong Li, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Lenovo Group Limited(联想集团有限公司) Wuhan University(武汉大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 发现LLM文本嵌入与高频词对齐导致语义捕获不足,提出EmbedFilter通过过滤解嵌入矩阵中的高频子空间来增强表示,并实现降维加速检索。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22880 2026-07-28 cs.SE cs.AI cs.LG 新提交 86%

Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

大语言模型生成的测试套件的覆盖度和变异分数与其有效性相关吗?(可重复性研究)

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型生成测试套件时,覆盖度和变异分数与有效性的关系。通过重复研究发现其有用性依赖上下文,在不同场景表现不同,且测试套件大小非主要混杂因素,为评估此类测试生成提供指导。

Comments 24 pages, 4 figures, 14 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA002

URL PDF HTML 收藏
2607.04470 2026-07-07 cs.LG cs.AI math.OC 新提交 86%

Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

大语言模型增强的合作多智能体强化学习的状态条件稳定化

Faid Keddouri, Sohaib Houhou, Aissa Boulmerka, Nadir Farhi

机构 * National School of Artificial Intelligence (ENSIA)(国立人工智能学院(ENSIA)) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型与合作多智能体强化学习集成时训练动态,指出非策略学习中动态更新奖励权重违反平稳假设。提出基于阶段的冻结计划和指数移动平均平滑两种稳定策略并评估,揭示奖励信号平稳性是必要设计约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10338 2026-06-10 cs.CL cs.AI 新提交 86%

Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

路由感知的专家校准用于混合专家语言模型中的机器遗忘

Jingyi Xie, Yijun Lin, Yinjiang Xiong, Zhikun Zhang, Sai Li

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Lightstandard

专题命中 其他LLM :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对MoE模型中遗忘数据与保留数据路由不匹配导致遗忘关键专家正则化不足的问题,提出TRACE方法,通过离线激活统计检测遗忘关键专家并重新加权保留损失以校准保留侧激活频率,实验表明在WMDP和MUSE-BOOKS上遗忘-效用权衡提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14113 2026-08-17 cs.HC 新提交 86%

Search or Chat? Comparing How We Learn About Debated Topics

搜索还是聊天?对比我们如何了解有争议的话题

Ran Yu, Alisa Rieger, Rabia Karatoprak Ersen, Jiqun Liu

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过194人参与的众包实验,对比传统搜索与LLM聊天界面对学习有争议话题的影响,发现工具无显著差异,用户特征对学习结果影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13063 2026-08-14 cs.AI cs.CL cs.LG 新提交 86%

Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)

罕见异常失效下的解释性参与:模型行为中的渐近稀有性(或:渐近式AI)

Sam Mao

专题命中 其他LLM :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探究LLM在低可控失效概率工作流中,解释性参与度随失效渐近稀有性的变化,发现触发结构是关键调节变量,不同模型的异常识别与参与表现存在差异。

Comments 11 figures. Elicitation-condition sweep across three open-weight models (qwen3:8b, llama3.1:8b, mistral:7b); pipeline scripts and experimental data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26591 2026-07-30 cs.SE 新提交 86%

MultiFixer: A Coordinator-Proposer Based Multi-Agent Framework For Fixing Multi-Hunk Bugs

MultiFixer:一种用于修复多块漏洞的基于协调者-提议者的多智能体框架

Haichuan Hu, Chunrong Fang, Ye Shang, Jiawei Liu, Weifeng Sun, Guoqing Xie, Chenxing Zhong, Quanjun Zhang

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对现有LLM-based APR方法难以修复多块漏洞的问题,提出MultiFixer多智能体框架,经多基准测试,其在Defects4J等数据集上达到最优修复效果,能有效修复多块漏洞。

Comments Accepted to 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00445 2026-07-02 cs.HC 新提交 86%

Gaze-Informed Proactive AI Assistance for Children's Picture Exploration

基于注视的主动式AI辅助儿童图画探索

Zekun Wu, Man Su, Huiyong Li, Tomohiro Nagashima, Anna Maria Feit

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Ollie系统,利用儿童注视估计注意力并触发LLM描述相关图画区域,实验表明注视辅助比随机辅助更有效维持注意力并引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25550 2026-06-25 cs.SE 新提交 86%

On the Viability of Requirements Generation From Code: An Experience Report

从代码生成需求的可行性:经验报告

Alexander Korn, Jone Bartel, Max Unterbusch, Andreas Vogelsang

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实验评估基于LLM和RAG的代理方法从源代码生成需求,发现LLM无法可靠生成未实现需求、高质量需求或引入需求气味,且单一人工难以检测气味,表明该方法尚不可行。

Comments Accepted for publication at the 13th International Workshop on Artificial Intelligence and Requirements Engineering (AIRE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18276 2026-06-18 cs.MA cs.SI physics.soc-ph 新提交 86%

Characterizing Opinion Evolution of Networked LLMs

表征网络化大语言模型的意见演化

Caleb Probine, Yigit Ege Bayiz, Filippos Fotiadis, Samuel Li, Yunhao Yang, Ufuk Topcu

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究经典意见动力学模型能否描述多智能体系统中大语言模型(LLM)的意见传播,发现引入偏置项可显著提升建模精度,将平均意见误差降低高达88%。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24051 2026-07-28 astro-ph.IM cs.AI cs.RO 新提交 85%

HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent

HELIOS:一个由大语言模型驱动的自主间接轨迹优化智能体

An-yi Huang

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究低推力轨迹优化面临的问题,提出基于大语言模型的HELIOS智能体,能自主进行PMP符号推导等。其创新包括约束自适应推导框架等,实验表明可解决多种轨迹优化问题,验证了模型无关架构及模型规模与推导能力的正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21641 2026-07-27 cs.SE cs.AI 新提交 85%

Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code

用于保护大语言模型生成的C代码的工具引导检索增强修复

Vidyut Sriram, Saatvik Pradhan, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12086 2026-07-15 cs.CL cs.CY cs.MA cs.SI 新提交 85%

CityBehavEx: A Scalable and Empirically Validated LLM-Assisted Urban Simulation Platform

CityBehavEx:一个可扩展且经过实证验证的基于大语言模型的城市模拟平台

Gustavo H. Santos, Aline Viana, Thiago H Silva

机构 * UTFPR(巴拉那联邦理工大学) Inria(法国国家信息与自动化研究所) University of Toronto(多伦多大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CityBehavEx平台针对基于大语言模型的城市模拟器扩展成本高和验证薄弱问题,结合人类出行模型与交叉编码器,实现大规模模拟,能生成更贴合现实的出行模式,还允许用户进行多种操作及验证。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09616 2026-07-13 cs.ET cs.AR cs.LG cs.SY eess.SY 新提交 85%

LLM for EDA in Front-End Design: Challenges and Opportunities

用于前端设计中电子设计自动化的大语言模型:挑战与机遇

Kangwei Xu, Bing Li, Ulf Schlichtmann

机构 * Chair of Electronic Design Automation, Technical University of Munich(电子设计自动化教授团,慕尼黑技术大学) Resource-Efficient AI Group, Technical University of Ilmenau(高效人工智能小组,伊门豪技术大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 探讨芯片前端设计瓶颈下,大语言模型在电子设计自动化中的潜力,回顾其在前端设计关键任务及流程中的进展,讨论集成大语言模型到EDA面临的挑战与限制,概述未来机遇,为相关研究提供系统视角。

Comments Invited paper at the ACM/IEEE DAC 2026 Special Research Session, 5 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11643 2026-06-11 cs.CL 新提交 85%

Improving Cross-Format Robustness in Language Models with Multi-Format Training

通过多格式训练提升语言模型的跨格式鲁棒性

June M. Liu, Shaomian Zheng, He Cao, Dingnan Jin, Qing Cui, Jun Zhou

机构 * Ant Group(蚂蚁集团) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 其他LLM :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 提出FormatMix方法,通过将部分训练数据扩展为多种等价格式,显著提升大语言模型在不同答案格式下的一致性,仅需30%数据即可接近全格式训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08562 2026-06-09 cs.CL 新提交 85%

Inside the LLM Word Factory

LLM单词工厂内部

Benzi Busigin, Yuval Pinter

机构 * Stein Faculty of Computer and Information Science(Stein计算机与信息科学学院)

专题命中 其他LLM :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 通过激活修补实验,定位Llama2-7B中英语去分词化过程为第1层的两阶段机制:注意力传递非最终子词的令牌特定信号,MLP将其与局部嵌入组合。该结构泛化至八族十二模型,但深度取决于位置编码类型。

Comments 17 pages, 12 figures. Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07496 2026-08-11 cs.HC 新提交 85%

Human-Simulation Interaction: From Prediction to Exploration in LLM Agent Simulations for Policy

人机模拟交互:面向政策的大语言模型智能体模拟中从预测到探索

Huanxing Chen

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对政策领域大语言模型智能体模拟的人机交互问题,提出需将当前问答式交互转为支持探索的人机模拟交互,以解决模型准确率无法弥补的信任赤字。

Comments 4 pages. Position paper accepted to PoliSim@CHI 2026: LLM Agent Simulation for Policy, a workshop at CHI 2026 (CHI Conference on Human Factors in Computing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11947 2026-08-13 cs.CL cs.AI 新提交 85%

Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

无标签策略下准确率与顺序敏感性存在分歧

Karl Hanna, Chen Feng

机构 * Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对大语言模型的多项选择题评估偏差,测试两种无标签缓解策略,发现其无法可靠提升准确率,循环排列可提升准确率,且去偏差度量未达预期效果。

Comments 20 pages. Code available at https://github.com/cotenthusiast/choicebench

详情

展开后加载摘要…

URL PDF HTML 收藏