arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 17 篇

2509.10078 2026-06-01 cs.CL cs.AI 90%

Human Psychometric Questionnaires Mischaracterize LLM Behavior

人类心理测量问卷误判LLM行为

Woojung Song, Dongmin Choi, Yoonah Park, Jongwook Han, Eun-Ju Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Communication, Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学通信系人工智能交叉学科项目)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过比较LLM在Likert问卷和生成概率上的价值与人格特征,发现问卷存在系统性偏差,提出基于生成概率的评估方法更准确。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30653 2026-06-01 cs.CL 90%

Counterfactual Graph for Multi-Agent LLM Calibration

多智能体LLM校准的反事实图

Jiatan Huang, Mingchen Li, Ziming Li, Sunjae Kwon, Hong Yu, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 针对多智能体LLM系统中通信导致的相关失败和虚假共识问题,提出CAGE-CAL框架,通过比较观察到的通信后图与匹配的反事实无通信图来校准置信度,提升可靠性区分和拓扑选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30930 2026-06-01 cs.HC cs.AI cs.CL cs.CY 87%

TUX: Measuring Human--AI Tacit Understanding

TUX:衡量人机默契理解

Yueshen Li, Hanyi Min, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30680 2026-06-01 cs.AI cs.MA 84%

Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response

战略提供者响应下的策略即代码搜索中的医疗机制

Zihan Wang, Xiang Xu, Hongyuan Zha, Wenhao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongji University(同济大学)

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 将医疗机制设计转化为语言模型的程序合成,通过多智能体模拟器Medi-Sim评估策略提供者响应下的均衡,并利用LLM引导的进化代码搜索合成可检查的混合目标程序。

Comments 32 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29268 2026-06-01 cs.CL cs.AI cs.LG cs.NE 83%

Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits

进化搜索中的计算分配:从深度-广度到多臂老虎机

Sixue Xing, Haoyu He, Kerui Wu, Zhuo Yang, Haozheng Luo, Tianfan Fu, Aarthy Nagarajan

机构 * University of Notre Dame(诺丁汉大学) Northeastern University(东北大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Southeast University(东南大学) Northwestern University(西北大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM引导的进化搜索中固定预算的LLM调用分配问题,提出基于多臂老虎机的BaSE方法,通过跨并行轨迹分配调用,平均适应度提升12.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01011 2026-06-01 cs.MA cs.AI 81%

Multi-Agent Teams Hold Experts Back

多智能体团队阻碍专家发挥

Aneesh Pappu, Batu El, Hancheng Cao, Carmelo di Nolfo, Yanchao Sun, Meng Cao, James Zou

机构 * stanford(斯坦福大学) apple(苹果公司) goizueta business school, emory(埃默里大学戈izueta商学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究自组织多智能体LLM团队在无约束协调下无法匹配专家性能,发现整合妥协行为是主要瓶颈,导致性能损失高达41.1%。

Comments Accepted at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22985 2026-06-01 cs.LG 79%

dgMARK: Decoding-Guided Watermarking for Diffusion Language Models

dgMARK: 面向扩散语言模型的解码引导水印方法

Pyo Min Hong, Albert No

机构 * Department of Computer Engineering, Hongik University(鸿基大学计算机工程系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 提出dgMARK方法,通过引导离散扩散语言模型的去掩码顺序满足奇偶约束,实现无需显式重加权概率的文本水印嵌入,并利用滑动窗口检测器保证对编辑操作的鲁棒性。

Comments Accepted at ICML 2026. Project page: https://dgmark-watermarking.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07927 2026-06-01 cond-mat.mtrl-sci 78%

MatterSim-MT: A multi-task foundation model for in silico materials characterization

MatterSim-MT:用于计算材料表征的多任务基础模型

Han Yang, Xixian Liu, Chenxi Hu, Yichi Zhou, Yu Shi, Chang Liu, Junfu Tan, Jielan Li, Guanzhi Li, Qian Wang, Yu Zhu, Zekun Chen, Shuizhou Chen, Fabian Thiemann, Claudio Zeni, Matthew Horton, Robert Pinsler, Andrew Fowler, Daniel Zügner, Tian Xie, Lixin Sun, Yicheng Chen, Lingyu Kong, Yeqi Bai, Deniz Gunceler, Frank Noé, Hongxia Hao, Ziheng Lu

专题命中 其他LLM :foundation model(title,abstract)

AI总结 提出MatterSim-MT多任务基础模型,通过预训练和微调实现材料结构、动力学、热力学及多种性质的高效预测,并展示其在复杂模拟中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31069 2026-06-01 cs.CV cs.CL 77%

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

面向有效长视频事件预测的多级事件语义挖掘

Bo Peng, YuanJie Lyu, PengGang Qin, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出VISTA框架,通过多级事件语义挖掘(细节级、事件级、未来级)实现长视频事件预测,解决现有模型无法精确提取事件细节和进行细粒度分析的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16187 2026-06-01 cs.SE cs.LG 77%

MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair

MatchFixAgent: 语言无关的自主仓库级代码翻译验证与修复

Ali Reza Ibrahimzada, Brandon Paulsen, Reyhaneh Jabbarvand, Joey Dodds, Daniel Kroening

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Amazon, Arlington, VA, USA(亚马逊公司,阿灵顿,弗吉尼亚州,美国) University of Oxford, Oxford, UK(牛津大学,牛津,英国)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于大语言模型的多智能体框架MatchFixAgent,实现语言无关的仓库级代码翻译等价性验证与修复,在验证覆盖率和修复成功率上显著优于现有方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30615 2026-06-01 cs.LG 70%

Improving Selective Classification with Pairwise Queries for Binary Classification

通过成对查询改进二分类的选择性分类

Harsh Vardhan, Sunav Choudhary, Natwar Modani, Arya Mazumdar

机构 * Adobe Research(Adobe研究院)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对选择性分类中模型置信度与预测不一致导致高错误率的问题,提出使用成对查询检测高错误样本,以降低非拒绝样本的错误率,并通过理论和实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17306 2026-06-01 cs.CL q-bio.NC 70%

Evidence for systematic semantic structure in individual phonemes

单个音素中系统性语义结构的证据

Gexin Zhao

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过大型语言模型、跨语言听者实验和发音特征分析,证明英语单个音素携带结构化的多维语义轮廓,挑战了音义关系任意性的传统假设。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30784 2026-06-01 cs.CV 67%

Text-guided Feature Disentanglement for Cross-modal Gait Recognition

文本引导的跨模态步态识别特征解耦

Zhiyang Lu, Ming Cheng

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,厦门大学)

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 针对LiDAR与RGB相机之间的模态差异,提出TCFDNet网络,利用文本先验引导解耦模态共享特征,通过CLIP对齐、特征解耦和稳定性增强实现跨模态步态识别,在SUSTech1K和FreeGait数据集上达到最优性能。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30501 2026-06-01 cs.CL 57%

Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs

线性集成洗去水印:论LLMs中分布扰动的脆弱性

Zhihao Wu, Gracia Gong, Qinglin Zhu, Yudong Chen, Runcong Zhao

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Mathematics, Imperial College London, UK(伦敦帝国学院数学系) Department of Statistics, University of Warwick, UK(沃里克大学统计系)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL

AI总结 本文通过理论和实验证明,当用户访问多个模型时,对输出概率分布进行简单平均即可消除水印,并提出了WASH方法解决集成中的词汇对齐和分词差异问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24535 2026-06-01 cs.CR cs.LG 57%

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.LG

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23278 2026-06-01 cs.CL stat.ML 57%

When Is Next-Token Prediction Useful? Marginalization, Ergodicity, Mixture Identifiability, Local Sufficiency, RAG, Tools, and Programming

下一个词预测何时有用?边缘化、遍历性、混合可识别性、局部充分性、RAG、工具与编程

Francesco Corielli

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本文通过区分完整条件语言过程、边缘文本过程和模型诱导分布,论证了下一个词预测的有效性依赖于强假设(平稳性、代表性、遍历性)以及观察前缀对潜在上下文的充分性,并解释了RAG和工具使用作为条件充分性机制的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31125 2026-06-01 cs.HC 50%

Generative AI in developing User Experience Research Point of View: A NotebookLM case study

生成式AI在用户体验研究观点开发中的应用:NotebookLM案例研究

Mona Giff, Stephen Giff, Huseyin Dogan

专题命中 其他LLM :prompting(abstract)

AI总结 本文提出并评估了一种利用Google NotebookLM增强用户体验研究观点(UXR PoV)框架的正式方法,通过五个提示词在四个阶段中应用,实验表明NotebookLM能有效协作生成PoV。

详情

展开后加载摘要…

URL PDF HTML 收藏