arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 730 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 730 篇

2606.16867 2026-06-16 cs.CL 新提交 81%

Revisiting the Systematicity in Negation in the Era of In-Context Learning

重新审视上下文学习时代否定中的系统性

Hitomi Yanaka, Taisei Yamamoto

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过行为与表征系统性分析,发现大型语言模型在上下文学习中能部分识别否定表达和范围,但无法完美执行,且功能向量在否定线索提取任务中可组合,但范围识别更具挑战。

Comments Accepted to the 6th Workshop Natural Language Meets Logic and Machine Learning (NALOMA2026) at ESSLLI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交 81%

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15033 2026-06-16 cs.HC cs.CL cs.CY 新提交 81%

Cloze: An Open Research Platform for Studying Human-AI Conversations in Mental Health Contexts

Cloze:一个用于研究心理健康背景下人机对话的开放研究平台

Matthew Flathers, Francesco Cipriani, John Torous

机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) University College London(伦敦大学学院) Division of Digital Psychiatry(数字精神病学部)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。

Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11869 2026-06-11 cs.SE cs.AI 新提交 81%

Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production

层层代理:从底层到生产构建自定义AI代理的方法论

Marc Alier Forment, Juanan Pereira, Francisco José García-Peñalvo, María José Casañ Guerrero

机构 * Universitat Politècnica de Catalunya (UPC)(西班牙巴塞罗那理工大学) Universidad del País Vasco / Euskal Herriko Unibertsitatea (UPV/EHU)(西班牙巴斯克大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种无框架的方法论,通过两个前提条件(将LLM作为软件组件和构建块)和三个实践(原型设计、打包为CLI、代理测试代理)来构建自定义AI代理,实现端到端开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11652 2026-06-11 cs.LG 新提交 81%

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

IAPO:面向小型多模态代理工具使用的输入归因感知策略优化

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 其他LLM :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09892 2026-06-10 cs.LG stat.ME 新提交 81%

LMT: A Bayesian Framework for Causal Discovery from Textual Alarm Records in Manufacturing Systems

LMT: 制造系统中文本告警记录的因果发现贝叶斯框架

Xiaofeng Xiao, Jianhong Chen, Qiuzhuang Sun, Naichen Shi, Xubo Yue

机构 * Department of Mechanical & Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系) College of Integrative Studies, Singapore Management University, Singapore(新加坡国立大学整合研究学院) Department of Industrial Engineering and Management Sciences, Department of Mechanical Engineering, Northwestern University, IL, USA(西北大学工业工程与管理科学系、机械工程系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LMT框架,结合大语言模型提取的语义信号和基于泊松过程的时间证据,通过贝叶斯方法从文本告警记录中发现因果图,在小样本场景下表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07513 2026-06-08 cs.CL 新提交 81%

Agentopia: Long-Term Life Simulation and Learning in Agent Societies

Agentopia: 智能体社会中的长期生活模拟与学习

Xintao Wang, Sirui Zheng, Hongqiu Wu, Weiyuan Li, Jen-tse Huang, Minghao Zhu, Can Zu, Qi Deng, Jiawei Wang, Qianyu He, Heng Wang, Xiaojian Wu, Yunzhe Tao

机构 * Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出Agentopia框架,模拟100个智能体在10年内的社会生活,通过生命奖励训练LLM,提升其社交智能,并在角色扮演基准上取得15.6%的提升。

Comments 79 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交 81%

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15713 2026-07-20 eess.SP cs.AI cs.LG 新提交 81%

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型

Yong Chu, Xun Zhou, Zenglin Xu, Hui Wang, Yue Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。

Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14113 2026-07-17 cs.CL cs.AI 新提交 81%

T5-CSBoost: Adversarial Perturbation Resistant LLM Fingerprinting

T5-CSBoost:抗对抗扰动的语言模型指纹识别

Gayan K. Kulatilleke, Mahsa Baktashmotlagh, Siamak Layeghy, Marius Portmann

专题命中 其他LLM :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对AIGT检测器在多种干扰下准确性下降的问题,提出T5-CSBoost,通过引入辅助损失鼓励学习抗扰动风格表示,在多基准测试中达先进水平,对高强度对抗扰动鲁棒性增强,证明对比学习规范风格嵌入可构建更强大指纹识别系统。

Comments 14 pages, 3 datasets, code and data will be provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14106 2026-07-17 cs.CL cs.AI 新提交 81%

Token Time Continuous Diffusion for Language Modeling

用于语言建模的令牌时间连续扩散

Parikshit Bansal, Sujay Sanghavi

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出令牌时间连续扩散(TTCD)语言模型,其在连续空间运行,引入令牌时间概念。该模型避免多令牌并行采样,能更好建模条件生成。实验表明,在高速加速时TTCD优于离散模型,在无条件和条件生成上有优势,数独求解也有类似成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07375 2026-07-09 cs.LG cs.AI 新提交 81%

On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces

基于中间谱子空间视角的视觉语言模型对抗脆弱性研究

Chethan Krishnamurthy Ramanaik, Tobias Callies, Michael Hecht, Eirini Ntoutsi

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学) University of Wrocław(弗罗茨瓦夫大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于Transformer的视觉语言模型对抗脆弱性,提出白盒谱子空间引导攻击(SSGRA),通过将中间表示与特定子空间对齐来攻击,实验显示其比现有基线更有效,还为模型对抗脆弱性提供谱解释,助力提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00852 2026-07-02 cs.CL cs.AI 新提交 81%

Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models

从隐藏状态恢复输入文本:基于梯度的解码器专用语言模型反演研究

Mikołaj Słowikowski, Maciej Witold Majewski

机构 * AGH University of Krakow, Faculty of Physics and Applied Computer Science(AGH克拉科夫大学物理与应用计算机科学学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究解码器专用语言模型最后层隐藏状态的反演问题,提出连续嵌入空间优化方法,通过离散损失评估恢复正确性,发现高频功能词是主要失败原因,内容词几乎完美恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19831 2026-06-19 cs.CL cs.LG 新提交 81%

Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models

杠杆不等于可达性:语言模型中单神经元操控的控制窗口定律

Hongliang Liu

机构 * Palo Alto Networks

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出预算归一化控制窗口框架,通过残差范数与写入范数之比定义的相干预算,预测单神经元干预何时产生连贯行为控制,并在15个神经元上验证了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08535 2026-08-11 cs.HC 新提交 80%

TeachUp: Facilitating Early-Stage Teachers to Learn Instructional Strategies from Classroom Videos with Reflective Support

TeachUp:借助反思性支持帮助新手教师从课堂视频中学习教学策略

Haoxiang Fan, Ding Lei, Zaihong Zheng, Jiale Li, Jionghao Lin, Jian Yin, Zhenhui Peng

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 TeachUp借助LLM驱动的流程检测课堂视频中的9种教学策略,为新手教师提供反思支持,经实验验证可提升其学习参与度与策略应用表现。

Comments 16 pages, 6 figures, and 4 tables. To appear in the Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08261 2026-08-11 cs.DB 新提交 80%

Scout: Scalable Document Extraction via Data Similarity

Scout:基于数据相似度的可扩展文档提取工具

Yiming Lin, Chiyu Hao, Shreya Shankar, Aditya G. Parameswaran

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 Scout是一款基于文档相似度的可扩展文档提取工具,通过生成优化规则集实现高性价比数据提取,在多个真实数据集上达到与前沿LLM相当的准确率,成本大幅降低且优于同类基于程序的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06088 2026-08-07 cs.RO cs.SE 新提交 80%

IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation

IcFuzz:基于语义阶段引导与多级变异的Isaac Sim模糊测试

Zhixiang Chen, Zhuangbin Chen, Ruoxi Jia, Zeqin Liao, Wei Li, Jinyang Liu, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学)

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 本文提出首个针对Isaac Sim的模糊测试方法IcFuzz,通过LLM语义阶段分割、多级变异算子与多臂老虎机算法提升测试效果,在代码覆盖率与漏洞检测上优于基线,已发现11个漏洞且9个被确认修复。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05659 2026-08-07 cs.CR 新提交 80%

Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks

针对代码任务定制化大语言模型的突破:针对指令后门攻击的自动红队测试

Yuchen Chen, Wei Cheng, Yuan Xiao, Wising Sun, Chunrong Fang, Yang Liu, Zhenyu Chen, Baowen Xu

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 本文提出ARIA自动红队测试框架,可高效生成针对代码定制化LLM的隐蔽带后门指令,攻击成功率达0.945且规避检测能力强,性能优于现有基线攻击。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05008 2026-08-06 cs.CY 新提交 80%

The Beginning of ChatGPT Ads

ChatGPT 广告的开端

Emma Lurie, Ro Encarnación, Sorelle A. Friedler, Danaé Metaxa

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文首次实证研究 ChatGPT 广告,采用傀儡审计方法,发现低收入账号更易收到广告,发布了广告存档并提出未来研究建议。

Comments To be published in AAAI/ACM AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03676 2026-08-05 cs.DC 新提交 80%

TAOT: Topology-Aware Optimal Transport for Dynamic Expert Replica Placement in MoE Training

TAOT:MoE训练中面向动态专家副本放置的拓扑感知最优传输方法

Lingyun Zhang, Henghua Zhang, Shilei Gu, Kai Mo, Shuai Han, Shiyong Li, Yanpeng Wang, Dou Shen

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对MoE训练中动态路由引发的负载不平衡问题,提出TAOT拓扑感知最优传输方法,可实现1.43倍训练加速,平衡质量优异且通信成本降幅最高达74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 80%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 80%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 80%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03229 2026-07-07 cs.DC 新提交 80%

HyperParallel-Mpipe: A Composable Algebra System for Optimizing MLLM Training over Supernode Clusters

HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统

Chong Li, Zhengdao Yu, Nelson Lossing, Thibaut Tachon, Pierre Leca, Etienne Filhol, Yujie Yuan, Chong Bao, Teng Su

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 80%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20835 2026-06-23 cs.CR cs.SE 新提交 80%

PromptMark: A Prompt-Guided Iterative-Feedback Framework for Source Code Watermarking

PromptMark: 一种提示引导的迭代反馈框架用于源代码水印

Istiaq Ahmed Fahad, Mridha Md. Nafis Fuad, Kazi Sakib

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PromptMark,一种黑盒提示引导的水印框架,通过结构化输入指令在AI生成代码中嵌入可检测信号,并利用迭代反馈优化嵌入,在保持代码正确性的同时实现强水印可检测性。

Comments Accepted in 21st International Conference on Evaluation of Novel Approaches to Software Engineering (ENASE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06747 2026-06-19 cs.SE 新提交 80%

Tensor Algebraic Property Skeletons: Amplifying Property-Based Testing for AI Compilers

张量代数性质骨架:增强AI编译器的基于性质的测试

Yuxin Qiu, Ben Limpanukorn, Seongmin Lee, Jiyuan Wang, Qian Zhang, Miryung Kim

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 提出Propilot框架,利用LLM将张量代数知识表示为可复用的性质骨架,自动生成可执行的基于性质的测试,以检测AI编译器中的语义漂移。

Comments v2 adds citations and fixes some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18065 2026-06-17 cs.MA 新提交 80%

Intelligence Entropy Principle and the ADE Stability Engineering Framework

智能熵原理与ADE稳定性工程框架

Dexing Liu

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 针对LLM驱动的多智能体系统从实验室到生产环境时出现的非线性退化,提出智能熵原理,构建ADE四层框架,通过Lyapunov分析给出稳定条件,实验验证将通道断裂率降至近0%,系统死亡概率低于0.02%。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07539 2026-06-09 cs.CY 新提交 80%

Prompt Governance? On Governing Technologies Governed by Natural Language

提示治理?论受自然语言治理的技术

Anna Neumann, Holli Sargeant, Jatinder Singh

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨系统级指令作为生成式AI治理工具的可靠性,发现文献中对其目标存在矛盾主张,政策框架将其视为稳定控制机制,但两者错位需审慎对待。

Comments Accepted as a full paper to ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15772 2026-08-18 cs.AI 新提交 79%

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性

Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.AI

AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。

详情

展开后加载摘要…

URL PDF HTML 收藏