Impact of Task Phrasing on Presumptions in Large Language Models
任务表述对大语言模型中假设的影响
机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
任务表述对大语言模型中假设的影响
机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。
SC-Taxo:基于语义一致性约束的层次化分类生成方法
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Science and Technology Beijing(北京科技大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出SC-Taxo框架,利用大语言模型和层次化优化机制,解决现有分类生成方法在结构一致性和语义对齐上的不足,提升分类体系的层次性和准确性。
Comments 12 pages, 5 figures, 2 tables
AgentReputation: 一种去中心化的代理AI声誉框架
机构 * Department of Computer Science(计算机科学系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。
Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track
Intern-Atlas:一种方法论进化图作为人工智能科学家的研究基础设施
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Xi'an Jiaotong University(西安交通大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Hunan University(湖南大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai University(上海大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 Intern-Atlas通过构建方法论进化图,自动识别方法实体,推断方法间的关系,并捕捉驱动创新过渡的瓶颈,为AI研究提供因果网络支持。
Comments 25 pages, 5 figures, 8 tables
多模态融合的拓扑学:为何当前架构在创造性认知上失败
机构 * Guangzhou Academy of Fine Arts(广州美术学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。
Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately
自适应双教师蒸馏与子网络校正用于桥接黑盒领域适应中的语义间隙
机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) ; School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出DDSR框架,通过自适应预测融合策略和子网络正则化机制,解决黑盒领域适应中任务特定知识与语言对齐语义先验的不一致问题,提升领域适应性能。
Comments Under Review
部署AI代理中的环境说服:非对抗性内容暴露后的未经授权升级
机构 * Digital Epidemiology Laboratory, Digital Futures, University of Cincinnati(数字流行病学实验室,数字未来,辛辛那提大学) ; Center for Humanities and Technology (CHaT), University of Cincinnati(人文与科技中心(CHaT),辛辛那提大学) ; Norwegian University of Science and Technology(挪威科技大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 研究探讨了部署AI系统中因非对抗性内容暴露导致的未经授权行为升级问题,分析了多代理监管机制的局限性及伦理治理挑战。
代理控制协议:代理行为的准入控制
机构 * TraslaIA
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。
Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added
Soft-MSM:用于时间序列的可微上下文感知弹性对齐
机构 * School of Electronics and Computer Science(电子与计算机科学学院) ; University of Southampton(南安普顿大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本文提出Soft-MSM,一种基于上下文感知的弹性对齐损失函数,通过平滑门替代MSM的分段分合成本,实现可微梯度计算,实验表明其在时间序列聚类和分类任务中优于Soft-DTW。
人工智能时代自主系统可靠性:安全、安全性和可靠性设计挑战
机构 * Colorado State University, US(科罗拉多州立大学) ; The University of North Carolina at Chapel Hill, US(北卡罗来纳大学教堂山分校) ; The TUM Institute for Advanced Study, Germany(慕尼黑工业大学高级研究 institute) ; Infineon Technologies, Germany(英飞凌科技)
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 本文探讨了在人工智能时代设计可靠自主和嵌入式系统的新方法和框架,重点在于可靠性建模、安全系统设计和认证方法,以应对AI组件带来的不确定性与非确定性。
语言模型能够识别应用于其激活上的dropout和高斯噪声
机构 * LawZero
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。
归一化变换器中的学习率转移
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Princeton University(普林斯顿大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出νGPT模型,通过结合数值实验和对齐指数,改进了超参数转移方法,实现了模型宽度、深度和token horizon上的学习率转移。
通过间接奖励解锁零样本地理推理
机构 * University at Buffalo(布法罗大学) ; Microsoft(微软)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。
Comments ICML 2026
智能交通系统入侵检测机器学习模型比较分析
机构 * Victoria University, Sydney, Australia(维多利亚大学,悉尼,澳大利亚) ; University of New South Wales College, Sydney, Australia(新南威尔士大学学院,悉尼,澳大利亚)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文研究了在边缘计算中提升延迟、带宽效率和服务响应性的机器学习模型,提出基于信任的联邦混合入侵检测框架,通过随机森林、决策树和线性SVM网络互补流量表示,并在服务器端进行信任感知的模型更新聚合。
集体代理的因果基础
机构 * Copenhagen Causality Lab and Pioneer Centre for AI, University of Copenhagen, Denmark(哥本哈根因果实验室和先锋人工智能中心,哥本哈根大学,丹麦) ; Cooperative AI Foundation, United Kingdom(协作人工智能基金会,英国)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文探讨了多智能体系统中集体代理形成的因果基础,提出通过因果游戏和因果抽象框架分析集体行为的理性与目标导向性,解决多智能体激励问题和投票机制的集体代理度评估。
Comments CLeaR 2026
PPLLaVA:通过提示引导的视频序列理解
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学) ; XPeng Inc.(小鹏汽车有限公司) ; Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)
专题命中 其他安全 :alignment(abstract)
AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。
Comments Accepted to ICLR' 26
CMTA:利用跨模态时间特征进行通用的AI生成视频检测
机构 * Xi’an Jiaotong University(西安交通大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) ; City University of Hong Kong(香港城市大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。
Comments 15 pages, 4 figures
ClozeMaster:利用LLMs填充掩码真实程序以模糊Rust编译器
专题命中 其他安全 :safety(abstract)
AI总结 本文提出ClozeMaster,通过利用LLMs填充掩码的真实程序,生成有效测试用例,发现Rust编译器27个已确认的bug,优于现有模糊测试工具。
Comments Accepted at ICSE 2025
BOLT:面向无准备异构协作感知的在线轻量适应
机构 * Renmin University of China(中国人民大学) ; National University of Defense Technology(国防科技大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本研究提出BOLT模块,通过 ego-as-teacher 蒸馏实现在线特征域对齐,无需预训练协调,在无准备场景下提升AP@50达32.3点,优于 ego-only 结果。
Comments 21 pages, 10 figures, 10tables
符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞
专题命中 其他安全 :safety(abstract)
AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。
Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering