Theoretical Limits of Language Model Alignment
语言模型对齐的理论极限
机构 * Apple(苹果公司)
专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究语言模型对齐的理论极限,通过推导KL散度预算下的最大预期奖励增益,揭示了KL正则化对齐的信息论限制,并证明了奖励融合能缓解奖励黑客问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
语言模型对齐的理论极限
机构 * Apple(苹果公司)
专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究语言模型对齐的理论极限,通过推导KL散度预算下的最大预期奖励增益,揭示了KL正则化对齐的信息论限制,并证明了奖励融合能缓解奖励黑客问题。
TextLDM:基于连续潜在扩散的语言建模
机构 * Joy Future Academy(京东探索研究院) ; HIT(Harbin Institute of Technology) ; HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))
专题命中 其他安全 :alignment(summary_cn,abstract);分类 cs.CL
AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。
无需再训练,对齐:通过表征对齐将自回归语言模型适应到扩散语言模型
机构 * Duke University(杜克大学) ; AITHYRA
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出REPR-ALIGN方法,通过表征对齐将自回归模型转换为扩散模型,实现4倍训练加速,尤其在低数据情况下效果显著。
Comments Code available at https://github.com/pengzhangzhi/Open-dLLM
玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐
机构 * University of Oxford(牛津大学) ; Columbia University(哥伦比亚大学) ; New York University(纽约大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。
多智能体AI中的隐藏联盟:来自内部表示的谱诊断
机构 * Reciprocal Research(递归研究) ; Center for the Future of AI, Mind, and Society(人工智能、心智与社会未来中心) ; Florida Atlantic University(佛罗里达 Atlantic 大学) ; Biological and Computational Intelligence Center(生物与计算智能中心) ; National Intelligence University(国家情报大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过分析多智能体系统内部神经表示的谱分区方法,检测隐藏联盟结构,验证了该方法在强化学习和大语言模型中的有效性,揭示了代表层次结构。
Comments 18 pages
Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示
机构 * Tsinghua University(清华大学) ; Panasonic AI Lab(松下人工智能实验室) ; Panasonic DX-CPS(松下DX-CPS) ; UC Berkeley(伯克利大学)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。
Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D
CommandSwarm: 为机器人群体提供安全意识的自然语言到行为树生成
专题命中 其他安全 :safety(title,abstract)
AI总结 本文提出CommandSwarm系统,通过多语言翻译、安全过滤和约束提示生成XML行为树,验证了紧凑量化领域适应的LLM在机器人群体控制中的有效性,强调了解析器接受和安全过滤的重要性。
因果涌现对齐假说:因果涌现与强化学习代理最终奖励对齐并预测
专题命中 其他安全 :alignment(title,abstract)
AI总结 研究探讨因果涌现与强化学习代理奖励之间的关系,发现因果涌现能预测最终奖励并促进表示动态与奖励提升对齐。
Comments 10 pages, 6 figures
ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力
机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。
Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git
从时间序列分析到问答:在大语言模型时代的一次综述
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Aalborg University(奥胡斯大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。
Comments Accepted by IJCAI 2026 Survey Track
均值池化余弦相似度并非长度不变:理论和跨领域证据支持一种长度不变的替代方案
机构 * Birla Institute of Technology(比拉理工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究指出均值池化余弦相似度在现代Transformer表示中并非长度不变,通过实验验证了其在跨语言Python接近性中的解释力,并提出中心核对齐(CKA)作为更优的替代方法。
Comments 9 pages, 6 figures. Submitted to the Mechanistic Interpretability Workshop at ICML 2026
E$Δ$-MHC-Geo变换器:具有保证正交性的自适应测地操作
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出E$Δ$-MHC-Geo变换器,结合流形约束超连接、深度delta学习和Cayley变换,实现输入自适应且无条件正交的残差连接。通过数据依赖的Cayley旋转和Householder反射的混合方法,提升长时稳定性和旋转损失性能。
Comments 21 pages, 8 figures; code will be available at https://github.com/arash-shahmansoori/edelta
GASim:一种用于大规模社会模拟的图加速混合框架
机构 * University of Science and Technology of China(中国科学技术大学) ; BASIS International School(BASIS国际学校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出GASim框架,通过图优化内存和图消息传递提升大规模社会模拟效率,实现9.94倍速度提升并降低计算成本。
TRAJGANR: 通过地理对齐的神经表示进行轨迹导向的城市多模态学习
机构 * Google Research, Mountain View, CA(谷歌研究,山景城,加利福尼亚州) ; Google LLC, Mountain View, CA(谷歌公司,山景城,加利福尼亚州) ; Dept. of Computer Science, University of Southern California, Los Angeles, CA(计算机科学系,南加州大学,洛杉矶,加利福尼亚州) ; SEAI Lab, Dept. of Geography and the Environment, The University of Texas at Austin, Austin, TX(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 TRAJGANR提出一种新的多模态自监督学习框架,通过将连续移动模式与静态位置观察对齐,提升城市理解和移动任务的性能,优于现有方法。
GamED.AI:一种用于自动教育游戏生成的分层多智能体框架
机构 * Arizona State University(亚利桑那州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出GamEDAI框架,通过分层多智能体方法将教师提供的问题转化为可玩的教育游戏,验证通过形式化机制合同。系统在200个问题上实现90%验证通过率和98.3%的模式合规性。
DiffeoMorph: 通过可微分基于代理的模拟学习3D形状变形
机构 * Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) ; Department of Data Science, Dana-Farber Cancer Institute(达纳-法伯癌症研究所数据科学部) ; Departments of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学部) ; Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出DiffeoMorph框架,通过可微分代理模拟学习形态发生协议,使代理群体变形为目标3D形状,采用SE(3)等价图神经网络和基于3DZernike多项式的形状匹配损失实现旋转不变性和反射敏感性。
基于闭式旋转的W4A4大语言模型量化去噪
机构 * National University of Defense Technology(国防科技大学) ; Qinghai Normal University(青海师范大学) ; Tibet University(西藏大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出SingleQuant框架,通过闭式最优旋转平滑激活异常值,提升大语言模型量化性能,实验证明其在多种任务中优于基线方法。
Comments 9 pages, 4 figures
探索虚拟宠物在旅游推荐系统中提供上下文通知:一项试点研究
专题命中 其他安全 :safety(abstract)
AI总结 本文探讨了利用虚拟宠物作为社交中介在旅游推荐系统中传递上下文感知通知的方法,通过试点研究验证了其在减少通知侵入性和提升用户接受度方面的有效性。
Comments 30 pages, 7 figures, 7 tables
多对多多智能体取货与送货
机构 * Institute of Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机械研究所,佐治亚理工学院) ; Symbotic Inc.(Symbotic公司) ; Northeastern University(东北大学)
专题命中 其他安全 :safety(abstract)
AI总结 本文提出M2M算法解决多对多多智能体取货与送货问题,通过任务持续时间优化和SKU分布优化,提升仓库效率。
各向异性模态对齐
机构 * HKUST(GZ)(香港科技大学(广州)) ; NUS(国立新加坡大学) ; UCSD(加州大学圣地亚哥分校) ; Stanford(斯坦福大学) ; PKU(北京大学) ; THU(清华大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。
AI赋能的低空经济:利用固定无线接入的协同感知
专题命中 其他安全 :safety(abstract)
AI总结 本文提出一种基于AI的两阶段协同感知方法,利用FWA设备的上行CSI实现无人机检测与定位,实验表明该方法能有效降低误检概率并满足3GPP要求。
通过多阶段LLM训练和错误修复提升Java到Cangjie的自动翻译
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出多阶段LLM训练框架,结合编译器反馈和错误修复,提升Java到Cangjie的翻译准确性与语义一致性,实验显示在有限平行数据下功能等价性提升6.06%。
掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测
机构 * Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) ; North China University of Water Resources and Electric Power(华北水利水电大学) ; University of Auckland(奥克兰大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。
非马尔可夫集体运动来自自我调节的感知动力学
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出一个双时间尺度模型,通过快感知寄存器和慢调节变量实现非马尔可夫集体运动,揭示了局部反馈如何影响集体秩序和调节强度。
Comments 15 pages, 5 figures
VizCopilot:通过上下文可视化促进对企业聊天机器人适当依赖
专题命中 其他安全 :alignment(abstract)
AI总结 VizCopilot通过可视化技术帮助用户对齐上下文,减少无关回答,提升信息整合效率,同时揭示AI摘要可信度的局限性。