Learning to Decide with AI Assistance under Human-Alignment
在人工智能协助下的人类对齐决策学习
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在高风险领域中,人工智能如何通过预测结果帮助决策者,并探讨了AI预测信心与决策者自身信心的对齐程度对决策学习复杂性的影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在人工智能协助下的人类对齐决策学习
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在高风险领域中,人工智能如何通过预测结果帮助决策者,并探讨了AI预测信心与决策者自身信心的对齐程度对决策学习复杂性的影响。
ALAS:音频语言模型的自动潜在对齐分数
机构 * Concordia University(Concordia 大学) ; Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) ; Centrale Supelec(Centrale Supelec 研究院) ; Laval University(Laval 大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。
人类与视觉语言模型之间的注意力对齐
机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) ; Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) ; Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。
注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用
机构 * National University of Singapore(新加坡国立大学) ; Center for AI Research, VinUniversity(Vin大学人工智能研究中心) ; Independent Researcher(独立研究者) ; Technical University of Munich(慕尼黑技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。
Comments Published at the International Conference on Machine Learning (ICML 2026)
向机器传授价值观:在LLMs中模拟类人行为
机构 * The Hebrew University of Jerusalem(海法大学) ; IBM Research(IBM研究院) ; Tel-Aviv University(特拉维夫大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究基于心理学价值理论,通过大规模实验(超过500万个问题)评估价值提示的LLMs在价值结构和价值-行为关系上与人类的一致性,并证明引入人类价值分布可增强群体模拟。
Comments We had some disagreement regarding proper attribution; we hope to resolve it soon and upload the paper
Darshana Graph:用于比较印度哲学的平行注释语料库,附文体计量与探索性图分析
机构 * Independent Researcher(独立研究者) ; Bangalore, India(印度班加罗尔)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 构建包含超12.5万条记录的印度哲学平行注释语料库,其中约8500条记录实现跨18位注释者的根颂对齐,通过文体计量和约束大语言模型管道分析论证风格与概念关系,揭示学派间分歧模式。
Comments 12 pages, 1 figure. Open Source Code available at https://github.com/joyboseroy/darshana-graph and dataset at https://huggingface.co/datasets/joyboseroy/darshana-graph
IsabeLLM: 自动化定理证明应用于共识的形式化验证
机构 * Imperial College London(伦敦帝国学院)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文改进IsabeLLM自动化定理证明工具,通过检索增强生成、错误追踪和反例生成提升大语言模型上下文,并兼容最新Isabelle和Sledgehammer,用于验证比特币工作量证明共识。
几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配
机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) ; Semaphor Surgical ; Johnson & Johnson MedTech(强生医疗科技)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。
MemSlides:一种用于个性化幻灯片生成与多轮局部修订的层次化记忆驱动智能体框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出MemSlides层次化记忆框架,通过分离长期记忆(用户画像和工具记忆)与工作记忆,结合局部修订机制,实现个性化幻灯片生成中的用户偏好保持、多轮修订和可靠局部编辑。
Comments Code, website, project page, and video are linked in the paper
DeMix: 通过影响向量调试包含混合错误类型的训练数据
机构 * Shanghai Jiao Tong University(上海交通大学) ; ByteDance Inc.(字节跳动) ; Tiktok
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 提出DeMix框架,利用影响向量捕捉不同错误类型对模型行为的独特模式,将数据调试转化为多标签分类问题,并引入基于干预的学习策略,在11个任务上显著提升调试F1分数和修复后模型性能。
Atlas: 编排异构模型与工具实现多领域复杂推理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出ATLAS双路径框架,通过无监督聚类路由和强化学习多步路由动态选择最优模型-工具组合,在15个基准上超越GPT-4o,分布内外任务分别提升10.1%和13.1%。
Comments Accepted by ACL 2026
EgoCS-400K:面向世界模型的自我中心游戏数据集
机构 * City University of Hong Kong(香港城市大学)
专题命中 其他安全 :alignment(abstract)
AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。
DeSRPA: 通过推理时干预的解耦语音角色扮演智能体
机构 * Nagoya University(名古屋大学) ; National Institute of Informatics(国立情报学研究所)
专题命中 其他安全 :alignment(abstract)
AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。
Comments Accepted to INTERSPEECH 2026
RSRank: 从表示偏移中学习相关性
专题命中 其他安全 :alignment(abstract)
AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。
Comments Under Peer Review
UoU:基于大规模无监督学习的通用指纹基础模型
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他安全 :alignment(abstract)
AI总结 提出UoU指纹基础模型,通过多级表示层次和结合监督、弱监督与无监督的训练策略,实现跨传感器、质量和应用的通用特征提取。
视觉检索增强生成:基于轮廓引导的动物艺术创作
机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) ; Vietnam National University, Ho Chi Minh(胡志明市国立大学)
专题命中 其他安全 :alignment(abstract)
AI总结 提出视觉检索增强生成(Visual-RAG)框架,通过检索与自然轮廓结构相似的动物形状,结合ControlNet和IP-Adapter引导扩散模型生成动物艺术,实现计算空想性视错觉。
Comments SOICT 2025
面向位置和朝向的信道图表
专题命中 其他安全 :alignment(abstract)
AI总结 提出一种自监督方法,利用信道状态信息同时估计用户设备位置和朝向,通过新颖的朝向三元组损失和对齐损失实现,在5G NR实测中接近监督学习精度。
Comments This work has been submitted to the IEEE Conference on Integrated Sensing and Communications 2026 (ISAC)
极性手性活性物质作为一种移动、无序的约瑟夫森阵列:信息超电流和戈尔登斯pin波
专题命中 其他安全 :alignment(abstract)
AI总结 本文研究极性手性活性物质的动力学,揭示信息超电流维持同步及spin波传输机制,提出其与约瑟夫森阵列的等价性。
Comments 21 pages, 9 figures
TWICEBEE: 一种两阶段患者内无曲线贝叶斯决策理论剂量递增设计
专题命中 其他安全 :safety(abstract)
AI总结 针对多周期免疫治疗中毒性随周期递减的特点,提出两阶段患者内剂量递增设计,结合加速滴定与改进的无曲线贝叶斯决策理论框架,实现安全高效的剂量探索。