Revisiting the shutdown problem
重新审视关机问题
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
重新审视关机问题
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。
人类与人工智能——促进可信且可理解的协作
专题命中 安全评测 :trustworthy(title)
AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。
Comments Comments: 19 pages, dual-language (English and German)
针对医学视觉-语言模型中否定处理改进的分层微调
机构 * University of Delaware(德克萨斯大学)
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本研究提出NAST方法,通过因果追溯效应调节逐层梯度更新,提升医学视觉-语言模型对否定处理的识别能力,同时保持一般视觉-语言对齐。
Comments 16 pages, 6 figures. Accepted to MLHC 2026
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
面向基于原则的监管的LLM作为评判者的四轴可信度基准
专题命中 安全评测 :分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)
AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。
Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster
AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。
Comments 19 pages, 5 figures
Polaris:用于对话式企业分析的多智能体系统
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。
语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试
机构 * DGIST(大邱庆北科学技术院) ; KAIST(韩国科学技术院) ; InnoCORE LLM
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。
Comments Accepted to CVPR 2026 Findings
基于内容的游戏玩法视频旁白:利用视觉语言模型
机构 * University of Washington(华盛顿大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。
Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)
LUNAR:基于通用用户行为日志的个性化大语言模型基准测试
机构 * Shenzhen University of Advanced Technology(深圳理工大学) ; Ant Group(蚂蚁集团)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究推出首个基于衣食住行等通用领域用户行为日志的LUNAR基准,经实验揭示LLM个性化的关键影响因素,为个性化LLM的发展指明了方向。
NEURON:一种面向临床可解释性的神经符号系统
机构 * University of North Texas(北卡罗来纳大学达顿分校) ; Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。
手术内窥镜视频的时间视觉语言模型的鲁棒性研究
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Birmingham City University(伯明翰城市大学) ; University Hospitals Birmingham(伯明翰大学医院) ; Khalifa University(哈利法大学) ; German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 安全评测 :alignment(abstract)
AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。
Comments Accepted to MICCAI 2026
超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN
专题命中 安全评测 :safety(abstract)
AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。
Comments Preprint. Code available at this https URL (https://github.com/MorrisYUJQ/DFT-GEN)
用于多智能体自主飞行器避障的时间屏障框架
专题命中 安全评测 :safety(abstract)
AI总结 该研究针对多自主飞行器避障问题,提出对抗性碰撞时间嵌入控制屏障函数的aTTC-CBF方法,经仿真验证其在提升航路点推进速度的同时降低了碰撞率。