arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 551 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 551 篇

2607.27951 2026-07-31 cs.CR cs.AI 新提交 79%

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26164 2026-07-30 cs.LG 新提交 79%

Data Fusion and Contrastive Alignment for Unconstrained IR Molecular Structure Elucidation

面向无约束红外分子结构解析的数据融合与对比对齐

Ethan J. Mick, Campbell A. Sweet, Matthias J. Young, Derek T. Anderson

机构 * University of Missouri(密苏里大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本研究针对无约束红外分子结构解析的局限性,改进Transformer并引入MoE解码器与对比对齐损失,使Top-K预测准确率提升超10个百分点,拓宽了AI在分析化学的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24782 2026-07-29 cs.AI 新提交 79%

Personalization, Personas, and Forecasting in Value Alignment

价值对齐中的个性化、角色设定与预测

James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 79%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 79%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15810 2026-07-20 cs.LG 新提交 79%

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习

Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10162 2026-07-14 eess.AS cs.CL 新提交 79%

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

像人类一样听?语音语言模型中的语音象征与感知对齐

Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu, Yi-Cheng Lin, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering National Taiwan University Taipei, Taiwan Graduate Institute of Electrical Engineering National Taiwan University Taipei, Taiwan Artificial Intelligence Center of Research Excellence National Taiwan University Taipei, Taiwan

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究语音语言模型是否有语音象征倾向,通过真实人类语音录音对比模型与人类数据,发现模型听觉判断与人类感知对齐差,错过声学线索,开放权重模型表现不佳,弱点在语音表示方式。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 79%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08043 2026-07-10 cs.SE cs.AI 新提交 79%

Aleena: Alignment Agent for Research Software Engineering Collaborations

Aleena:用于研究软件工程协作的对齐代理

Kshitij Dani, Cordero Core, Landung Setiawan, Carlos Garcia Jurado Suarez, Anshul Tambay, Vani Mandava, Anant Mittal

机构 * eScience Institute(eScience研究院) University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。

Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06522 2026-07-08 cs.AI cs.CV 新提交 79%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04306 2026-07-07 cs.LG cs.CV 新提交 79%

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation

SAD-LoRA:低秩知识蒸馏的谱对齐

Omer Tariq, Syed Muhammad Raza, Jeongbae Son

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出SAD-LoRA方法用于低秩知识蒸馏,从数据加权学生空间参考更新中选择权重子空间,通过可微主角度损失训练,减少子空间错位,提升对齐效果,提高秩效率。

Comments ICML'26 workshop on CoLoRAI - The 2nd Workshop on Connecting Low-rank Representations in AI, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 79%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 79%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26466 2026-06-26 cs.CL 新提交 79%

Soft Token Alignment for Cross-Lingual Reasoning

跨语言推理的软令牌对齐

Jiayi He, Jungsoo Park, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出SOLAR方法,通过软令牌对齐跨语言表示,提升多语言推理准确率,尤其对低资源语言效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22992 2026-06-23 cs.CL 新提交 79%

Predicate Importance Estimation and Decoupled Rationale-Score Distillation for Entity Alignment

谓词重要性估计与解耦理由-分数蒸馏用于实体对齐

Keunha Kim, Yoonjin Jang, Hyeon-gu Lee, Sihyung Kim, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出谓词重要性估计和解耦理由-分数蒸馏两个模块,通过谓词感知嵌入和蒸馏小语言模型提升知识图谱实体对齐性能,并利用分数与理由的不一致实现人机协同验证。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 79%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21851 2026-06-23 cs.CL 新提交 79%

TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation

TALAS:基于教师锚定的层对齐与自适应锐度感知最小化的嵌入蒸馏

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Linh Ngo Van, Nguyen Thi Ngoc Diep, Thien Huu Nguyen, Trung Le

机构 * Hanoi University of Science and Technology(河内科技大学) VNU University of Engineering and Technology(越南国立大学工程与技术大学) University of Oregon(俄勒冈大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出TALAS框架,通过教师锚定机制仅蒸馏最终句子嵌入到学生上层,结合层对齐自蒸馏和自适应锐度感知最小化,在降低计算成本的同时提升句子嵌入蒸馏性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 79%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20258 2026-06-19 cs.HC cs.AI 新提交 79%

Editorial Alignment: A Participatory Approach to Engaging Editorial Expertise in LLM-mediated Knowledge Dissemination

编辑对齐:一种参与式方法,将编辑专业知识引入LLM介导的知识传播

Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo

机构 * Aarhus University(奥胡斯大学) University of Copenhagen(哥本哈根大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出“编辑对齐”作为参与式AI设计实践,通过设计工作坊让编辑参与重新对齐LLM接口至编辑标准,以维护公共知识机构的编辑职能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18703 2026-06-18 cs.LG q-bio.QM 新提交 79%

Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment

跨模态生物学语言模型的逻辑空间对比对齐

Yanjun Shao, Yundi Chen, Yashvi Patel, Aurelien Pelissier, María Rodríguez Martínez

机构 * Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出LOGICA框架,在输出逻辑空间进行对比学习,通过门控跨模态适配器保留预训练似然接口,实现跨不同词汇表模型的上下文条件预测,在蛋白质-配体结合、TCR-肽活性和药物耐药性预测任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15250 2026-06-16 cs.CV cs.AI 新提交 79%

Landmark-free Assessment of Lower-limb Alignment with Implicit Neural Shape Functions from Knee Radiographs

基于膝关节X光片的隐式神经形状函数的无地标下肢对齐评估

Zhisen Hu, Antti Kemppainen, David Johnson, Egor Panfilov, Huy Hoang Nguyen, Timothy Cootes, Claudia Lindner, Aleksei Tiulpin

机构 * Division of Informatics, Imaging and Data Sciences, The University of Manchester(曼彻斯特大学信息学、影像与数据科学部) Research Unit of Health Sciences and Technology, University of Oulu(奥卢大学健康科学与技术研究部) Medical Research Center Oulu, University of Oulu and Oulu University Hospital(奥卢大学与奥卢大学医院医学研究中心) Department of Trauma and Orthopaedics, Stockport NHS Foundation Trust, Stepping Hill Hospital(斯泰平希尔医院斯托克波特NHS基金会创伤与骨科) School of Health and Society, University of Salford(索尔福德大学健康与社会学院) School of Biological Sciences, The University of Manchester(曼彻斯特大学生物科学学院) Weill Cornell Medicine, Cornell University(康奈尔大学威尔康奈尔医学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出隐式神经形状函数(INSF)方法,无需显式地标,通过编码解剖形状到潜在空间并直接回归临床对齐测量,实现自动化下肢对齐评估,性能与现有方法相当且易于扩展。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 79%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12940 2026-06-12 cs.SD cs.LG 新提交 79%

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

自引导:通过解码器流形对齐增强神经编解码器

Xiang Li, Yixuan Zhou, Jingran Xie, Zhiyong Wu, Hui Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出自引导方法,通过轻量特征映射损失对齐解码器内部流形,在不改变推理过程下提升VQ-VAE神经语音编解码器重建质量,实现低比特率SOTA性能并支持4倍码本缩减。

Comments 20 pages, 9 figures, accepted to ICML 2026, demo website available at https://sgvqvae.github.io/sgvqvae-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12633 2026-06-12 cs.CV cs.LG 新提交 79%

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

ECA:面向开放图像到文本生成的高效持续对齐

Jiangtao Kong, Peijun Zhao, Chun-Fu Chen, Youngwook Do, Shaohan Hu, Tianyi Zhou, Huajie Shao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12199 2026-06-11 eess.AS cs.CL cs.SD 新提交 79%

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究

Zhen Ye, Xu Tan, Yiming Li, Guangyan Zhang, Chimin Chan, Haohe Liu, Zhengxi Liu, Hongzhan Lin, Zheqi Dai, Xinshen Zhang, Peiwen Sun, Qiuqiang Kong, Wei Xue

机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) Tencent, China(腾讯) University of Surrey, United Kingdom(Surrey大学) Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。

Comments Accepted by Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09068 2026-06-09 cs.CL 新提交 79%

Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

由谄媚诱导的突现性失调可通过对齐门控逆转

Sicheng Wang, Xiangyang Zhu, Han Wang, Zongrui Wang, Yuan Tian, Kaiwei Zhang, Kaiyuan Ji, Qi Jia, Guangtao Zhai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。

Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08262 2026-06-09 cs.LG 新提交 79%

Causal Semantic Alignment for LLM-based Time Series Forecasting

基于大语言模型的时间序列预测的因果语义对齐

Kexuan Zhang, Xiaobei Zou, Cesare Alippi, Gary G. Yen, Yang Tang

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出CVAformer框架,通过因果干预解耦变量中的动态和不变成分,消除对齐中的混杂偏差,在多种预测场景下达到或超越最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07874 2026-06-09 cs.AI 新提交 79%

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

安全是上下文相关的,而LLM评判者不是:应对评估者的刚性先验

Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

机构 * University of Oxford(牛津大学) Cohere

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM作为安全评判者时,对上下文信息的依赖性和对不同安全定义的可引导性,发现它们难以在上下文或安全定义与自身先验矛盾时调整评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09702 2026-07-14 cs.GT q-fin.TR 新提交 79%

Fundamental market design as a layer of AI-agent alignment

作为人工智能-智能体对齐层次的基础市场设计

Omar Inverso, Emilio Tuosto, Dragisa Zunic

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究探讨市场中人工智能-智能体对齐,提出将基础市场设计视为该对齐层次,通过对市场核心形式化建模,利用理论计算机科学严谨性构建透明盒模型,支持激励分析与机制设计,使期望行为受青睐,不良行为难维持。

Comments Accepted as at the EC'26 Workshop on Incentive-Based AI Alignment, co-located with the 27th ACM Conference on Economics and Computation, Rome, Italy, July 2026. This version is prepared for public dissemination following workshop acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 78%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏