arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-28 至 2026-07-28 共收录 126 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2607.23373 2026-07-28 cs.CV 新提交 50%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23213 2026-07-28 cs.HC 新提交 50%

A Taxonomy of Confabulations and the Perception-Reality Gap in LLM-Assisted Immersive Scene Editing

大语言模型辅助沉浸式场景编辑中的虚构分类与感知-现实差距

Junlong Chen, Per Ola Kristensson

专题命中 其他安全 :safety(abstract)

AI总结 研究LLM辅助沉浸式3D场景编辑中的虚构,通过对24名非专业用户的探索性研究构建分类法,报告其普遍性与破坏性,定义感知-现实差距结构,强调负载下虚构意识饱和度,得出对未来系统减轻虚构的设计启示。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22678 2026-07-28 math.OC stat.ME 新提交 50%

Convexifying Mean-Field Control: An Occupation-Measure and Frank-Wolfe Approach

凸化平均场控制:一种占用测度和弗兰克 - 沃尔夫方法

Di Yu, Sixiong You, Chaoying Pei

专题命中 其他安全 :safety(abstract)

AI总结 针对大规模机器人群体的平均场控制问题,建立基于优化的框架,将其提升到占用测度空间并采用弗兰克 - 沃尔夫算法求解,避免状态空间离散化,具有O(1/k)收敛速度,可扩展到三维环境,展现出实用性和可扩展性。

Comments 7 pages, 5 figures. Accepted to the 2026 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18239 2026-07-28 cs.HC 版本更新 50%

Emergent Learner Agency in Implicit Human-AI Collaboration: How Supportive and Contrarian AI Personas Reshape Interaction

隐式人机协作中新兴的学习者能动性:支持性和逆向性人工智能角色如何重塑互动

Yueqiao Jin, Roberto Martinez-Maldonado, Dragan Gašević, Xibin Han, Lixiang Yan

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨支持性和逆向性AI角色对隐式人机创意协作中学习者能动性等方面的影响,通过让大学生分组完成任务并分析话语等,发现逆向性AI虽激发批判性但降低满意度,教育设计需平衡挑战与情感氛围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03753 2026-07-28 cs.HC 版本更新 50%

VisTR: Visualizations as Representations for Time-series Table Reasoning

VisTR:将可视化作为时间序列表推理的表示

Jianing Hao, Zhuowen Liang, Chunting Li, Yuyu Luo, Jie Li, Wei Zeng

专题命中 其他安全 :alignment(abstract)

AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏