arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 150 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 58 篇

2606.29390 2026-06-30 cs.CY 57%

Toward Comprehensive Risk Assessments and Assurance of AI-Based Systems

迈向基于AI系统的全面风险评估与保证

Heidy Khlaaf

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对AI系统部署带来的新风险,本文提出一个整合运行设计域(ODD)的端到端AI风险框架,以统一术语、改进风险评估,确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28856 2026-06-30 q-bio.OT cs.AI 57%

Building AI-Ready Data Systems for Space Life Sciences, Aerospace Medicine, and Deep Space Exploration

构建面向空间生命科学、航空航天医学和深空探测的AI就绪数据系统

Sylvain V. Costes, Sergio Garcia Busto, Ryan T. Scott, James A. Casaletto, Gautier Bardi de Fourtou, Brian M. Evarts, Amanda M. Saravia-Butler, Xavier-Lewis Palmer, Rodrigo Coutinho de Almeida, Laetitia Frost, Jelena Tešić, Afshin Beheshti, Christopher E. Mason, Peter W. Rose, Sergio E. Baranzini, Lauren M. Sanders, Stefania Giacomello, Pedro Madrigal

机构 * Blue Marble Space Computational and Systems Biology(计算与系统生物学) Trivedi Institute for Space and Global Biomedicine(Trivedi空间与全球医学研究所) Wellcome Sanger Institute(Wellcome桑格研究所) University of Cambridge(剑桥大学) Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学 division, NASA Ames研究中心) Massachusetts Institute of Technology(麻省理工学院) Crown Point Technologies, Inc(Crown Point Technologies公司) BiosView Labs Directorate of Human and Robotic Exploration, European Space Agency(欧洲航天局人类和机器人探索部门) Texas State University(德克萨斯州立大学) McGowan Institute for Regenerative Medicine, Department of Surgery, University of Pittsburgh School of Medicine(McGowan再生医学研究所,匹兹堡大学医学院外科系) Center for Space Biomedicine, Trivedi Institute for Space and Global Biomedicine(空间生物医学中心,Trivedi空间与全球医学研究所) Department of Bioengineering, University of Pittsburgh(匹兹堡大学生物工程系) Stanley Center for Psychiatric Research, Broad Institute of MIT and Harvard(Stanley精神医学研究中心,MIT和哈佛Broad研究所) Department of Systems and Computational Biomedicine and WorldQuant Initiative, Weill Cornell Medicine(系统与计算生物医学系及WorldQuant计划,Weill Cornell医学院) San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,加州大学旧金山分校神经病学系) Science for Life Laboratory, Department of Gene Technology, KTH Royal Institute of Technology(Science for Life实验室,基因技术系,皇家理工学院) European Molecular Biology Laboratory, European Bioinformatics Institute (EMBL-EBI)(欧洲分子生物学实验室,欧洲生物信息研究所(EMBL-EBI))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对空间生物学数据异构性阻碍AI应用的问题,提出从FAIR到AI就绪再到空间就绪的三层数据架构,并建议建立国际协调机构以支持深空生物学研究。

Comments 26 pages, 3 figures, 1 table, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28383 2026-06-30 cs.CV cs.LG 57%

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

零标签驾驶场景复杂度检测基于联合嵌入预测架构

Santosh Jaiswal

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28365 2026-06-30 cs.IR cs.AI 57%

CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval

CAMI:成本感知的智能体引导多索引语义检索

Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

机构 * IBM Software Innovation Lab India(IBM软件创新实验室印度)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出CAMI框架,将多索引构建形式化为预算约束的多目标组合选择问题,通过智能体发现、原子单元搜索和置信度感知调度,在严格预算下系统性地识别高召回率索引组合,相比标准基线召回率提升9.4%,预算减少5倍。

Comments Accepted to ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03895 2026-06-30 cs.OS cs.AI cs.CR 57%

Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体

Yingqi Zhang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09785 2026-06-30 cs.CL 57%

EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpreting

EPIC-EuroParl-UdS:翻译与解读的信息论视角

Maria Kunilovskaya, Christina Pollkläsener

机构 * Saarland University(萨尔兰大学) University of Hildesheim(希尔德斯海姆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文介绍了更新和结合的双向英语-德语EPIC-UdS(口语)和EuroParl-UdS(书面)语料库,包含原始欧洲议会演讲及其翻译和解读。新版本修正了元数据和文本错误,优化内容,更新语言标注,并增加词对齐和词级意外指数等新层。

Comments 16 pages with appendices, 8 figures to be published in LREC-2026 main conference proceedings

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 6998--7013, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20610 2026-06-30 cs.SE cs.CL 57%

SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference

SpecMind:基于认知的、交互式多轮框架用于后置条件推断

Cuong Chi Le, Minh V. T Pham, Tung Vu Duy, Cuong Duc Van, Huy N. Phan, Hoang N. Phan, Tien N. Nguyen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) FPT Software AI Center(FPT软件AI中心) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SpecMind通过多轮交互式提示方法提升后置条件生成的准确性和完整性,利用反馈驱动模型迭代优化,增强代码理解和程序行为对齐。

Comments Accepted in ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06359 2026-06-30 cs.AI cs.MA 57%

Modelling Human Values for Value-Aware Multi-Agent Systems

为价值感知多智能体系统建模人类价值观

Nardine Osman, Mark d'Inverno

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个形式化框架,用于表示人类价值观,以支持多智能体系统中的价值感知推理。通过社会心理学研究,建立价值关系和重要性模型,实现行为评估和价值感知决策机制。

Comments arXiv admin note: text overlap with arXiv:2305.02748

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16527 2026-06-30 cs.CV cs.LG 57%

Contrastive vision-language learning with paraphrasing and negation

基于改写与否定的对比视觉-语言学习

Kwun Ho Ngan, Saman Sadeghi Afgeh, Joe Townsend, Artur d'Avila Garcez

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出SemCLIP模型,通过结合改写与否定的对比损失函数,提升视觉-语言模型在处理语义变化时的鲁棒性,实验证明其在零样本下游任务中表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21530 2026-06-30 cs.LG 57%

Expert-guided Clinical Text Augmentation via Query-Based Model Collaboration

通过基于查询的模型协作进行专家指导的临床文本增强

Dongkyu Cho, Miao Zhang, Rumi Chunara

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出基于查询的模型协作框架,利用专家知识指导文本增强,提升医疗信息保留并减少幻觉,实验显示在临床预测任务中表现优于传统方法。

Comments 18 pages, 6 figures, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30220 2026-06-30 cs.CV 50%

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

从准确性到视觉依赖性:审计与过滤交通视频问答中的模态崩溃

Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim, Zeynep Akata

专题命中 安全评测 :safety(abstract)

AI总结 针对交通视频问答中模型依赖文本捷径而非视觉证据的问题,提出盲差距和视觉增益两个数据集级诊断指标,以及实例级捷径分数实现无训练过滤,提升视觉基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30151 2026-06-30 cs.RO 50%

AERIS: Aerial-Edge Role-Driven Intelligence at Runtime via Orchestrated Language-Model Swarm

AERIS: 通过编排语言模型群在运行时实现空中边缘角色驱动智能

Jiabin Lou, Haopeng Wang, Xinyu Liu, Yu Zhang, Rongye Shi, Wenjun Wu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出AERIS框架,通过编排专用小语言模型和轻量感知控制模块,在边缘实现空中平台的长时指令分解与实时闭环运行。

Comments 10 pages, 11 figures. Preprint version of the submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30124 2026-06-30 cs.CV 50%

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

SciIR:面向科学图像推理生成的大规模训练数据集与基准

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)

专题命中 安全评测 :alignment(abstract)

AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29997 2026-06-30 cs.CV 50%

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

Rigel: 基于自蒸馏分数自适应的图像与视频字幕评估

Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Daichi Yashima, Komei Sugiura

机构 * Keio University(Keio大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出Rigel评估指标,通过自蒸馏从冻结LLM提取评估专用评分头,解决大词汇语言模型与小标签集不匹配问题,在视频字幕评估中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29097 2026-06-30 cs.CV 50%

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

TrafficAlign: 对齐大语言模型用于交通场景生成

Zhi Tu, Liangkun Niu, Tianyi Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 提出TrafficAlign框架,利用真实驾驶视频合成交通场景并对齐大语言模型,生成场景使自动驾驶模型碰撞率提升10.8%,微调后碰撞率降低36.1%。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 2026, pp. 39744-39754

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28364 2026-06-30 cs.IR 50%

LLM based Knowledge Graph Approach to Automating Medical Device Regulatory Compliance

基于LLM的知识图谱方法实现医疗器械监管合规自动化

Subhankar Chattoraj, Karuna Pande Joshi

专题命中 安全评测 :safety(abstract)

AI总结 提出结合知识图谱与大语言模型的方法,从FDA文档提取监管知识并自动分类医疗器械,实现合规评估自动化,减少人工审查并加速上市。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025, pp. 321-328

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23660 2026-06-30 physics.ed-ph 50%

Using Large Language Models in Physics Education

在物理教育中使用大型语言模型

Jonah L. Donaldson, Aliya Nawaz, Konstantinos Doran, Alysta Lim, Mario Campanelli

专题命中 安全评测 :alignment(abstract)

AI总结 本研究评估了2024年中至2025年底发布的前沿大型语言模型在解决大学物理问题(经典力学、电磁学、量子力学)和自动评分方面的能力,发现文本推理接近饱和,多模态集成解决了空间几何限制,但部分评分仍存在挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV 50%

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 10 篇

2601.12033 2026-06-30 cs.CL 83%

Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

通过关键权重保护在量化大语言模型中保持公平性与安全性

Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri Koto

机构 * Faculty of Computer Science, Universitas Indonesia(印度尼西亚大学计算机科学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了静态和动态量化对公平性和安全性的影響,提出关键权重保护技术以减少偏见和安全风险,保持模型效率与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17753 2026-06-30 cs.CY cs.AI 81%

The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems

2025人工智能代理指数:记录已部署代理式人工智能系统的技术和安全特性

Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

机构 * University of Cambridge(剑桥大学) University of Washington(华盛顿大学) Harvard Law School(哈佛法学院) Stanford University(斯坦福大学) Concordia AI(康科迪亚AI) University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出2025人工智能代理指数,记录30种先进代理式AI系统的起源、设计、能力、生态系统及安全特性,揭示代理发展中的趋势和开发者透明度问题。

Comments To be publishesd at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29280 2026-06-30 cs.LG cs.AI cs.CL 67%

Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning

高风险AI的确定性决策:具有RAG可部署性和机器学习准确性的零出口管道

Craig Atkinson

机构 * Verificate Pty Ltd(Verificate公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究识别并量化了零样本大语言模型在教育咨询中的干预偏差,通过监督策略学习(决策树和XGBoost)消除该偏差,实现接近零的校准误差,并揭示了评估差距。

Comments 41 pages, 11 tables, no figures. Preprint intended for submission to EDM 2027 / LAK 2027. Includes a reproducibility package: trained ONNX Decision Transformer, generic training script, OULAD evaluation scripts, and per-arm results CSVs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28796 2026-06-30 cs.CL cs.LG 62%

Structure-Preserving Document Translation via Multi-Stage LLM Pipeline: A Case Study in Marathi

通过多阶段LLM流水线实现结构保持的文档翻译:以马拉地语为例

Manasi Waghe, Danish Chandargi, Mohammad Aamir Rayyan, Raviraj Joshi, A. R. Deshpande

机构 * Pune Institute of Computer Technology(普那计算机技术学院) L3Cube Labs(L3Cube实验室) Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出一种结构保持的马拉地语-英语政府文档翻译框架,集成布局感知OCR、坐标文本提取、LLM翻译和HTML重建,确保文档布局和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28683 2026-06-30 cs.AI cs.CY stat.AP stat.ME 62%

Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

通过伦理困境对LLM进行亚里士多德式美德画像

Ioannis Tzachristas, John Pavlopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿提卡研究中心)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出VirtueMap框架,通过七种非致命、非政治、非宗教的伦理困境,让人类或LLM对五种回应排序,基于95%共识的参考排序,使用归一化Borda对齐计算实践智慧、正义、诚实、勇气和节制的美德画像,在九个LLM家族中评估,平均排名一致性达90.3%。

Comments VirtueMap website: https://jtzach.github.io/Aristotle-Virtue-Map

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16291 2026-06-30 cs.CY cs.AI cs.GT 62%

AI of the People, by the People, for the People: A Social Choice Approach to Collective Control of Artificial Intelligence

为人民的AI,由人民,为人民:一种社会选择方法用于集体控制人工智能

Paul Anton Bachmann, Niclas Boehmer, Lukas Daniel Klausner, Martin Lackner

机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) Hasso Plattner Institute, University of Potsdam(哈索·platzer研究所,波茨坦大学) Center for Artificial Intelligence, University of Applied Sciences St. Pölten(人工智能中心,圣波尔滕应用科学大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于社会选择理论的集体控制AI方法,强调在机器学习全流程中融入公众意见,提供数学框架评估控制机制。

Comments Accepted for publication in Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

Journal ref Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), 2026, 4610-4629

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12957 2026-06-30 cs.LG cs.AI 62%

Attribution Graphs and Causal Probing for Mechanistic Discovery and Bias Repair in Multimodal Generative Learning

揭示-修订:具有多模态注意力的可解释性偏见感知生成建模

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。

Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11534 2026-06-30 cs.CL cs.CY 62%

Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models

人工智能中的物种歧视:评估大型语言模型对动物的歧视

Monika Jotautaitė, Lucius Caviola, David A. Brewster, Thilo Hagendorff

机构 * Independent(独立学者) University of Cambridge(剑桥大学) Harvard University(哈佛大学) University of Stuttgart(斯图加特大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究评估大型语言模型是否表现出基于物种的歧视倾向,发现其在识别物种歧视言论方面可靠但较少谴责,且在文本生成中倾向于合理化对农场动物的伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-06-30 cs.CL econ.GN q-fin.EC 57%

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28340 2026-06-30 cs.IR 50%

Rethinking Fairness in LLM-Based Recommender Systems: A Survey

重新思考基于LLM的推荐系统中的公平性:一项综述

Song-Duo Ma, Chu-Yun Chen, Bang-An Li, Pin-Yu Chen, Shau-Yung Hsu, Yun-Nung Chen

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 31 篇

2606.29273 2026-06-30 cs.CL cs.AI 81%

A Hybrid Framework for Song Lyric Annotation Based on Human-LLM Alignment

基于人类-大语言模型对齐的歌词注释混合框架

Rashini Liyanarachchi, Frank Tran, Md Mahmudul Hasan, Aditya Joshi, Erik Meijering

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出混合注释框架,通过预测人类与LLM在歌词情感标注中的潜在不一致,优化注释过程,并创建句子级歌词数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏