arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 62 篇

2606.01508 2026-06-02 cs.CR cs.AI 57%

Agent Operating Systems (AOS): Integrating Agentic Control Planes into, and Beyond, Traditional Operating Systems

代理操作系统 (AOS):将代理控制平面集成到传统操作系统及其之外

Ankur Sharma, Deep Shah

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出代理操作系统(AOS)架构,通过集成代理控制平面到现有操作系统或逐步接管部分OS职责,以解决传统OS在调度、内存管理、安全、可观测性和治理方面对长期目标导向的代理AI工作负载的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01276 2026-06-02 cs.CL 57%

Worlds Within Words: Translating Culture in Ancient Chinese Texts with Multi-Agent Coordination

词中世界:基于多智能体协调的古代汉语文本文化翻译

Xiaoqi He, Kaixin Lan, Mu You, Tao Fang, Lidia S. Chao, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学自然语言处理与计算机实验室,计算机与信息科学系) Institute of International Language Services Studies, Macau Millennium College(澳门 millennium 学院国际语言服务研究学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对古代汉语文本中文化负载词的翻译难题,提出多智能体文化感知翻译框架MACAT,通过选择性显化策略动态识别文化短语并注入简洁解释,在中医经典和《论语》上优于基线模型。

Comments The preprint manuscript is 20 pages long and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00871 2026-06-02 cs.CV cs.AI 57%

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

城市感知中的视觉语言模型基准应具备可靠性意识且可协商

Rashid Mushkani

机构 * Rashid Mushkani

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出,用于城市感知的视觉语言模型基准应将分歧和弃权视为测量结果,报告标注者间信度,并将标签空间和评分策略视为可协商的产物。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00523 2026-06-02 cs.CL 57%

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

ProactiveLLM: 学习流式大语言模型的主动交互

Junlong Tong, Yao Zhang, Anhao Zhao, Yingqi Fan, Yunpu Ma, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出ProactiveLLM,利用模型内生状态指导交互决策,通过掩码流式建模和同步特权自蒸馏实现主动交互,减少延迟并保持质量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00448 2026-06-02 cs.SE cs.AI cs.CR 57%

When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems

当安全技能碰撞:衡量智能体技能生态系统中的组合风险

Su Wang, Pin Qian, Yihang Chen, Junxian You, Xiaoyuan Wang, Xiaochong Jiang, Lifei Liu, Haoran Yu, Jingzhou Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学) Independent Researcher(独立研究员) Corespeed Inc.(Corespeed公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出SkillReact框架,通过静态组合基准、双评分者LLM辅助人工审核和基于动作的可利用性测试,研究LLM智能体中个体安全的技能组合后可能产生的不安全行为,发现约18.2%的候选组合存在真实风险,且主机模型决定是否利用这些组合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00320 2026-06-02 cs.LG 57%

Adversarially Robust Control of Conditional Value-at-Risk via Rockafellar-Uryasev Conformal Inference

通过Rockafellar-Uryasev共形推断的条件风险价值对抗鲁棒控制

Catherine Chen, Jingyan Shen, Zhun Deng, Lihua Lei

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出一种在线无分布框架,通过结合共形尾风险控制、在线学习和CVaR的变分表示,在非平稳和对抗环境下实现对条件风险价值(CVaR)的鲁棒控制,并提供渐近保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00168 2026-06-02 cs.CL 57%

RealityTest: How People Probe AI Identity and Whether Models Disclose It

RealityTest: 人们如何探查AI身份以及模型是否披露它

Anna Gausen, Sarenne Wallbridge, Bessie O'Dell, Christopher Summerfield, Hannah Rose Kirk

机构 * AI Security Institute(人工智能安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 通过收集来自49个国家约750名参与者的3152个身份探查查询,构建首个大规模多模态多语言基准RealityTest,发现仅31%的人在模糊场景中直接询问身份,且问题多样性远超机器生成查询,测试17个文本和6个语音模型后发现,问题措辞和对话上下文比模型本身对披露行为影响更大。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00030 2026-06-02 cs.CY 57%

From Parliamentary Rhetoric to Enacted Law: An NLP Pipeline for Semantic Auditing of the Greek Legislative Process

从议会修辞到制定法:用于希腊立法过程语义审计的NLP流水线

Despoina Antonakaki, Sotiris Ioannidis

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 提出一个多模态计算流水线,通过NLP分析议会辩论和立法文本,揭示法律复杂性、模糊性以及政治承诺与法律实施之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29365 2026-06-02 cs.CL 57%

Casual as an Anchor: Resolving Supervision Misalignment in Formality Transfer Dataset

Casual 作为锚点:解决语体转换数据集中的监督偏差

Hyojeong Yu, Hyukhun Koh, Minsung Kim, Kyomin Jung

机构 * Seoul National University(首尔国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出将语体转换重新概念化为一个分级维度,引入三层次谱系(非正式、随意、正式),并构建3LF数据集以解决现有基准中监督信号偏差导致的非正式到正式转换失败问题。

Comments HEAL@CHI 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25799 2026-06-02 cs.CL 57%

LISTEN to Your Preferences: An LLM Framework for Multi-Objective Selection

LISTEN 你的偏好:面向多目标选择的LLM框架

Adam S. Jovine, Tinghan Ye, Francis Bahk, Jingjing Wang, Matthew Ford, David B. Shmoys, Peter I. Frazier

机构 * Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出LISTEN框架,利用LLM作为决策代理,通过迭代优化内部偏好模型(LISTEN-U参数法或LISTEN-T非参数法)从自然语言中学习用户隐含偏好,实现多目标选择。

Comments Accepted at IJCAI-ECAI 2026 (the 35th International Joint Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01841 2026-06-02 cs.AI 57%

Retrieval-aligned Tabular Foundation Models Enable Robust Clinical Risk Prediction in Electronic Health Records Under Real-world Constraints

检索对齐的表格基础模型实现电子健康记录中在现实约束下的稳健临床风险预测

Minh-Khoi Pham, Thang-Long Nguyen Ho, Thao Thi Phuong Dao, Tai Tan Mai, Minh-Triet Tran, Marie E. Ward, Una Geary, Rob Brennan, Nick McDonald, Martin Crane, Marija Bezbradica

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对电子健康记录中高维、异质、类别不平衡和分布偏移等挑战,提出任务对齐检索框架AWARE,通过监督嵌入学习和轻量适配器提升表格上下文学习性能,在极端不平衡下AUPRC提升高达12.2%。

Comments Not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 57%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07083 2026-06-02 cs.SE cs.AI 57%

Rethinking Scientific Modeling: Toward Physically Consistent and Simulation-Executable Programmatic Generation

重新思考科学建模:迈向物理一致且可模拟执行的程序化生成

Yongqing Jiang, Jianze Wang, Zhiqi Shen, Zhenghong Lin, Jiayuan Wang, Yijian Yang, Kaoshan Dai, Haoran Luo

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学) Fuzhou University(福州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对大型语言模型在工程建模中生成代码的物理不一致问题,提出结合领域知识构建、约束对齐和验证驱动的框架,并引入CivilInstruct数据集和MBEval基准,通过两阶段微调提升模型生成的可执行性和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02258 2026-06-02 cs.CE 50%

Matter to Mechanism: A Benchmark for AI Co-Scientists in Materials and Battery Research

物质到机制:材料与电池研究中AI合作科学家的基准

Shashwat Sourav, Tanjin. He, Maria K. Y. Chan, Anubhav Jain, Tirthankar Ghosal

专题命中 安全评测 :alignment(abstract)

AI总结 提出Matter to Mechanism基准,通过结构化问题-假设推理任务评估AI合作科学家在材料科学(特别是电池研究)中的表现,并引入复合评分体系。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03384 2026-06-02 cs.CR cs.SD 50%

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

DECKER: 跨键盘提取与识别的域不变嵌入

Bikrant Bikram Pratap Maurya, Nitin Choudhury, Daksh Agarwal, Arun Balaji Buduru

机构 * IIIT-Delhi(印度德里理工学院) Guru Gobind Singh Indraprastha University(戈克辛格印度教大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对键盘声学侧信道攻击的跨键盘、跨用户和噪声环境泛化问题,提出包含四阶段域不变击键推理框架DECKER,并构建了多维度数据集HEAR,实验表明该方法在跨键盘和跨用户场景下显著提升击键识别性能。

Comments Accepted to AsiaCCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00782 2026-06-02 cs.CV 50%

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection

FlowOVD: 学习生成式潜在流用于零样本开放词汇检测

Yao Wei, Andrea Cavallaro, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出FlowOVD,基于修正流的文本条件查询生成框架,通过连续潜在查询动态实现开放词汇检测,在COCO和LVIS上分别达到49.5 AP和31.5 AP,优于GroundingDINO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00689 2026-06-02 cs.CV 50%

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

小波融合扩散模型用于多模态脑MRI合成,具有模态和元数据条件

Muhammad Nabi Yasinzai, Remika Mito, Mangor Pedersen

机构 * Department of Psychology & Neuroscience, Auckland University of Technology(心理学与神经科学系,奥克兰技术大学) Department of Psychiatry, University of Melbourne(精神病学系,墨尔本大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出一种小波融合扩散模型(WFDM),结合小波融合变分自编码器(WF-VAE)和条件3D U-Net扩散模型,通过显式模态和元数据条件实现多模态脑MRI合成,解决了数据集模态覆盖不均和异质性问题,在分布对齐上优于现有方法。

Comments 51 pages, 7 figures, including supplementary material. Submitted to Imaging Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00669 2026-06-02 cs.CR 50%

NeuroLog: Reasoning You Can Audit -- Neuro-Symbolic Vulnerability Discovery via LLM Facts, Datalog, and SMT

NeuroLog: 可审计的推理——通过LLM事实、Datalog和SMT进行神经符号漏洞发现

Sanjay Rawat

专题命中 安全评测 :safety(abstract)

AI总结 提出NeuroLog流水线,结合LLM提取事实、Souffle规则组合和Z3后处理,实现无需构建的漏洞发现,并在多个真实项目中重新发现CVE级漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00592 2026-06-02 cs.CV 50%

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

通过PRISM:原则感知、可解释和多尺度的视觉设计评估

Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy, Sayan Nag

机构 * Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出PRISM基准和一种多尺度评估框架,通过原则扰动和分层分析实现可解释的设计质量评估。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00167 2026-06-02 cs.SE cs.LO 50%

Specification-Driven Development Benchmark: Security Knowledge Transition

规范驱动开发基准:安全知识迁移

Oleg Grynets, Andrii Salyk, Vasyl Lyashkevych, Oleh Kaskun, Danyil Zhuravchak

专题命中 安全评测 :safety(abstract)

AI总结 针对AI辅助规范驱动开发中安全行为隐式化的问题,提出多层规范安全模型和安全知识迁移方法,通过结构化安全知识提升生成系统的安全性。

Comments 15 pages, 7 figures, 8 tables, 32 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18340 2026-06-02 cs.CV 50%

Beyond Rigid: Benchmarking Non-Rigid Video Editing

超越刚性:非刚性视频编辑基准测试

Bingzheng Qu, Xuefeng Bai, Kehai Chen, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 安全评测 :alignment(abstract)

AI总结 提出NRVBench诊断基准,通过物理感知评估框架揭示传统指标在非刚性视频编辑中的不足,并引入VM-Edit基线分析稳定性-可塑性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 12 篇

2509.05367 2026-06-02 cs.CR cs.AI 88%

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs

进退维谷:大型语言模型中伦理推理与安全对齐之间的张力

Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26397 2026-06-02 cs.CL cs.AI 73%

Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

LLM生成的自闭症交流中的算法脆弱性与人格偏见

Naba Rizvi, Mohammed Rizvi, Harper Strickland, Saleha Ahmedi, Nedjma Ousidhoum

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过双人格改写范式,发现LLM在生成自闭症人格文本时存在词汇与情感偏离、输出坍塌等系统性失败,且对齐策略而非参数规模主导这些失败,表明当前对齐训练导致深层表征鸿沟。

Comments main paper: 9 pages; total: 19 pages; 2 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00003 2026-06-02 cs.CY cs.CR cs.HC 70%

Learning from Mistakes: Can LLM Self-Recover after Misalignment?

从错误中学习:LLM 在错位后能否自我恢复?

Olga E. Sorokoletova, Francesco Giarrusso, Vincenzo Suriani, Daniele Nardi

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 研究大语言模型在遭受恶意攻击后,是否具有内在的自我对齐恢复能力,并提出一种建模用户-助手交互安全轨迹并检测恢复趋势的方法。

Comments AAAI'26 Workshop (WS37), Machine Ethics: from formal methods to emergent machine ethics, January 20--27, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 67%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00020 2026-06-02 cs.CL cs.AI 62%

CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards

CSRP:基于效率感知奖励的强化学习链式推理中文文本纠错

Wei Tian, Yuhao Zhou, Man Lan

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华大学教育人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CSRP三阶段框架,通过连续预训练、链式推理监督微调和基于效率感知奖励的组相对策略优化,在NACGEC基准上实现最优性能,有效缓解过度纠正偏差。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24005 2026-06-02 cs.AI cs.CL 62%

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD:通过一致性调节奖励分解挖掘潜在逻辑以实现自我进化推理

Yanyu Chen, Jiyue Jiang, Dianzhi Yu, Zheng Wu, Jiahong Liu, Jiaming Han, Xiao Guo, Jinhu Qi, Yu Li, Yifei Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中高质量过程数据稀缺的问题,提出LC-ERD框架,通过潜在逻辑挖掘和一致性调节的奖励分解,实现自我对齐与推理进化。

Comments Accepted in SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16139 2026-06-02 cs.CY cs.AI 62%

Enhancing Trust Through Standards: A Comparative Risk-Impact Framework for Aligning ISO AI Standards with Global Ethical and Regulatory Contexts

通过标准增强信任:一种用于对齐ISO AI标准与全球伦理和监管背景的比较风险-影响框架

Sridharan Sankaran

机构 * Research and Innovation Group(研究与创新组) Tata Consultancy Services(塔塔咨询服务)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出比较风险-影响评估框架,分析ISO AI标准在不同监管环境下的伦理风险覆盖情况,并建议通过强制审计、区域附件和隐私模块增强其全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02578 2026-06-02 cs.CV cs.AI 57%

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00359 2026-06-02 cs.CY 57%

Next-Billion AI Index: The compass for AI utility and adoption in the global majority

Next-Billion AI Index: 面向全球大多数人口的AI实用性与采用指南针

Ambrish Rawat, Jessica He, Subhabrata Majumdar, Claudio Pinhanez, Yann Le Beux, Satyapriya Krishna, Rahul Gupta, Rumman Chowdhury, Kush R. Varshney

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出Next Billion AI Index (nexbax)诊断框架,通过经济可行性、运营可部署性和治理对齐三个主题下的10个维度,评估AI在下一个十亿用户环境中的实用性,并通过专家访谈验证其有效性。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏