arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7978 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7978 篇

2602.15763 2026-02-25 cs.LG cs.CL 62%

GLM-5: from Vibe Coding to Agentic Engineering

GLM-5:从振动编码到代理工程

GLM-5-Team, :, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang, Chengxing Xie, Chenzheng Zhu, Congfeng Yin, Cunxiang Wang, Gengzheng Pan, Hao Zeng, Haoke Zhang, Haoran Wang, Huilong Chen, Jiajie Zhang, Jian Jiao, Jiaqi Guo, Jingsen Wang, Jingzhao Du, Jinzhu Wu, Kedong Wang, Lei Li, Lin Fan, Lucen Zhong, Mingdao Liu, Mingming Zhao, Pengfan Du, Qian Dong, Rui Lu, Shuang-Li, Shulin Cao, Song Liu, Ting Jiang, Xiaodong Chen, Xiaohan Zhang, Xuancheng Huang, Xuezhen Dong, Yabo Xu, Yao Wei, Yifan An, Yilin Niu, Yitong Zhu, Yuanhao Wen, Yukuo Cen, Yushi Bai, Zhongpei Qiao, Zihan Wang, Zikang Wang, Zilin Zhu, Ziqiang Liu, Zixuan Li, Bojie Wang, Bosi Wen, Can Huang, Changpeng Cai, Chao Yu, Chen Li, Chengwei Hu, Chenhui Zhang, Dan Zhang, Daoyan Lin, Dayong Yang, Di Wang, Ding Ai, Erle Zhu, Fangzhou Yi, Feiyu Chen, Guohong Wen, Hailong Sun, Haisha Zhao, Haiyi Hu, Hanchen Zhang, Hanrui Liu, Hanyu Zhang, Hao Peng, Hao Tai, Haobo Zhang, He Liu, Hongwei Wang, Hongxi Yan, Hongyu Ge, Huan Liu, Huanpeng Chu, Jia'ni Zhao, Jiachen Wang, Jiajing Zhao, Jiamin Ren, Jiapeng Wang, Jiaxin Zhang, Jiayi Gui, Jiayue Zhao, Jijie Li, Jing An, Jing Li, Jingwei Yuan, Jinhua Du, Jinxin Liu, Junkai Zhi, Junwen Duan, Kaiyue Zhou, Kangjian Wei, Ke Wang, Keyun Luo, Laiqiang Zhang, Leigang Sha, Liang Xu, Lindong Wu, Lintao Ding, Lu Chen, Minghao Li, Nianyi Lin, Pan Ta, Qiang Zou, Rongjun Song, Ruiqi Yang, Shangqing Tu, Shangtong Yang, Shaoxiang Wu, Shengyan Zhang, Shijie Li, Shuang Li, Shuyi Fan, Wei Qin, Wei Tian, Weining Zhang, Wenbo Yu, Wenjie Liang, Xiang Kuang, Xiangmeng Cheng, Xiangyang Li, Xiaoquan Yan, Xiaowei Hu, Xiaoying Ling, Xing Fan, Xingye Xia, Xinyuan Zhang, Xinze Zhang, Xirui Pan, Xu Zou, Xunkai Zhang, Yadi Liu, Yandong Wu, Yanfu Li, Yidong Wang, Yifan Zhu, Yijun Tan, Yilin Zhou, Yiming Pan, Ying Zhang, Yinpei Su, Yipeng Geng, Yong Yan, Yonglin Tan, Yuean Bi, Yuhan Shen, Yuhao Yang, Yujiang Li, Yunan Liu, Yunqing Wang, Yuntao Li, Yurong Wu, Yutao Zhang, Yuxi Duan, Yuxuan Zhang, Zezhen Liu, Zhengtao Jiang, Zhenhe Yan, Zheyu Zhang, Zhixiang Wei, Zhuo Chen, Zhuoer Feng, Zijun Yao, Ziwei Chai, Ziyuan Wang, Zuzhou Zhang, Bin Xu, Minlie Huang, Hongning Wang, Juanzi Li, Yuxiao Dong, Jie Tang

机构 * GLM-5 Team(GLM-5团队) Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14462 2026-02-25 cs.LG cs.AI 62%

Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment

数据并行全微调中的沉默不一致:诊断工作级别优化不一致

Hong Li, Zhen Zhou, Honggang Zhang, Yuping Luo, Xinyue Wang, Han Gong, Zhiyuan Liu

机构 * School of Transportation Southeast University(交通学院东南大学) Department of Logistics and Maritime Studies The Hong Kong Polytechnic University(物流与海运研究部香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种轻量诊断框架,用于检测数据并行微调中工作级别优化的不一致问题,通过损失分散度、梯度范数分散度和方向一致性指标,揭示隐藏的不稳定性模式。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02620 2026-02-25 q-bio.QM cs.AI cs.LG 62%

CryoLVM: Self-supervised Learning from Cryo-EM Density Maps with Large Vision Models

CryoLVM: 从冷冻电镜密度图中利用大视觉模型进行自监督学习

Weining Fu, Kai Shu, Kui Xu, Qiangfeng Cliff Zhang

机构 * State Key Laboratory of Membrane Biology, Beijing Frontier Research Center of Biological Structures, Tsinghua-Peking Joint Center for Life Sciences, School of Life Sciences, Tsinghua University, Beijing, China(膜生物学国家重点实验室,北京生物结构前沿研究中心,清华-北大联合生命科学中心,生命科学学院,清华大学,北京,中国) State Key Laboratory of Membrane Biology-Membrane Structure and Artificial Intelligence Biology Branch,Hangzhou, China(膜生物学国家重点实验室-膜结构与人工智能生物学分支,杭州,中国) State Key Laboratory of Membrane Biology, Beijing Tsinghua Institute for Frontier Interdisciplinary Innovation, Beijing, China(膜生物学国家重点实验室,北京清华大学前沿交叉创新研究院,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CryoLVM通过自监督学习从冷冻电镜密度图中提取结构信息,结合JEPA与SCUNet实现高效适应多种下游任务,提升密度图处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20104 2026-02-24 cs.AI cs.HC cs.LG 62%

Align When They Want, Complement When They Need! Human-Centered Ensembles for Adaptive Human-AI Collaboration

在需要时对齐,在想要时补充!面向适应性人机协作的人本集成

Hasan Amin, Ming Yin, Rajiv Khanna

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种人本适应性AI集成,通过上下文提示在对齐与互补模型间切换,以提升人机协作的性能与信任。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13632 2026-02-24 cs.CL cs.AI eess.AS 62%

Closing the Gap Between Text and Speech Understanding in LLMs

弥合语言模型中文本与语音理解之间的差距

Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

机构 * Université de Toulon, Aix Marseille Université, CNRS, LIS(法国图卢兹大学、马赛大学、CNRS、LIS)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SALAD通过主动选择和跨模态蒸馏提高语音与文本对齐,以更高效的方式弥合LLMs在语音理解上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12313 2026-02-24 eess.IV cs.AI cs.LG 62%

Visible and Hyperspectral Imaging for Quality Assessment of Milk: Property Characterisation and Identification

可见光和超光谱成像在牛奶质量评估中的应用:性质表征与识别

Massimo Martinelli, Elena Tomassi, Nafiou Arouna, Morena Gabriele, Laryssa Perez Fabbri, Luisa Pozzo, Bianca Castiglioni, Paola Cremonesi, Giuseppe Conte, Davide Moroni, Laura Pucci

机构 * Institute of Information Science and Technologies, National Research Council(信息科学与技术研究所,国家研究理事会) Institute of Agricultural Biology and Biotechnology, National Research Council(农业生物学与生物技术研究所,国家研究理事会) Department of Agricultural, Food, and Agri-Environmental Sciences(农业、食品和农业环境科学系)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用可见光和超光谱成像结合机器学习,实现了对牛奶中多酚、抗氧化能力及脂肪酸等关键性质的快速非破坏性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04940 2026-02-24 cs.CL cs.AI 62%

VQEL: Enabling Self-Play in Emergent Language Games via Agent-Internal Vector Quantization

VQEL: 通过内部向量量化在涌现语言游戏中实现自我对战

Mohammad Mahdi Samiei Paqaleh, Mehdi Jamalkhah, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering(计算机工程系) Sharif University of Technology(谢里夫理工学院) School of Electrical and Computer Engineering(电气与计算机工程学院) University of Tehran(德黑兰大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 VQEL通过内部向量量化在自我对战中实现语言涌现,提升离散通信协议的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18451 2026-02-24 cs.CY cs.AI 62%

Developing a Multi-Agent System to Generate Next Generation Science Assessments with Evidence-Centered Design

开发一个多智能体系统以生成下一代科学评估并采用证据中心设计

Yaxuan Yang, Jongchan Park, Yifan Zhou, Xiaoming Zhai

机构 * AI4STEM Education Center, University of Georgia(AI4STEM教育中心,佐治亚大学) Department of Educational Psychology, University of Georgia(教育心理学系,佐治亚大学) School of Computing, University of Georgia(计算学院,佐治亚大学) Department of Mathematics, Science, and Social Studies Education, University of Georgia(数学、科学与社会科学教育系,佐治亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出将证据中心设计整合到多智能体系统中,以自动生成符合NGSS的评估项目,发现AI生成的项目在包容性方面表现良好,但存在清晰性和多模态设计的局限。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16826 2026-02-20 cs.LG cs.AI 62%

HiVAE: Hierarchical Latent Variables for Scalable Theory of Mind

HiVAE:用于可扩展理论之心的层次潜在变量

Nigel Doering, Rahath Malladi, Arshia Sangwan, David Danks, Tauhidur Rahman

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HiVAE通过层次化变分架构提升理论之心推理能力,解决现实时空领域中的心理状态推断问题,并提出自监督对齐策略以增强潜在表示的参照性。

Comments Accepted at the Workshop on Theory of Mind for AI (ToM4AI) at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), Singapore, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16755 2026-02-20 q-bio.OT cs.AI cs.CL 62%

PREFER: An Ontology for the PREcision FERmentation Community

PREFER:一个用于精确发酵社区的本体

Txell Amigó, Shawn Zheng Kai Tan, Angel Luu Phanthanourak, Sebastian Schulz, Pasquale D. Colaianni, Dominik M. Maszczyk, Ester Milesi, Ivan Schlembach, Mykhaylo Semenov Petrov, Marta Reventós Montané, Lars K. Nielsen, Jochen Förster, Bernhard Ø. Palsson, Suresh Sudarsan, Alberto Santos

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PREFER是一个开源本体,旨在为精确发酵社区建立统一标准,促进生物过程数据的互操作性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15322 2026-02-18 cs.LG cs.AI 62%

On Surprising Effectiveness of Masking Updates in Adaptive Optimizers

自适应优化器中掩码更新的意外有效性

Taejong Joo, Wenhan Xia, Cheolmin Kim, Ming Zhang, Eugene Ie

机构 * Northwestern University(西北大学) Google(谷歌)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Magma通过动量对齐梯度掩码提升自适应优化器性能,显著降低大型语言模型的困惑度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09982 2026-02-17 cs.CL cs.AI 62%

Context Volume Drives Performance: Tackling Domain Shift in Extremely Low-Resource Translation via RAG

上下文体积驱动性能:通过RAG解决极低资源翻译中的领域偏移

David Samuel Setiawan, Raphaël Merx, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过RAG方法,利用检索增强生成技术,在极低资源翻译中有效缓解领域偏移问题,恢复性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14229 2026-02-17 cs.AI cs.ET cs.LG 62%

CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments

CORPGEN:在多时间尺度任务环境中通过自主数字员工模拟企业环境

Abubakarr Jaye, Nigel Boachie Kumankumah, Chidera Biringa, Anjel Shaileshbhai Patel, Sulaiman Vesal, Dayquan Julienne, Charlotte Siska, Manuel Raúl Meléndez Luján, Anthony Twum-Barimah, Mauricio Velazco, Tianwei Chen

机构 * Microsoft Corporation(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CorpGen通过分层规划、子代理隔离和分层内存等机制,在多时间尺度任务环境中实现自主数字员工的高效模拟,提升企业环境模拟的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 62%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13248 2026-02-17 cs.AI cs.CL cs.RO 62%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12778 2026-02-16 cs.CL cs.LG 62%

Aspect-Based Sentiment Analysis for Future Tourism Experiences: A BERT-MoE Framework for Persian User Reviews

面向未来旅游体验的基于方面的情感分析:一种针对波斯语用户评论的BERT-MoE框架

Hamidreza Kazemi Taskooh, Taha Zare Harofte

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种BERT-MoE框架,用于波斯语旅游评论的基于方面的情感分析,实现90.6%的ABSA F1分数,同时提升计算效率,支持可持续AI发展。

Comments 25 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12546 2026-02-16 eess.AS cs.AI cs.CL cs.SD 62%

Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR

仅解码器的Conformer结合模态感知的稀疏专家混合

Jaeyoung Lee, Masato Mimura

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种仅解码器的Conformer模型,通过模态感知的稀疏混合专家实现更高效的ASR,减少了参数使用并提升了识别准确率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 62%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00185 2026-02-11 cs.AI cs.LG 62%

Chunking Strategies for Multimodal AI Systems

多模态AI系统中的分块策略

Shashanka B R, Mohith Charan R, Seema Banu F

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。

Comments 50 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10030 2026-02-11 cs.CL cs.AI 62%

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

面向推理的提示优化以对齐黑盒大语言模型

Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAPO框架,通过联合优化提示和推理规模,提升黑盒大语言模型对齐效果。

Comments Accepted to AAAI 2026. Extended 17-page version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09552 2026-02-11 cs.CL cs.AI cs.IR 62%

Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA

跨多领域对话问答中RAG方法的全面比较

Klejda Alushi, Jan Strich, Chris Biemann, Martin Semmann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过跨多领域对话问答数据集的全面比较,发现简单策略在多轮对话中表现更优,而复杂方法未必有效,强调检索策略与数据集结构的匹配至关重要。

Comments Accepted to EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16054 2026-02-11 cs.CL cs.AI 62%

Learning Tractable Distributions Of Language Model Continuations

学习可 tractable 的语言模型延续分布

Gwen Yidou-Weng, Ian Li, Anji Liu, Oliver Broadrick, Yuchen Cui, Guy Van den Broeck, Benjie Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 LTLA通过结合神经网络和隐马尔可夫模型,提高语言模型延续的可 tractable 性,实现更高效的解码和更强的约束控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09003 2026-02-10 cs.AI cs.CL 62%

Data Science and Technology Towards AGI Part I: Tiered Data Management

数据科学与技术迈向通用人工智能 Part I:分层数据管理

Yudong Wang, Zixuan Fu, Hengyu Zhao, Chen Zhao, Chuyue Zhou, Xinle Lin, Hongya Lyu, Shuaikang Xue, Yi Yi, Yingjiao Wang, Zhi Zheng, Yuzhou Zhang, Jie Zhou, Chaojun Xiao, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) ModelBest Inc.(ModelBest公司) Beijing Institute of Technology(北京理工大学) South China Agricultural University(华南农业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层数据管理框架,通过数据与模型的协同进化提升大语言模型训练效率和性能。

Comments 16 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03041 2026-02-10 cs.LG cs.AI 62%

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

Optimas: 通过全局对齐的局部奖励优化复合AI系统

Shirley Wu, Parth Sarthi, Shiyu Zhao, Aaron Lee, Herumb Shandilya, Adrian Mladenic Grobelnik, Nurendra Choudhary, Eddie Huang, Karthik Subbian, Linjun Zhang, Diyi Yang, James Zou, Jure Leskovec

机构 * Stanford University(斯坦福大学) Amazon(亚马逊) Jožef Stefan Institute(乔泽夫·斯蒂芬研究所) Rutgers University(罗格斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Optimas通过全局对齐的局部奖励优化复合AI系统,有效提升复合系统的性能。

Comments Accepted to ICLR 2026. 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07338 2026-02-10 cs.CL cs.AI 62%

Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation

意图不匹配导致大语言模型在多轮对话中迷失

Geng Liu, Fei Zhu, Rong Feng, Changyi Ma, Shiqi Wang, Gaofeng Meng

机构 * College of Computing, City University of Hong Kong(香港城市大学计算机学院) Centre for Artificial Intelligence and Robotics, HKISI, CAS(中国科学院香港中文大学人工智能与机器人中心) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出调解员-助手架构,通过解耦意图理解和任务执行,解决大语言模型在多轮对话中因意图不匹配导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04210 2026-02-09 cs.AI cs.LG 62%

Steering LLMs via Scalable Interactive Oversight

通过可扩展的交互监督引导大语言模型

Enyu Zhou, Zhiheng Xi, Long Ma, Zhihao Zhang, Shihan Dou, Zhikai Lei, Guoteng Wang, Rui Zheng, Hang Yan, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14625 2026-02-09 cs.CL cs.AI 62%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04116 2026-02-05 cs.LG cs.AI cs.SI 62%

Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach

迈向有效的多模态图基础模型:基于分而治之的方法

Sicheng Liu, Xunkai Li, Daohan Su, Ru Zhang, Hongchao Qin, Ronghua Li, Guoren Wang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PLANET提出了一种基于分而治之的方法,通过解耦模态交互和对齐,提升多模态图基础模型的性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04074 2026-02-05 cs.LG cs.CL 62%

Stroke Lesions as a Rosetta Stone for Language Model Interpretability

中风病变作为语言模型可解释性的一种罗塞塔石碑

Julius Fridriksson, Roger D. Newman-Norlund, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Xiang Guan, Yong Yang, Srihari Nelakuditi, Rutvik Desai, Leonardo Bonilha, Jeff Charney, Chris Rorden

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 中风病变被用于验证语言模型的可解释性,通过比较模型扰动与人类病变模式,揭示语言处理的共享计算原则。

Comments 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14157 2026-02-05 cs.SD cs.AI cs.LG 62%

ConceptCaps: a Distilled Concept Dataset for Interpretability in Music Models

ConceptCaps:用于音乐模型可解释性的精简概念数据集

Bruno Sienkiewicz, Łukasz Neumann, Mateusz Modrzejewski

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ConceptCaps通过分离语义建模与文本生成,提供一个包含21,000个音乐-标签三元组的数据集,用于提升音乐模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏