arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 171 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2511.21607 2026-06-23 cs.DB cs.LG 57%

Beyond Accuracy: An Empirical Study of Uncertainty Estimation in Imputation

超越准确性:对缺失数据填补中不确定性估计的实证研究

Zarin Tahia Hossain, Mostafa Milani

机构 * Department of Computer Science Western University London, Ontario, Canada(计算机科学系 温哥华大学 安大略省伦敦市 加拿大)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文通过实证研究比较了三种主要填补方法家族的不确定性估计,发现高重建准确性并不一定意味着可靠的不确定性,提出了选择不确定性感知填补器的指导方针。

Comments To appear in conference proceedings

Journal ref Proceedings of the 2025 IEEE International Conference on Big Data, BigData 2025, Macau, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06917 2026-06-23 cs.LG eess.SP 57%

Efficient Unsupervised Domain Adaptation Regression for Spatial-Temporal Sensor Fusion

高效无监督领域适应回归用于空间-时间传感器融合

Keivan Faghih Niresi, Ismail Nejjar, Olga Fink

机构 * Intelligent Maintenance and Operations Systems Laboratory, EPFL(智能维护与操作系统实验室,瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种针对回归任务的高效无监督领域适应方法,通过整合空间-时间图神经网络和源目标域扰动逆Gram矩阵对齐,实现无标注数据下的可扩展领域适应,验证于空气质量监测和EEG信号重建任务,取得最佳性能。

Comments Accepted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 隐私与版权 7 篇

2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交 81%

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15980 2026-06-23 cs.LG cs.AI cs.CL 新提交 67%

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness

安全监控器在更新后是否仍可靠?激活监控器陈旧性的基准测试与预测

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型更新后激活监控器是否仍可靠,发现量化更新影响小,微调更新常导致监控器失效,且可通过预部署特征预测退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15948 2026-06-23 eess.SY cs.SY 新提交 67%

Artificial Intelligence for Power-Converter-Rich Electrical Systems: A Review

人工智能在富含电力电子变换器的电力系统中的应用综述

Pengfeng Lin, Yuan Gao, Yuxi Tang, Muhammad Waqas Qaisar, Peifeng Hui, Chuanlin Zhang, Miao Zhu, Xiaoyong, Cao, Chia-chi Chu, Peng Wang

专题命中 隐私与版权 :alignment(abstract);safety(abstract)

AI总结 本文综述了人工智能在富含电力电子变换器的电力系统全生命周期中的应用,涵盖设计、控制、运行和治理,并指出了部署关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 67%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17270 2026-06-23 cs.HC cs.AI cs.CR cs.CY 版本更新 62%

Understanding U.S. Users' Security and Privacy Transparency Needs for Consumer-Facing Generative AI

用户在面向消费者的人工智能生成技术中需要哪些安全和隐私透明度

Jiaxun Cao, Yu Dong, Chunxi Zhan, Rithvik Neti, Sai Teja Peddinti, Pardis Emami-Naeini

机构 * Duke University(杜克大学) Duke Kunshan University(杜克昆山大学) Google(谷歌)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨用户在使用面向消费者的人工智能生成技术时对安全和隐私信息的需求,发现现有信息不足以驱动初始采用,用户更依赖流行度等粗略指标,后续使用中不确定性影响用户行为,提出需可信信息和易用界面的透明度设计。

Comments To Appear at the Twenty-Second Symposium on Usable Privacy and Security (SOUPS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22483 2026-06-23 cs.LG cs.AI 版本更新 62%

OFMU: Optimization-Driven Framework for Machine Unlearning

OFMU:面向机器遗忘的优化驱动框架

Sadia Asif, Mohammad Mohammadi Amiri

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出OFMU,一种基于惩罚的双层优化框架,通过层次结构优先遗忘并保持保留性能,在视觉和语言基准上优于现有方法。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19780 2026-06-23 cs.AI 版本更新 57%

NOEM$^{3}$A: a Neuro-symbolic Ontology-Enhanced Method for Multi-intent understanding in Mobile Agents

NOEM$^{3}$A:一种用于移动代理中多意图理解的神经符号本体增强方法

Ioannis Tzachristas, Aifen Sui

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Technical University of Munich(慕尼黑技术大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 提出NOEM$^{3}$A,一种轻量级神经符号层,通过意图本体增强紧凑语言模型,在低延迟和隐私约束下提升移动代理的自然语言理解准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 60 篇

2606.22706 2026-06-23 cs.AI 新提交 83%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 83%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20626 2026-06-23 cs.CY cs.AI 新提交 81%

Efficient Safety Benchmarking via Item Response Theory

通过项目反应理论实现高效安全基准测试

Fabio Spagliardi, Mírian Silva, Ayan Datta, Aiden Zhou, Vamshi Bonagiri, Diogo Cruz

机构 * Supervised Program for Alignment Research (SPAR)(对齐研究监督计划) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 针对安全基准测试中项目信息量不均的问题,利用项目反应理论(IRT)实现自适应项目选择,将评估成本降低至少80%,最高达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 79%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21939 2026-06-23 cs.CL 新提交 79%

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

超越价值基准:通过对称Q分类测量大型语言模型中的价值结构对齐

Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出基于Q方法的对称人机评估框架,通过140项道德陈述的强制分布排序,测量LLM价值结构对齐,发现跨家族异质性和局部错位。

Comments 32 pages, 8 figures, 16 tables; accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21415 2026-06-23 cs.LG 新提交 79%

One Size does not Fit All: Heterogeneous Latent Space Alignment for Unsupervised Domain Adaptation

一种尺寸并不适合所有情况:无监督域适应的异构潜在空间对齐

Evangelia Koskinioti, Yi Shen, Georgios Stamou, Michael M. Zavlanos

机构 * Duke University(杜克大学) National Technical University of Athens(雅典国家技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出ADualVUOT框架,结合双编码器VAE与连续归一化流增强潜在表达,利用非平衡最优传输(GGW距离)对齐域,并引入对抗增强提升鲁棒性,在医学图像分割中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20686 2026-06-23 cs.RO cs.AI 新提交 79%

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

JPPD:具有可微安全引导的联合预测-规划扩散框架用于智能交通系统中的动态障碍物规避

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出联合预测-规划扩散框架,将参与者预测与机器人规划视为条件轨迹生成问题,通过可微安全势引导和条件流匹配提升共享空间中的安全性与效率。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 79%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 78%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 安全评测 :alignment(title,abstract)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07339 2026-06-23 cs.CR 78%

TDML -- A Trustworthy Distributed Machine Learning Framework

TDML -- 一个可信的分布式机器学习框架

Zhen Wang, Qin Wang, Guangsheng Yu, Shiping Chen

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出TDML框架,利用区块链协调远程训练器并验证工作负载,实现隐私、透明和高效的模型训练,克服性能限制和恶意节点检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 75%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 73%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20963 2026-06-23 cs.AI cs.CY cs.DB 新提交 73%

Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government

面向地方政府AI保障的生成式负责任AI数据评估模式(GRAIDES)

Ethan Knights, Christopher Conlan, Temilorun Gbolahan, Stephen Waterman, Gurpreet Muctor

机构 * AI Innovation Lab, Westminster City Council(威斯敏斯特市议会人工智能创新实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 提出轻量级开源数据模型GRAIDES,用于集中管理生成式AI的可观测性,通过代码、架构和统计评估蓝图,在组织层面实现系统保障,并在威斯敏斯特市议会案例中验证了人机对齐测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 73%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-06-23 cs.AI 新提交 70%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Amrita Singh, Rishabh Jha

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 70%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20663 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

DrugBench:评估用于减轻药物危害的AI控制协议

Guido Freire, Agustín Martínez-Suñé, Viviana Cotik

机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales, Departamento de Computación(布宜诺斯艾利斯大学,精确与自然科学学院,计算机系) AI Safety Argentina (AISAR)(阿根廷人工智能安全组织 (AISAR)) Department of Computer Science, University of Oxford(牛津大学计算机科学系) CONICET-Universidad de Buenos Aires, Instituto de Ciencias de la Computación (ICC)(阿根廷国家科学与技术研究理事会-布宜诺斯艾利斯大学,计算机科学研究所 (ICC))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DrugBench基准,结合医疗对话与FDA标签,评估AI控制协议在减轻药物交互、禁忌症等四类危害中的有效性,并引入基于严重性的监控方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-06-23 cs.AI cs.CL cs.LG stat.ML 新提交 67%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 67%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏