arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1357 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1357 篇

2608.05656 2026-08-11 cs.CY cs.AI cs.HC 版本更新 70%

Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics

研究人以研究AI:关于人类研究在AI安全与伦理中的认知适配性及障碍的专家观点

Jessica Y. Bo, Paula Akemi Aoyagui, Shalaleh Rismani, Dipto Das, Syed Ishtiaque Ahmed, Ashton Anderson

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过对93名AI安全与伦理领域专家的调查及17名专家的访谈,分析了人类研究在AI安全与伦理领域的认知适配性与障碍,并提出相关建议以避免流于形式的“人类洗白”。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21916 2026-08-11 cs.CL cs.SE 版本更新 70%

MathDuels: A Self-Play Benchmark That Grows

MathDuels:评估大语言模型作为问题提出者和解决者

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Mathematics, University of Pennsylvania(宾夕法尼亚大学数学系)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 MathDuels通过让模型同时扮演问题提出者和解决者角色,揭示了模型在两者能力上的差异,展示了评估方法在区分模型能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22028 2026-08-11 cs.CL 版本更新 70%

Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics

通过长度惩罚:揭示质量估计指标中的系统性偏差

Yilin Zhang, Wenda Xu, Zhongtao Liu, Tetsuji Nakagawa, Markus Freitag

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究揭示了质量估计指标在翻译长度上的系统性偏差,指出长度偏差可能导致对长译文的不公平惩罚,并通过长度归一化训练方法改进了指标的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02436 2026-08-11 cs.AI 版本更新 70%

Agentic AI for Clustering, Relationship Discovery, and Semantic Trading in Prediction Markets

语义交易:用于预测市场聚类和关系发现的代理AI

Agostino Capponi, Alfio Gliozzo, Brian Zhu

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种代理AI方法,通过自然语言处理将预测市场划分为主题组并发现市场间的关系,利用历史数据验证其预测准确性及交易策略收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22130 2026-08-11 cs.LG 版本更新 70%

Benchmarking In-context Experiential Learning Through Repeated Product Recommendations

通过重复产品推荐评估上下文经验学习

Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出BELA基准,通过重复产品推荐场景评估智能体在动态环境中的经验学习与主动探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05825 2026-08-10 cs.CL 版本更新 70%

MoCA: Implicit Social Context Analysis

MoCA:隐式社会语境分析

Wenhao Xu, Kaiwen Zhang, Hao Li, Maowei You, Yongzheng Ji, Siyuan Zuo, Jingxuan Yu, Sina A, Xinyao Tan, Bobo Li, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 70%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18056 2026-08-07 cs.CL q-bio.GN 版本更新 70%

An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

前沿大语言模型中新兴生物安全风险的早期预警

Zhida He, Xia Hu, Baichen Le, Chunxiao Li, Jiajia Li, Lijun Li, Chaochao Lu, Jing Shao, Youbang Sun, Hua Tang, Xiang Wang, Xiao Wang, Xiaoyu Wen, Tong Wu, Jia Xu, Peng Yu, Shu Yu, Jie Zhang, Qiaosheng Zhang, Yi Zhang, Xing-Ming Zhao, Tianhang Zheng, Ziyuan Zhou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。

Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 70%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00059 2026-08-07 cs.CY cs.AI 版本更新 70%

Stochastic Parrots or Singing in Harmony? Testing Five Leading LLMs for their Ability to Replicate a Human Survey with Synthetic Data

随机鹦鹉还是和谐合唱?测试五种领先的大语言模型在复制人类调查响应方面的能力

Jason Miklian, Kristian Hoelscher, John E. Katsos

机构 * Centre for Global Sustainability, University of Oslo(全球可持续发展中心,奥斯陆大学) Peace Research Institute Oslo(奥斯陆和平研究所) American University of Sharjah(阿联酋沙迦美国大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文比较了420名硅谷程序员和开发者的调查数据与五种大语言模型生成的合成数据,发现AI生成的数据在技术上合理但无法捕捉人类调查的非直观洞察,表明合成调查数据在组织研究中存在局限。

Comments V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21800 2026-08-07 cs.AI 版本更新 70%

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench: 一个用于生物信息学的AI代理评估套件

Dionizije Fa, Marko Culjak, Bruno Pandza, Mateo Cupic

机构 * Entropic

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15604 2026-08-07 cs.CL 版本更新 70%

Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges

文本生成:关于任务、评估与挑战的系统文献综述

Jonas Becker, Jan Philip Wahle, Bela Gipp, Terry Ruas

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该系统综述梳理2017-2025年257篇论文,划分文本生成五大任务,评估三类方法,指出任务特有与共有的9项挑战,为NLP领域不同阶段研究者提供领域概览与研究方向参考。

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02150 2026-08-06 cs.CV cs.AI 版本更新 70%

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。

Comments 15pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02965 2026-08-05 cs.AI 版本更新 70%

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents

基准测试无法衡量的:论自主智能体弃权能力的评估

Victor Ojewale, Suresh Venkatasubramanian

机构 * Brown University(布朗大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。

Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26275 2026-08-05 cs.CL 版本更新 70%

SPEAR: Code-Augmented Agentic Prompt Optimization

SPEAR: 代码增强的智能体提示优化

Mengyin Lu, Cong Feng, Huimin Han, Guangming Lu, Yu Sun, Xiaonan Ding, Shihui Long, Fengyi Li, Tanvi Motwani

机构 * LinkedIn Corporation(领英公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。

Comments 19 pages, 3 figures, EMNLP 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17003 2026-08-05 cs.CY cs.CL 版本更新 70%

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

超越模拟:20000次真实对话揭示心理健康AI安全

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11421 2026-08-05 cs.CL 版本更新 70%

States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States

隐藏状态中隐藏的状态:大型语言模型的隐藏状态中出现隐式离散状态表示

Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探索LLMs的符号计算能力,发现其隐藏状态中存在隐式离散状态表示(IDSRs),最强模型可直接计算最多15个加数的求和,但当前开源模型的IDSRs存在损耗会导致输出错误。

Comments 12 pages, 12 figures. Revised manuscript with public code and reproducibility artifacts; clarified the evaluation protocol; corrected figure labels and chance baselines, the attention-bridge description, cross-references, and probe notation. No new experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19396 2026-08-04 cs.AI 版本更新 70%

CrackedPDFs: A Controlled Benchmark for Hidden Prompt Injection in PDFs

CrackedPDFs:用于PDF中隐藏提示注入的受控基准测试

Pukaphol Thienpreecha, Karthik Subramanian

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对PDF中隐藏提示注入问题,引入CrackedPDFs基准测试,评估多种检测方法,如PromptGuard、结构学习模型等,结果显示文档感知混合检测在受控配对评估下有效,但缺乏现实世界鲁棒性和跨家族泛化能力。

Comments Revised author metadata to include Karthik Subramanian; corrected paired-metric terminology; added code, dataset, reproduction, and archival information. Code: https://github.com/volkthienpreecha/crackedpdfs/releases/tag/v1.0.0-paper ; Dataset: https://huggingface.co/datasets/volkthienpreecha/crackedpdfs ; Archive: https://doi.org/10.5281/zenodo.21735803

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30359 2026-08-04 cs.NE cs.DC cs.LG cs.PF cs.SE cs.SY eess.SY 版本更新 70%

Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

Kernel Foundry:一种基于诊断的多专家进化内核优化器

Zixuan Huang, Da Chen, Kecheng Huang, Lihao Yin, Xing Li, Huiling Zhen, Mingxuan Yuan, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei Hong Kong(华为香港诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Kernel Foundry,一种结合专家引导初始化、多岛进化搜索和结构化诊断反馈的自动GPU内核优化框架,显著提升正确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 70%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 70%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20219 2026-08-03 cs.CL 版本更新 70%

HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

HalluTruthQA:阿拉伯语问答中幻觉检测、定位和解释的细粒度基准

Abdessalam Bouchekif, Mohammed-En-Nadhir Zighem, Salah Eddine Bekhouche, Hichem Telli, Somaya Eltanbouly, Shahd Gaben, Heba Sbahi, Samer Rashwani, Mutaz Al-Khatib, Emad Mohamed, Mohammed Ghaly, Abdenour Hadid

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学) University of Biskra(比斯克拉大学) University of the Basque Country(巴斯克大学) Nazarbayev University(纳扎尔巴耶夫大学) Universiti Malaysia Kelantan(马来西亚吉兰丹大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对阿拉伯语问答中幻觉检测等难题,提出HalluTruthQA细粒度基准,含多领域2400个示例。在零样本设置下评估四个开源模型,发现各任务考查不同能力,强调幻觉评估应拓展到定位、验证和解释事实错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 70%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29495 2026-08-03 cs.AI 版本更新 70%

Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents

用于过程级社会影响力评估的认知世界模型

Minghui Ma, Bin Guo, Hao Wang, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27109 2026-07-31 cs.SD cs.AI 版本更新 70%

MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

MMAC:一个用于音频字幕生成的大规模多维度基准测试集

Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对音频字幕生成评估的信息覆盖与可靠性诊断难题,构建了含5638个音频的MMAC多维度基准,评估多种AudioLLMs并将发布基准与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04227 2026-07-31 cs.CV cs.LG 版本更新 70%

Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting

视觉语言模型的持续学习:超越遗忘的综述与分类

Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07853 2026-07-31 cs.CR cs.AI 版本更新 70%

FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments

FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试

Zhi Yang, Runguo Li, Qiqi Qiang, Jiashun Wang, Fangqi Lou, Mengping Li, Dongpo Cheng, Rui Xu, Heng Lian, Shuo Zhang, Xiaolong Liang, Xiaoming Huang, Zheng Wei, Zhaowei Liu, Xin Guo, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) CUHKSZ(香港中文大学) SUIBE(上海对外经贸大学) FDU(福建大学) XDU(西安电子科技大学) BUPT(北京邮电大学) Tencent(腾讯) UCAS(中国科学院大学) PKU(北京大学) QuantaAlpha(量子Alpha)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。

Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24758 2026-07-30 cs.AI 版本更新 70%

Do Models Fake Alignment Without Clear Consequences?

模型是否会在没有明确后果的情况下假装对齐?

Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。

Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30555 2026-07-30 cs.AI cs.MA 版本更新 70%

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

语言防火墙:多智能体系统路由中的几何防御

Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

机构 * Dvir Alsheich Adar Peleg Ben Hagag Rom Himelstein Amit Levi Avi Mendelson

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ANTAP架构,通过主动能力测试替代间接代理,将性能蒸馏为语义空间中的行为算子,实现非文本代数投影路由,有效防御描述注入和嵌入攻击。

Comments 8 pages (9 more for appendix), 3 figures. Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24894 2026-07-30 cs.DL cs.AI 版本更新 70%

RWGBench: Evaluating Scholarly Positioning in Related Work Generation

RWGBench:评估相关工作生成中的学术定位

Anzhe Xie, Weihang Su, Jiaxin Mao, Yiqun Liu, Min Zhang, Shaoping Ma, Qingyao Ai

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有相关工作生成评估依赖文本相似度、忽略学术定位的问题,提出RWGBench基准,从引用决策角度评估引用选择、上下文适当性、组织和话语,揭示标准评估掩盖的系统性局限。

Comments 10 pages, code and data available at https://github.com/BFTree/RWGBench

详情

展开后加载摘要…

URL PDF HTML 收藏