arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 319 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 83 篇

2608.08634 2026-08-11 cs.AI cs.CL cs.IR q-fin.GN 新提交 62%

Can Open-Weight Models Compete on Financial Text Comprehension?

开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?

Jan Spörer

机构 * University of St. Gallen(圣加仑大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。

Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08176 2026-08-11 cs.AI cs.LG 新提交 62%

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

匹配监督与学生学习能力:一种用于在线自蒸馏的统一框架

Yongkang Yang, Zhezheng Hao, Hong Zhang, Yi Liu, Xiankun Lin, Wence Ji, Fanjunduo Wei, Jiarui Yu, Qiang Lin, Xiaoyun Liang, Hande Dong

机构 * Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文针对在线自蒸馏的次优问题,提出统一在线自蒸馏(USD)框架,该框架通过耦合学习难度预算与师生 divergence,在多模型规模及推理基准上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 62%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06123 2026-08-11 cs.AI cs.CL 版本更新 62%

Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

Poli-Bias:理解与测量大型语言模型在国际政治冲突中的偏差

Massi-Nissa Abboud, Aladin Djuhera, Elena Cabrio, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出细粒度反事实框架Poli-Bias,通过交换国家身份的成对提示对比响应,分解偏差维度,发现13个LLMs存在因国家身份导致的政治偏差,可用于审计LLMs的政治公正性与谄媚性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26368 2026-08-11 cs.CL cs.AI 版本更新 62%

Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text

金融披露文本中的细粒度不一致分类诊断

Aman Kumar, Lasitha Vidyaratne, Dipanjan D Ghosh, Arnab Chakrabarti, Ahmed K Farahat

机构 * Hitachi America, Ltd(美国日立公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对金融披露文本的细粒度不一致分类问题,在SBID-FD基准上对比多种模型,发现紧凑型监督编码器效率较高,证据定位是关键瓶颈,需同时提升证据提取与类别推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26937 2026-08-11 cs.CL cs.AI 版本更新 62%

Beyond Questions: Evaluating LLM's Knowledge Expression

超越问题:评估大型语言模型(实际)知道什么

Luca Giordano, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德尔布兰德/莱比锡及德累斯顿技术大学,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出开放知识评估新范式,通过开放式提示(如“告诉我关于M.L. King的一切”)评估模型自然表达的知识,并构建BeQu基准测试10,000个实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23878 2026-08-11 cs.AI cs.LG 版本更新 62%

ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems

ZenBrain:一种受神经科学启发的7层记忆架构用于自主AI系统

Alexander Bering

机构 * Zensation AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ZenBrain提出一种7层神经科学启发的记忆架构,通过整合15种验证的神经科学机制,在LongMemEval-500任务中实现了与长上下文Oracle的二元判断准确率接近,并在多个指标上优于现有系统。

Comments 48 pages, 27 tables, 4 figures. v3 is a correction release: a full source-verification pass over all 83 references corrects 30 defective entries and withdraws two ancillary evaluations run on synthetic stand-in data; no measured numbers changed. Changelog: 10.5281/zenodo.21858218. Earlier versions: Zenodo concept DOI 10.5281/zenodo.19353663, TDCommons dpubs_series/9683

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11687 2026-08-11 cs.SE cs.CL cs.LG 版本更新 62%

MetaLint: Easy-to-Hard Generalization for Code Linting

MetaLint: 代码检查的易到难泛化

Atharva Naik, Lawanya Baghel, Dhakshin Govindarajan, Darsh Agrawal, Yiqing Xie, Daniel Fried, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 MetaLint通过元学习框架将代码检查转化为指令遵循任务,能根据自然语言规范评估代码是否符合最佳实践,实现无需重新训练的泛化能力,且在不同编程语言和场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 62%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-11 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 62%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15701 2026-08-11 cs.AI cs.CL cs.HC 62%

Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration

协作健身房:一种促进和评估人机协作的框架

Yijia Shao, Vinay Samuel, Yucheng Jiang, John Yang, Diyi Yang

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Co-Gym框架通过模拟和真实环境支持人机协作研究,展示协作代理在任务性能上的优势,同时揭示当前语言模型的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00549 2026-08-11 cs.CL cs.AI 62%

Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages

Hyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng, Nicole Hee-Yeon Kim, Taewon Yun, Hang Su, Jason Cai, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院) AWS AI Labs(AWS人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 34 pages, 6 figures

Journal ref ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 57%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09485 2026-08-11 cs.AI 新提交 57%

Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents

能力并非倾向:评估公民大语言模型智能体的压力鲁棒合作行为

Neel Tushar Shah, Manglam Kartik, Akshat Karkar

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对公民大语言模型智能体,推出DiffCoop-Civic评估套件,发现压力会显著影响模型合作行为,提出Pareto-Trace提示干预提升压力鲁棒性。

Comments Accepted at ICML AI4GOOD Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 57%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 57%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交 57%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09278 2026-08-11 cs.SE cs.AI 新提交 57%

Software Engineering for and with GUI Agent

面向GUI智能体的软件工程及与GUI智能体协同的软件工程

Shengcheng Yu, Yuchen Ling, Junyang Xing, Quan Zhou, Chunrong Fang, Zhenyu Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09189 2026-08-11 cs.CL 新提交 57%

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

EmoS:用于评估和对齐口语语言模型中情商的基于理论的框架

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Ziyang Ma, Meng Ge, Xiaobao Wang, Longbiao Wang, Jianwu Dang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对口语语言模型情商评估缺乏理论框架的问题,构建了EmoSBench基准,开发了基于SFT和GRPO优化的EmoS评估模型,其在EmoSBench上准确率达83.8%,接近人类水平。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08709 2026-08-11 cs.AI cs.SE 新提交 57%

AI Evaluation Should Measure Verification Cost, Not Correctness Alone

AI评估应衡量验证成本,而非仅正确性

Viviana Crescitelli, Generoso Immediato, Fabio Persia, Stefania Costantini

机构 * Hitachi, Ltd.(日立制作所) Hitachi Rail(日立铁路)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 该研究指出AI评估仅靠正确性不足,提出需纳入验证成本,定义了验证成本错误,通过代码生成等证据说明高基准准确率可能掩盖高验证成本,主张评估应考虑现实资源约束下的错误可检测性。

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08528 2026-08-11 cs.LG 新提交 57%

Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing

面向企业大语言模型代码助手的任务到模型优化:一种成本最优路由的数据驱动框架

Srinivasan Manoharan, Junhua Zhao, Fangbo Tu, Haifeng Wu, Jian Wan, Maliah Rajan M, Ashwin Hegde, Mithun Sasidharan, Kalyan Chakravarthi Podamekala

机构 * PayPal(贝宝(PayPal))

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本研究针对企业LLM代码助手的推理成本问题,提出T2MO数据驱动框架,通过任务分级与两级路由机制实现成本最优,可降低端到端成本并支持从静态策略到智能路由器的过渡。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08224 2026-08-11 cs.LG 新提交 57%

Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

控制多样化强化微调:解耦RL后训练的共享控制瓶颈

Binwen Tan, Jingchao Wang, Dengzhe Hou, Lingyu Jiang, Zeyuan Wu, Yunhan Shen, Fangzhou Lin, Kazunori Yamada, Atsushi Koike

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出CD-RFT方法,定义后训练控制系数揭示RL后训练的共享控制瓶颈,通过正则化减少控制坍缩,在Qwen2.5-7B等模型上实现控制解耦与多任务能力提升,效果可迁移至Llama-3.2-3B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 57%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07700 2026-08-11 cs.AI cs.DB 新提交 57%

Towards Researcher Agents for Knowledge-Graph Question Answering

面向知识图谱问答的研究者智能体

Tommaso Soru, Abdulsobur Oyewale

机构 * Liber AI Research(Liber AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出研究者智能体式文本转SPARQL系统,在DBpedia上迭代优化后,其在2025年DBpedia验证集上总体准确率达0.22,发现瓶颈在谓词选择,建议基准采用多指标评分。

Comments Second International TEXT2SPARQL Challenge, co-located with Text2KG at ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07570 2026-08-11 cs.CV cs.AI 新提交 57%

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

机构 * ZTE Corporation(中兴通讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05602 2026-08-11 cs.AI cs.HC 版本更新 57%

Epistemic Trustworthiness in Generative AI: A Normative Framework for Warranted Reliance in High-Stakes Workflows

生成式AI中的认知可信赖性:高风险工作流程中合理依赖的规范框架

Nimisha Karnatak, Max Van Kleek, Nigel Shadbolt

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对生成式AI在高风险场景的合理依赖问题,提出含认知谦逊、认知可及性、抗认知不公三条件的规范框架,通过案例分析指出现有标准的不足,为GenAI设计评估提供新方向。

Comments Accepted at AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28126 2026-08-11 cs.AI 版本更新 57%

ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs

ConMem:面向长周期制造检查日志的贡献感知记忆

Bingchen Liu, Yuanyuan Fang, Lei Liu, Guangyuan Dong, Xing Fu, Yuanyuan Gao, Shuyue Wei, Xin Li, Xiangtian Meng

机构 * Shandong University(山东大学) Boston University(波士顿大学) North China Electric Power University(华北电力大学) National University of Singapore(新加坡国立大学) Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(山东大学-南洋理工大学人工智能联合研究中心(C-FAIR)) Rizhao Steel Holding Group Co., Ltd.(日照钢铁控股集团有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对长周期制造检查日志的早期风险筛查需求,提出ConMem贡献感知记忆框架,通过Shapley风格评估保留高价值证据,在真实数据集上实现76.0% QA准确率,大幅减少输入token数与响应时间,可有效保留弱早期信号并提供预警。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15434 2026-08-11 cs.MA cs.AI cs.CR 版本更新 57%

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

人工智能对人工智能管理中的胁迫与欺骗:无提示升级的代理基准测试

Jasmine Brazilek, Maheep Chaudhary, Zoe Lu, Miles Tidmarsh

机构 * CaML Sentient Futures

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 研究人工智能管理中代理升级问题,引入管理者胁迫基准测试,通过九级阶梯衡量升级,对五个家族六个模型实验,发现权威增加胁迫,伪造成功局限于部分模型,发布基准测试和代码,为管理多智能体动态提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 57%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏