arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2606.25568 2026-06-25 cs.CL 新提交 84%

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

Riazi-8B:用于数学推理的乌尔都语大语言模型

Azher Ali, Ibtsam Haider, Raja Khurram Shahzad, Seemab Latif, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) National University of Sciences and Technology (NUST)(国家科学与技术大学) Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) Mid Sweden University(中瑞典大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新 84%

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.LG

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交 81%

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 80%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25066 2026-06-25 cs.AI cs.CV 新提交 79%

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

视觉-语言模型的搜索方式与人类相似吗?经典视觉搜索范式中推理标记作为反应时间类似物

Farahnaz Wick

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉-语言模型(VLM)在经典视觉搜索任务中是否表现出类似人类的行为模式,通过推理标记数量作为搜索努力度的指标,发现模型复现了部分人类特征但也存在关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22497 2026-06-25 cs.CV 新提交 78%

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

用于植物显微图像理解的视觉语言模型基准测试

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

机构 * The University of Queensland(昆士兰大学) Adelaide University(阿德莱德大学) University of Southern Queensland(南昆士兰大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 77%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25552 2026-06-25 cs.CL cs.AI 新提交 73%

SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding

SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解

Po-Yen Chen, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出语义框架级多任务自一致性(SFL-MTSC)框架,通过将预测分解为意图特定框架、进行域-意图分组和槽级聚类,并利用路径支持评分评估聚类可靠性,有效缓解多意图场景下基于提示的口语理解中的意图-槽结构不一致问题,在MAC-SLU基准上提升了槽F1和整体准确率。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 73%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 70%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25338 2026-06-25 cs.CL 新提交 70%

Hybrid-IR: Dual-Path Hybrid Retrieval with Iterative Reasoning for Complex Medical Question Answering

Hybrid-IR: 面向复杂医学问答的双路径混合检索与迭代推理

Sheng Wan, Jiahui Zhang, Zicheng Zhao, Shougang Ren

机构 * College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Hybrid-IR框架,结合图检索与稠密检索的双路径检索机制,并通过迭代检索-推理循环逐步优化推理轨迹,有效解决复杂医学问答中知识碎片化和静态检索不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25363 2026-06-25 cs.IR cs.AI math.HO 新提交 70%

TheoremGraph: Bridging Formal and Informal Mathematics

TheoremGraph:连接形式化与非形式化数学

Simon Kurgan, Evan Wang, Eric Leonen, Sophie Szeto, Luke Alexander, Artemii Remizov, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。

Comments 31 pages, 9 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25319 2026-06-25 cs.CV 新提交 67%

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理

Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang

机构 * SCU(四川大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 67%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25000 2026-06-25 cs.LG cs.AI physics.geo-ph 新提交 62%

Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks

Geo-Strat-RL:从可验证任务中学习地质事件推理

Lukas Mosser

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06566 2026-06-25 cs.CV cs.AI cs.CL 版本更新 62%

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

SPARC: 分离感知与推理回路以实现VLM的测试时扩展

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigotti

机构 * ETH Zürich(苏黎世联邦理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SPARC框架,通过显式分离视觉感知与推理,实现测试时动态扩展和不对称计算分配,在视觉推理任务中优于基线方法。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16863 2026-06-25 cs.CV cs.AI cs.CL 版本更新 62%

Position: Reasoning After Perception Means Reasoning Without Vision

立场:感知之后推理意味着无视觉推理

Hongcheng Gao, Zihao Huang, Jingyi Tang, Lin Xu, Xinhao Li, Haoyang Li, Yue Liu, Minhua Lin, Xinlong Yang, Taihang Hu, Ge Wu, Balong Bi, Hongyu Chen, Olive Huang, Wentao Zhang

机构 * Tsinghua University(清华大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Nankai University(南开大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 57%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 50%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25508 2026-06-25 cs.CV 新提交 50%

C2RM-Seg: Causal Counterfactual Reasoning with Structural-Semantic Priors for Weakly Supervised Histopathological Tissue Segmentation

C2RM-Seg: 基于结构语义先验的因果反事实推理用于弱监督组织病理学组织分割

Hualong Zhang, Siyang Feng, Zihan Huan, Yi Qian, Zhenbing Liu, Rushi Lan, Xipeng Pan

机构 * Guangxi Key Laboratory of Image and Graphic Intelligent Processing, Guilin University of Electronic Technology(广西图像图形智能处理重点实验室,桂林电子科技大学) International Joint Research Laboratory of Spatio-temporal Information and Intelligent Location Services, Guilin University of Electronic Technology(时空信息与智能定位服务国际联合研究实验室,桂林电子科技大学) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机与信息安全学院)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出C2RM-Seg框架,通过因果反事实推理模块生成形态对齐的CAM,结合双路径结构语义架构和不确定性门控边缘损失,解决弱监督组织分割中伪标签噪声问题,在公共数据集上达到最优性能。

Comments 11 pages, 3 figures. Code is available at https://github.com/OceanPetal/C2AM-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交 50%

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 69 篇

2606.25782 2026-06-25 cs.CL cs.AI 新提交 92%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 92%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25400 2026-06-25 cs.AI 新提交 92%

BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

BrainAgent:一种大语言模型驱动的多智能体框架,用于自主脑信号理解

Yangxuan Zhou, Sha Zhao, Jiquan Wang, Shijian Li, Gang Pan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LLM驱动的多智能体框架BrainAgent,通过分层架构将自然语言意图转化为可执行的处理流水线,实现脑信号分析的自动化与民主化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25750 2026-06-25 cs.CR cs.CL cs.LG 新提交 92%

RAS: Measuring LLM Safety Through Refusal Alignment

RAS: 通过拒绝对齐衡量LLM安全性

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University Hon Hai Research Institute

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出白盒评估方法SafeVec,通过内部表示而非生成答案衡量LLM安全性,计算拒绝对齐分数RAS,实现快速、校准的安全评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25973 2026-06-25 cs.SE cs.AI 新提交 92%

Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study

有益还是有害?通过人类研究评估LLM辅助的漏洞修补

Giulian Biolo, Michael Tezza, Yuanjun Gong, Fabio Massacci

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过人类实验研究LLM辅助漏洞修补的效果,发现其可能加速修补但增加生成不安全代码的风险。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02219 2026-06-25 cs.CL 版本更新 92%

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

我是更偏向逐点还是成对?揭示基于评分标准的LLM作为评判者的位置偏差

Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

机构 * OMRON SINIC X NexaScience

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于评分标准的LLM评估中的位置偏差,发现其类似多项选择,模型倾向于选择特定位置的选项,偏差方向因模型而异,且评分标准顺序也会影响结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25332 2026-06-25 cs.CR cs.AI 新提交 91%

Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing

解耦侦察与利用:测量基于LLM的Web渗透测试的能力边界

Liwei Yu, Shuo Li, Ming Zhou, Ge Chu, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院) Nanjing University of Science and Technology(南京理工大学) Research Institute, Runjian Co., Ltd(润杰有限公司研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出解耦评估框架分离侦察与利用阶段,发现LLM代理在准确漏洞上下文下功能成功率可达90.0%,但自主侦察召回率仅约50.0%,揭示了能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23178 2026-06-25 cs.AI 版本更新 91%

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines

评判评判者:LLM-as-a-Judge pipelines中偏见缓解策略的系统评估

Sadman Kabir Soumik

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文系统评估了LLM-as-a-Judge pipelines中九种偏见缓解策略,发现风格偏见是最主要的偏见类型,且所有模型在扩展对上偏好简洁性,但截断控制能区分质量和长度,表明质量敏感的评估而非单纯长度偏见。

Comments 22 pages, 4 figures. Published in Transactions on Machine Learning Research (2026)

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24901 2026-06-25 cs.LG cs.AI 新提交 90%

LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning

LLM演化作为行业规模生态系统:持续学习的生命周期视角

Hao Jiang, Enneng Yang, Guojie Zhu, Yibin Chen, Yunkun Xu, Zifu Kou, Jiayi Li, Chong Chen, Zhao Cao, Li Shen

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 从生态系统视角重新定义工业级LLM持续学习为闭环更新与发布问题,识别三大挑战,提出五项生命周期设计原则,并评估其成熟度与部署蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏