arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.12133 2026-08-13 cs.AI 新提交 70%

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

GUIDE:企业场景下从文档到制品生成的受控统一智能

Shivali Dalmia, Sumukha Thoppanahalli, Mohammadreza Sediqin, Abhishek Mukherji

机构 * Centific Research(森蒂菲克研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 70%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 70%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11650 2026-08-13 cs.SD cs.CL 新提交 70%

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Confucius4-TTS:带有可学习说话人编码器的无文本跨语言零样本文本转语音系统

Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

机构 * NetEase Youdao(网易有道)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出支持14种语言的Confucius4-TTS系统,采用两阶段架构,无需音频提示转录即可实现跨语言零样本TTS,在多项基准测试中表现优异,相关资源已公开。

Comments 12 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 70%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-13 cs.AI 新提交 70%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 70%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10806 2026-08-12 cs.CL 新提交 70%

Assessing Reliability of BERT-Based Models on Question Answering Tasks

评估基于BERT的模型在问答任务上的可靠性

Pooja Yadav, Priyanka Harjule, Basant Agarwal, Marko Robnik Šikonja

机构 * Malaviya National Institute of Technology(马拉维亚国家理工学院) Central University of Rajasthan(拉贾斯坦中央大学) University of Ljubljana(卢布尔雅那大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估BERT及其变体在问答任务上的可靠性,发现RoBERTa可靠性更高,ALBERT与DistilBERT存在显著不一致,验证了MCD作为可靠性指标的有效性,强调需同时评估QA模型的准确性与稳定性。

Comments Accepted for publication in the Journal of Experimental & Theoretical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10375 2026-08-12 cs.CE cs.AI 新提交 70%

Beyond Forecasting: Recasting Volatility Control as a Routing Problem

超越预测:将波动率控制重新定义为路由问题

Hongji Pu, Leyang Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出模块化框架VolRouter,将波动率控制转化为基于状态的估计器-控制器对路由问题,在四类金融场景中多数取得最优风险调整表现,证明波动率控制可视为策略选择问题。

Comments 24 pages, 6 figures, ACM ICAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10224 2026-08-12 cs.AI 新提交 70%

Self-evolving Agentic Customer Support System at LinkedIn

领英的自进化智能体客户支持系统

Chih Hui Wang, Mengdie Tu, Qianyun Zhang, Wei Wu, Lili Zhou, Mingqi Shen, Changshuai Wei

机构 * LinkedIn(领英公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 领英提出一种集成检索增强生成、进化自动提示与模块化评估框架的自进化智能体客户支持系统,经测试可显著提升多项支持任务指标,为企业级自进化 AI 智能体提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 70%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 70%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 70%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08264 2026-08-11 cs.AI 新提交 70%

OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents

OBLIVION:面向已部署智能体的工作流级操作技能遗忘

Zhengyang Shan, Xu Qian, Jiayun Xin, Kun Li, Yue Zhang, Minghui Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体的技能撤销问题,提出OBLIVION框架,通过工作流建模、跨表面连贯擦除等技术降低技能复活风险,在基准与沙箱实验中有效减少攻击成功率与影响加权暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07873 2026-08-11 cs.AI 新提交 70%

Back to the Future: A workbook time machine for spread sheet creation benchmarks

回到未来:用于电子表格创建基准测试的工作簿时光机

Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06785 2026-08-10 cs.CL 新提交 70%

Multi-Perspective Triad Interaction Graph Neural Network for Cognitive Distortion Detection

用于认知扭曲检测的多视角三元组交互图神经网络

Jun Seo Kim, Hye Hyeon Kim

机构 * Gachon University(嘉泉大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06539 2026-08-10 cs.CL 新提交 70%

Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

除非你知道自己在说什么,否则别跟我“嗯,实际上”:弱前提验证会降低通用问答性能

Shenran Wang, Vered Shwartz, Hila Gonen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Amii(阿尔伯塔机器智能研究所) CIFAR(加拿大高级研究所)

专题命中 评测与基准 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 该研究指出假前提问答(FPQA)的弱事实核查模块会降低通用问答性能,发现FPQ性能更好的方法往往在正常问题(TPQ)上表现更差,呼吁开发适配现实场景的FPQA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06370 2026-08-07 cs.CL 新提交 70%

The Bitter Lesson of Tool Calling

工具调用的惨痛教训

Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06346 2026-08-07 cs.AI 新提交 70%

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

TRAJDEBUG:追踪错误生命周期以识别长视野智能体轨迹中的关键失败

Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对长视野智能体轨迹调试的级联错误与关键错误定位难题,提出TrajDebug框架,构建含486条轨迹的TrajErrBench基准,实验显示其性能优于现有基线,可提供改进智能体的可操作反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06331 2026-08-07 cs.DB cs.AI 新提交 70%

Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data

Tytan:从关系数据交互式神经符号构建分析语义模式

Donna Hooshmand, Shubham Shahi, Cameron Barrie, Abhratanu Dutta, Marko Sterbentz, Harper Pack, Kristian J. Hammond

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TYTAN是从关系数据自动构建分析语义模式的交互式神经符号系统,在多数据库评估中实现了100%覆盖率、检索正确性及高语义角色一致性,盲测表现优异。

Comments 20 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05573 2026-08-07 cs.AI 新提交 70%

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现

Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04260 2026-08-06 cs.CL 新提交 70%

Towards End-to-End Multilingual Metaphor Processing: Integrating Detection, Translation, and Evaluation

面向端到端多语言隐喻处理:整合检测、翻译与评估

Jiahui Liang, Lifeng Han

机构 * Leiden University(莱顿大学) Leiden University Medical Centre(莱顿大学医学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究拟开发端到端多语言隐喻处理框架,整合隐喻检测、面向隐喻的翻译评估及联合建模,结合语言学理论与大语言模型,以提升多语言NLP系统处理比喻语言的能力。

Comments Scientific report on PhD thesis plans and milestones achieved (current progress)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04205 2026-08-06 cs.AI 新提交 70%

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

MatrAIx:用83亿个 persona 智能体模拟世界

Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley Huang, Yifan Liu, Xiaoyi Liu, Yilan Fan, Yijun Wang, Koutian Wu, Ruoqi Gao, Muhammad Ahmed Mohsin, Jing Tang, Brihi Joshi, Heming Liu, Zheyuan Deng, Zonglin Di, Sankalp Jajee, Jiuyao Lu, Zhiwei Zhang, Saksham Kapoor, Ishan Gupta, Yunhan Zhao, Chanwoo Park, Yucheng Lu, Bing Hu, Weihang Xiao, Aravind Mohan, Hanwen Xing, Runyu Zhang, Mihir Kulshreshtha, Yuanda Xu, Qianyu Zhu, Dianzhuo Wang, Yuxin Xiao, Bowen Jiang, Yongye Su, Wenhao Chai, Zuxin Liu, Lawrence Yunliang Chen, Xuandong Zhao, Ethan Ye, Shivam Patel, Jason Xie, Alex Martin Richmond, Weixiang Ding, Emre Okcular, Diya Mathew, Ziheng Wang, Rana M. Shahroz Khan, Zhejian Peng, Fang Wu, Fan Nie, Xinyang Han, Yubin Kim, Jiawei Zhang, Zhenting Qi, Huangyuan Su, Xu Pan, Abinitha Gourabathina, Hyewon Jeong, Hemanth Neelgund Ramesh, Kumail Alhamoud, Kimia Hamidieh, Zidi Xiong, Samuel Schmidgall, Pengrui Han, Yepeng Huang, Yongheng Wang, Bowen Yang, Alex Gu, Yuchu Wang, Akshay Paruchuri, Brenna Li, Hejie Cui, Jiayuan Ding, Chaosheng Dong, Jiahao Wang, Yixuan He, Chi Wang, Pamela Bhattacharya, Tianyi Peng, Paul Pu Liang, Mitchell Gordon, Yilun Du, Marinka Zitnik, James Zou, Prasanna Tambe, Philip Torr, Emily Fox, Asu Ozdaglar, Dawn Song

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MatrAIx是含83亿 persona 智能体的模拟用户评估基础设施,含Persona 8B、MatrAIx Playground及1010个多领域任务,经验证可高效评估AI系统与数字产品。

Comments Project website: https://matraix.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04008 2026-08-05 cs.CL 新提交 70%

WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament

世界杯竞技场:前沿大语言模型在实时赛事上的前瞻性、无泄露评估

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建世界杯竞技场基准,在2026世界杯期间让6个前沿LLMs实时预测,发现其平均准确率63.9%,无明显差异,将相关数据和代码作为基准发布。

Comments Project page: https://co-minder.github.io/worldcup2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03892 2026-08-05 cs.AI 新提交 70%

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

通过对比激活加法实现Qwen3的跨期偏好调控

Michal Mráz, Justin Shenk

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03691 2026-08-05 cs.SE cs.AI cs.CV 新提交 70%

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

像素上的模式:测量多模态代码生成中的模式完成偏差

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03689 2026-08-05 cs.AI cs.SE 新提交 70%

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench:面向网页生成的开放世界评估

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-05 cs.CL 新提交 70%

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment $\unicode{x2013}$ Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03397 2026-08-05 cs.AI 新提交 70%

MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc

MMLongBench-Doc-V2:MMLongBench-Doc的修正标注、语义感知修订版

Mingtian Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对MMLongBench-Doc基准的标注错误等问题,推出MMLongBench-Doc-V2,修正106个标注、调整评估方式,移除错误文件名和重复问题,形成不可与V1分数对比的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏