arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM 73%

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI 73%

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-04-01 cs.AI 70%

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29085 2026-04-01 cs.AI 70%

PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering

PAR$^2$-RAG:计划主动检索与推理用于多跳问答

Xingyu Li, Rongguang Wang, Yuying Wang, Mengqing Guo, Chenyang Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI(甲骨文人工智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PAR$^2$-RAG通过分阶段的覆盖与承诺分离,结合广度优先锚定和深度优先细化,提升多跳问答的准确率和检索效果。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19835 2026-04-01 cs.LG 70%

FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization

FIPO:通过未来KL影响的策略优化激发深度推理

Chiyu Ma, Shuo Yang, Kexin Huang, Jinda Lu, Haoming Meng, Shangshang Wang, Bolin Ding, Soroush Vosoughi, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FIPO通过引入折扣后的未来KL散度,改进策略更新,使模型突破传统基线的长度停滞,提升推理能力与准确率。

Comments Move related work to main paper, and add one more background information in Preliminary section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28889 2026-04-01 cs.DB 67%

DeepEye: A Steerable Self-driving Data Agent System

DeepEye:一种可调节的自动驾驶数据代理系统

Boyan Li, Yiran Peng, Yupeng Xie, Sirong Lu, Yizhang Zhu, Xing Mu, Xinyu Liu, Yuyu Luo

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。

Comments SIGMOD Demo (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01946 2026-04-01 cs.RO cs.CV 67%

Scaling Cross-Environment Failure Reasoning Data for Vision-Language Robotic Manipulation

为视觉-语言机器人操控扩展跨环境故障推理数据

Paul Pacaud, Ricardo Garcia, Shizhe Chen, Cordelia Schmid

机构 * Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎高等师范学院、法国国家科学研究中心、巴黎文理研究大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 本文提出自动框架生成多样化的机器人规划与执行故障数据,构建FailCoT数据集,训练Guardian模型提升故障检测泛化能力。

Comments Code, Data, and Models available at https://www.di.ens.fr/willow/research/guardian/. The paper contains 8 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28522 2026-04-01 cs.RO cs.AI cs.CV cs.LG 62%

RAD-LAD: Rule and Language Grounded Autonomous Driving in Real-Time

基于规则和语言的实时自动驾驶:RAD-LAD

Anurag Ghosh, Srinivasa Narasimhan, Manmohan Chandraker, Francesco Pittaluga

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAD-LAD,结合规则和语言的实时自动驾驶系统,通过中断架构实现高效路径规划与文本推理,提升自动驾驶性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03638 2026-04-01 cs.LG cs.AI math.RT stat.ML 62%

Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling

隐式模型的表达能力:丰富的均衡与测试时扩展

Jialin Liu, Lisang Ding, Stanley Osher, Wotao Yin

机构 * University of Central Florida(中佛罗里达大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Decision Intelligence Lab, DAMO Academy, Alibaba US(达摩院决策智能实验室,阿里巴巴美国)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究隐式模型通过非参数分析揭示其表达能力,证明其表达能力随测试时计算量增加而提升,验证了其在多个领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21035 2026-04-01 cs.AI cs.CL 62%

CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering

CLAUSE: 通过动态可学习上下文工程实现基于代理的神经符号知识图谱推理

Yang Zhao, Chengxiao Dai, Wei Zhuo, Yue Xiu, Dusit Niyato

机构 * Independent Researcher(独立研究员) School of Computer Science, The University of Sydney, Australia(悉尼大学计算机科学学院) College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 CLAUSE通过动态可学习上下文工程实现神经符号知识图谱推理,优化多跳问答的准确率、延迟和成本,减少子图增长和端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV 62%

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 50%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29593 2026-04-01 physics.soc-ph q-fin.CP 50%

Be Water: An Evolutionary Proof for Trend-Following

顺势而为:一种进化证明的跟风策略

Yijia Chen

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文通过构建大规模基于代理的模型,探讨了金融市场中跟风策略的进化可行性,发现顺应市场趋势的策略比逆势策略更具生存优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29095 2026-04-01 cs.HC 50%

VueBuds: Visual Intelligence with Wireless Earbuds

VueBuds:集成摄像头的无线耳机实现视觉智能

Maruchi Kim, Rasya Fawwaz, Zhi Yang Lim, Brinda Moudgalya, Hexi Wang, Yuanhao Zeng, Shyamnath Gollakota

专题命中 推理与问题求解 :language model(abstract)

AI总结 VueBuds通过集成摄像头的无线耳机实现视觉智能,利用低功耗单色摄像头和视觉语言模型进行实时场景理解与文本阅读,其性能与智能眼镜相当。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV 50%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 62 篇

2603.28769 2026-04-01 cs.DC cs.CL cs.LG 92%

Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation

Spark-LLM-Eval: 一个用于统计严谨大语言模型评估的分布式框架

Subhadip Mitra

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Spark-LLM-Eval,一个基于Apache Spark的分布式评估框架,通过数据并行处理实现大规模LLM评估,强调统计严谨性,提供置信区间和显著性检验,并利用Delta Lake实现响应缓存以降低评估成本。

Comments 16 pages, 2 figures, 6 tables. Open source: https://github.com/bassrehab/spark-llm-eval. Cross-list requested: cs.CL, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04472 2026-04-01 cs.IR cs.AI cs.CL cs.LG 90%

EventChat: Implementation and user-centric evaluation of a large language model-driven conversational recommender system for exploring leisure events in an SME context

EventChat: 一种基于大语言模型的对话推荐系统在中小企业休闲活动探索中的实现与用户导向评估

Hannes Kunstmann, Joseph Ollier, Joel Persson, Florian von Wangenheim

机构 * Swiss Federal Institute of Technology, Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于大语言模型的对话推荐系统,通过客观指标和用户评价评估其在中小企业场景下的性能,揭示了系统在用户体验和商业可行性方面的挑战。

Comments Just accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29846 2026-04-01 cs.CL 89%

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

SNEAK:评估大语言模型中的战略沟通与信息泄露

Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SNEAK通过模拟盟友和间谍两种角色,评估语言模型在信息共享与保密之间的平衡能力,发现当前系统在非对称信息下的战略沟通仍存在挑战,人类表现显著优于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 89%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15738 2026-04-01 cs.NE 89%

EvoDR: Evolving Dispatching Rules via Large Language Model for Dynamic Flexible Assembly Flow Shop Scheduling

EvoDR:基于大语言模型的动态柔性装配流水车间调度的进化调度规则

Junhao Qiu, Haoyang Zhuang, Fei Liu, Jianjun Liu, Qingfu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EvoDR框架,利用大语言模型的语义理解能力,通过双专家共演化机制生成适应动态特征的调度规则,实验表明其在降低平均延误和鲁棒性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28972 2026-04-01 cs.CR cs.AI 89%

Privacy Guard & Token Parsimony by Prompt and Context Handling and LLM Routing

通过提示和上下文处理及LLM路由实现隐私保护与令牌节约

Alessio Langiu

机构 * National Research Council of Italy - Institute of Marine Sciences (CNR-ISMAR)(意大利国家研究委员会海洋科学研究所(CNR-ISMAR))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出隐私守护机制,结合上下文管理和LLM路由,通过自动提示优化减少云服务成本和敏感信息泄露风险,实验证明在隐私保护与成本节约之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29497 2026-04-01 cs.CL 88%

Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models

从大语言模型中提炼人类对齐的隐私敏感性评估

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi

机构 * Hornetsecurity Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工-里尔高等电力学院,UMR 9189 - CRIStAL)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过轻量级编码器模型提炼大语言模型的隐私评估能力,降低计算成本并验证其在去标识化系统中的实用性。

Comments Accepted to the LREC CALD-pseudo 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29288 2026-04-01 cs.CY cs.AI cs.CL cs.HC cs.SI 86%

Sima AIunty: Caste Audit in LLM-Driven Matchmaking

Sima AIunty: LLM驱动的匹配中阶级审计

Atharva Naik, Shounok Kar, Varnika Sharma, Ashwin Rajadesingan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过实世界婚姻资料审计LLM在匹配中的阶级偏见,发现同阶级匹配评分更高,揭示现有阶级体系在AI决策中的再现,需制定文化导向的评估与干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29112 2026-04-01 cs.AI cs.CL 86%

GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification

GISTBench:通过证据基础的兴趣验证评估大语言模型的用户理解能力

Iordanis Fostiropoulos, Muhammad Rafay Azhar, Abdalaziz Sawwan, Boyu Fang, Yuchen Liu, Jiayi Liu, Hanchao Yu, Qi Guo, Jianyu Wang, Fei Liu, Xiangjun Fan

机构 * Meta Recommendation Systems (MRS)(Meta推荐系统(MRS))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GISTBench通过证据基础的兴趣验证评估大语言模型在推荐系统中理解用户的能力,提出两种新指标并验证了合成数据集的准确性。

Comments 9 figures, 20 tables; code at https://github.com/facebookresearch/GISTBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00314 2026-04-01 cs.CL cs.AI 86%

When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation

当度量标准产生分歧:自动相似性与LLM作为评判者在临床对话评估中的对比

Bian Sun, Zhenjian Wang, Orvill de la Torre, Zirui Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在临床对话评估中,LLM作为评判者与传统自动相似性度量之间的分歧,通过LoRA技术对Llama-2-7B进行领域适应,并发现自动化指标可能无法完全反映临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10780 2026-04-01 cs.CL cs.LG 86%

Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting

脚本间隙:在真实世界环境中评估LLM在印度语言本土脚本与罗马化脚本上的三线分类

Manurag Khullar, Utkarsh Desai, Poorva Malviya, Aman Dalmia, Zheyuan Ryan Shi

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在印度语言及尼泊尔语的本土脚本与罗马化脚本在真实世界中的三线分类可靠性,发现罗马化文本导致性能下降达24分,并提出基于不确定性的选择路由方法以缩小脚本差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29559 2026-04-01 cs.CL cs.CY 85%

When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment

当我们可以信任LLM评分者?校准自动评估的置信度

Robinson Ferrer, Damla Turgut, Zhongzhou Chen, Shashank Sonkar

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了如何通过校准LLM评分器的置信度来提高自动评估的可靠性,比较了三种置信度估计方法在不同规模的LLM上的表现,发现自报置信度在所有条件下均表现最佳,且大模型在不同数据集上具有更好的校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29517 2026-04-01 cs.CL 85%

LLM Probe: Evaluating LLMs for Low-Resource Languages

LLM Probe:评估低资源语言的大型语言模型

Hailay Kidu Teklehaymanot, Gebrearegawi Gebremariam, Wolfgang Nejdl

机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) Aksum University(阿克苏姆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLM Probe框架,通过词典基础方法系统评估低资源语言中LLM的语言能力,揭示序列到序列模型在形态语法分析和翻译质量上的优势,以及因果模型在词汇对齐上的表现。

Comments 11 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29217 2026-04-01 eess.AS cs.CL cs.SD 85%

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

推进基于大语言模型的音素到字母转换以实现多语言语音识别

Lukuang Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

机构 * TasiTech Co., Ltd., China(塔斯科技股份有限公司,中国) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能(SPMI)实验室,中国) School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的多语言音素到字母转换,通过鲁棒训练和低资源过采样将平均识别错误率从10.56%降至7.66%。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 85%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏