arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2604.08844 2026-04-13 cs.LG 70%

Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance

LoRA适配器的谱几何编码了训练目标并预测了有害合规性

Roi Paul

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.LG

AI总结 研究LoRA适配器的谱几何能否识别语言模型的微调目标,并预测下游行为危害。通过实验发现,LoRA权重空间几何能反映训练目标和危害合规性,但跨方法监控需单独校准。

Comments 15 pages, 8 figures, pre-registered experiment, data at https://github.com/roip/task-geometry-experiment-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17667 2026-04-13 cs.IR cs.CV cs.LG 70%

When & How to Write for Personalized Demand-aware Query Rewriting in Video Search

何时及如何为个性化需求感知的视频搜索查询重写编写

Cheng cheng, Chenxing Wang, Aolin Li, Haijun Wu, Huiyun Hu, Juyuan Wang

机构 * Weixin Group, Tencent(腾讯微信事业群)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出WeWrite框架,通过自动化后验挖掘策略、混合训练范式和并行'假召回'架构,提升视频搜索查询重写效果,提高点击视频量1.07%并降低查询重写率2.97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 70%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 67%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08565 2026-04-13 cs.CL cs.AI cs.LG 67%

Dynamic sparsity in tree-structured feed-forward layers at scale

大规模树状前馈层中的动态稀疏性

Reza Sedghi, Robin Schiewer, Anand Subramoney, David Kappel

机构 * CITEC, Bielefeld University(比勒费尔德大学认知交互技术研究中心) Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了树状结构前馈层作为Transformer中密集MLP块的替代方案,实现条件计算无需额外路由网络。通过动态稀疏性技术,在大规模模型中实现高效的语言建模和问答任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG 62%

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 57%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 7 篇

2604.08757 2026-04-13 cs.CL cs.AI 90%

Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models

卡牌对战大语言模型:大型语言模型幽默对齐的基准测试

Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie

机构 * Ghent University(根特大学) University of Helsinki(赫尔辛基大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过让五种前沿语言模型与人类玩家玩卡牌对战游戏,评估大语言模型在幽默对齐方面的表现,发现模型在幽默判断上与人类偏好不一致,可能受系统性偏差影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04256 2026-04-13 cs.CL 81%

SSPO: Subsentence-level Policy Optimization

SSPO:子短语级策略优化

Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao

机构 * Ping An Technology(平安科技) TJUNLP Lab, Tianjin University(天津大学TJUNLP实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SSPO在子短语层面计算重要性比率,平衡GRPO与GSPO的优劣,缓解训练崩溃和方差问题,同时避免整个响应被保留导致的不稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09515 2026-04-13 cs.SE 80%

When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation

当LLM落后时:来自演进API的代码生成中的知识冲突

Ahmed Nusayer Ashik, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman, Yuan Tian

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了API演变对LLM代码生成的影响,发现缺乏全面文档时LLM难以优先处理外部上下文,执行率仅42.55%,而结构化文档和大模型规模可提升至66.36%,但推理策略如Self-Reflection可进一步提升11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08723 2026-04-13 cs.CL cs.AI 79%

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

分解Delta:模型实际上从偏好对中学习了什么?

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 62%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09386 2026-04-13 cs.CV 50%

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

区域约束的群相对策略优化用于基于流的图像编辑

Zhuohan Ouyang, Zhe Qian, Wenhuo Cui, Chaoqun Wang

机构 * South China Normal University(华南师范大学) South China Agricultural University(华南农业大学) Monash University(莫纳什大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出RC-GRPO-Editing框架,通过区域约束的GRPO后训练提升流基图像编辑中目标区域指令遵循和非目标区域保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22437 2026-04-13 cs.CV 50%

EmoCtrl: Controllable Emotional Image Content Generation

EmoCtrl:可控的情感图像内容生成

Jingyuan Yang, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 EmoCtrl通过结合内容描述与目标情绪生成图像,实现内容忠实与情绪表达的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2506.17310 2026-04-13 q-bio.NC cs.CL cs.NE 89%

PaceLLM: Brain-Inspired Large Language Models for Long-Context Understanding

PaceLLM:用于长上下文理解的脑启发式大语言模型

Kangcong Li, Peng Ye, Chongjun Tu, Lin Zhang, Chunfeng Song, Jiamin Wu, Tao Yang, Qihao Zheng, Tao Chen

机构 * School of Information Science and Technology, Fudan University(复旦大学信息科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 PaceLLM通过引入持久活动机制和皮层专家聚类,解决大语言模型在长上下文中的信息衰减和语义碎片化问题,提升多文档问答和无限基准任务性能,扩展上下文长度至200K tokens。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15313 2026-04-13 cs.CL 83%

Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory

Mnemis:基于分层图的双路检索用于长期LLM记忆

Zihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mnemis提出一种结合系统1相似性搜索和系统2全局选择机制的新型记忆框架,通过分层图实现语义层次的自顶向下检索,提升长期记忆检索性能。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04144 2026-04-13 cs.CL cs.AI 81%

Many Preferences, Few Policies: Towards Scalable Language Model Personalization

多种偏好,少数政策:迈向可扩展的语言模型个性化

Cheol Woo Kim, Jai Moondra, Roozbeh Nahavandi, Andrew Perrault, Milind Tambe, Swati Gupta

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PALM方法,通过多维权重向量建模用户偏好,生成小规模LLM组合以实现个性化,理论保证了规模和近似质量的平衡。

Comments Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10722 2026-04-13 q-bio.NC cs.NE 75%

Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems

连接大脑与机器:神经科学、人工智能与神经形态系统的统一前沿

Sohan Shankar, Yi Pan, Hanqi Jiang, Zhengliang Liu, Mohammad R. Darbandi, Agustin Lorenzo, Junhao Chen, Weihang You, Md Mehedi Hasan, Arif Hassan Zidan, Eliana Gelman, Joshua A. Konfrst, Jillian Y. Russell, Katelyn Fernandes, Tianze Yang, Yiwei Li, Huaqin Zhao, Afrar Jahin, Triparna Ganguly, Shair Dinesha, Yifan Zhou, Zihao Wu, Xinliang Li, Lokesh Adusumilli, Aziza Hussein, Sagar Nookarapu, Jixin Hou, Kun Jiang, Jiaxi Li, Brenden Heinel, XianShen Xi, Hailey Hubbard, Zayna Khan, Levi Whitaker, Ivan Cao, Max Allgaier, Andrew Darby, Lin Zhao, Lu Zhang, Xiaoqiao Wang, Xiang Li, Wei Zhang, Xiaowei Yu, Dajiang Zhu, Yohannes Abate, Tianming Liu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文探讨神经科学、通用人工智能与神经形态计算的融合,提出基于脑生理学的框架,总结了突触可塑性、稀疏脉冲通信和多模态关联在下一代AGI系统中的应用,并讨论了突破冯·诺依曼瓶颈的物理子系统及四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02967 2026-04-13 cs.LG cs.AI eess.SP 73%

AR-KAN: Autoregressive-Weight-Enhanced Kolmogorov-Arnold Network for Time Series Forecasting

AR-KAN:用于时间序列预测的自回归权重增强的科莫戈洛夫-阿诺尔德网络

Chen Zeng, Tiehang Xu, Qiao Wang

机构 * School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) School of Economics and Management, Southeast University(东南大学经济管理学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AR-KAN,结合自回归模块和KAN,通过理论证明和实验验证,展示了其在时间序列预测中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 70%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI 70%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08644 2026-04-13 cs.CL 70%

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09494 2026-04-13 cs.CL cs.AI cs.IR cs.LG 67%

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

RecaLLM:通过显式上下文检索解决‘思维迷失’现象

Kyle Whitecross, Negin Rahimi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。

Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08256 2026-04-13 cs.CL cs.AI 62%

HyperMem: Hypergraph Memory for Long-Term Conversations

HyperMem:用于长期对话的超图记忆

Juwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang, Tingwen Liu, Li Guo, Yafeng Deng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) EverMind AI

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 HyperMem通过超图结构建模高阶关联,提升长期对话中的记忆检索效率与准确性,实验表明其在LoCoMo基准上达到92.73%的LLM-as-a-judge准确率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19396 2026-04-13 cs.AI 57%

EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration

EchoTrail-GUI: 通过批评者引导的自我探索构建可操作的记忆以改进GUI代理

Runze Li, Yuwen Zhai, Bo Xu, LiWu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出EchoTrail-GUI框架,通过动态记忆系统提升GUI代理任务成功率和效率,验证了结构化记忆在GUI自动化中的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14925 2026-04-13 cs.SE 50%

CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs

CODEPROMPTZIP:用于编码任务中基于检索的生成的代码特定提示压缩

Pengfei He, Shaowei Wang, Tse-Hsun Chen

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出CodePromptZip框架,通过程序分析识别代码token类型并进行消融分析,训练小型LM实现灵活压缩,提升编码任务性能。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 48 篇

2604.08563 2026-04-13 cs.CL cs.AI cs.LG 93%

Temperature-Dependent Performance of Prompting Strategies in Extended Reasoning Large Language Models

提示策略在扩展推理大语言模型中的温度依赖性能

Mousa Salah, Amgad Muneer

机构 * Gujarat Technological University(古吉拉特技术大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 研究评估了不同温度下链式思维和零样本提示策略在扩展推理中的表现,发现零样本提示在中等温度下性能最佳,链式思维在极端温度下表现最佳,扩展推理的收益随温度增加而提升。

Comments 3 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG 88%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17788 2026-04-13 cs.AI cs.CL cs.LG cs.MA 88%

Bayesian Social Deduction with Graph-Informed Language Models

基于图信息的语言模型的贝叶斯社会推断

Shahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell

机构 * Purdue University(普渡大学) Oracle(甲骨文公司) Virginia Tech(弗吉尼亚理工大学) Intel Labs(英特尔实验室)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);language agent(abstract)

AI总结 本文提出一种混合推理框架,通过外部化信念推断到结构化概率模型,结合语言模型进行理解和交互,在Agent-Agent游戏中实现与大模型相当的性能,并首次在受控研究中击败人类玩家。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25835 2026-04-13 cs.AI 87%

Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search

链式树搜索:LLM树搜索中的回归顺序推理

Xinzhe Li

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Chain-in-Tree框架,通过在搜索过程中决定分支时机而非每步扩展,显著减少计算开销,在GSM8K和Math500上提升效率达75-85%。

Comments ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏