arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.20133 2026-04-30 cs.CL 79%

Reasoning Gets Harder for LLMs Inside A Dialogue

在对话中LLM的推理变得更难

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了在对话场景中LLM的推理能力,通过BOULDER基准测试发现,对话环境显著影响LLM性能,揭示了对话多轮交互对推理能力的挑战。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01297 2026-04-30 cs.AI 79%

RE-MCDF: Closed-Loop Multi-Expert LLM Reasoning for Knowledge-Grounded Clinical Diagnosis

RE-MCDF:闭环多专家LLM推理用于知识驱动的临床诊断

Shaowei Shen, Xiaohong Yang, Jie Yang, Lianfen Huang, Yongcai Zhang, Yang Zou, Seyyedali Hosseinalipour

机构 * School of Informatics, Xiamen University, China(厦门大学信息学系, 中国) National Institute for Data Science in Health and Medicine, Xiamen University, China(健康医学数据科学国家研究院, 厦门大学, 中国) Key Laboratory of Intelligent Manufacturing Equipment and Industrial Internet Technology, Fujian Provincial Universities, the School of Information Science and Technology, Xiamen University Tan Kah Kee College, and also with the Department of Informatics and Communication Engineering, Xiamen University, China(福建省智能制造装备与工业互联网技术重点实验室, 福建省高校, 厦门大学信息科学系, 厦门大学坦克 Kee 学院, 以及厦门大学信息与通信工程系, 中国) School of Medicine, Xiamen University, China(厦门大学医学院, 中国) School of Electronic and Information Engineering, Tongji University, China(同济大学电子与信息工程学院, 中国) department of Electrical Engineering, University at Buffalo-SUNY, Buffalo, NY, USA(University at Buffalo-SUNY 电气工程系, Buffalo, NY, 美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对神经科电子病历异质性、稀疏性和噪声问题,提出RE-MCDF框架,通过闭环架构整合三个互补组件,强化疾病间逻辑约束,提升复杂诊断场景性能。

Comments Accepted by International Joint Conference on Neural Networks (IJCNN 2026); 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26319 2026-04-30 cs.CL 70%

A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection

基于大语言模型的立场检测中提示与多智能体方法的系统比较

Genan Dai, Zini Chen, Yi Yang, Bowen Zhang

机构 * School of Artificial Intelligence, Shenzhen Technology University(人工智能学院,深圳技术大学)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文系统比较了提示和多智能体方法在大语言模型立场检测中的表现,评估了五种方法在四个数据集14个子任务上的性能,发现提示方法在多数模型上表现更优,且模型规模对性能影响大于方法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26456 2026-04-30 cs.CL cs.AI 62%

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

Naamah:通过DBpedia seeding和LLM生成构建大规模合成梵语命名实体识别语料库

Akhil Rajeev P, Annarao Kulkarni

机构 * Centre for Development of Advanced Computing (C-DAC)(发展高级计算中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Naamah,一个包含102942个句子的高质量梵语NER数据集,结合DBpedia实体提取与混合推理模型生成,用于评估XLM RoBERTa和IndicBERTv2模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25235 2026-04-30 cs.LG cs.CL cs.CV stat.ML 62%

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

VLM评判者能排序但无法评分:多模态评估中的任务依赖性不确定性

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) AI Labs at Capital One(Capital One人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过置信预测框架分析VLM作为评判者的可靠性,发现任务依赖性显著影响评估不确定性,提出排名-评分解耦问题,揭示任务难度和标注质量对区间宽度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05190 2026-04-30 cs.CL cs.AI cs.IR 62%

Retrieval-Augmented LLMs for Evidence Localization in Clinical Trial Recruitment from Longitudinal EHR Narratives

基于检索增强的LLM在纵向电子健康记录叙事中证据定位的临床试验招募

Ziyi Chen, Mengxian Lyu, Cheng Peng, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics(健康结果与生物医学信息学系) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于编码器和解码器的生成LLM在临床试验招募中的应用,通过三种策略缓解长文档处理问题,MedGemma模型在RAG策略下达到89.05%的微F1分数,提升了长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 62%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG 57%

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23758 2026-04-30 cs.LG cond-mat.mtrl-sci 57%

Agentic Fusion of Large Atomic and Language Models to Accelerate Superconductors Discovery

代理融合大规模原子和语言模型以加速超导体发现

Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi Li, Zongzhao Li, Qiuliang Liu, Rui Jiao, Tian Bian, Pengju Wang, Hao Sun, Jianfeng Zhang, Ji-Rong Wen, Deli Zhao, Shifeng Jin, Tingyang Xu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团达摩院,杭州,中国) Hupan Lab, Hangzhou, China(虎扑实验室,杭州,中国) Institution of Physics, University of the Chinese Academy of Sciences, Beijing, China(中国科学院物理研究所,北京,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ElementsClaw框架,结合大规模原子模型与语言模型,通过自主协作加速超导体发现,筛选240万晶体识别6.8万高置信度候选,发现四个新实验验证超导体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03992 2026-04-30 cs.CV cs.AI 57%

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26561 2026-04-30 cs.MA cs.AI 57%

Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation

保持分歧:多智能体政策模拟中的架构异质性与一致性验证

Ariel Sela

机构 * Ariel Sela

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI委员会框架,通过120次模拟测试两种干预措施,发现架构异质性可减少一致性,但一致性验证在不同场景下产生分歧-多样性权衡。

Comments 14 pages, 7 tables, 120 deliberations across 2 policy scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25923 2026-04-30 cs.CL 57%

Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing

重新评估:自然语言处理中评估关注点的分类

Ruchira Dhar, Anders Søgaard

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文重新审视自然语言处理中的评估方法,通过梳理现有研究,建立评估关注点的分类体系,并提出结构化检查表以指导更严谨的评估设计与解读。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06198 2026-04-30 cs.CL 57%

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

LIT-RAGBench:大型语言模型检索增强生成能力的基准测试

Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

机构 * neoAI Inc.(neoAI公司) Tokyo Metropolitan University(东京 Metropolitan 大学) The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LIT-RAGBench通过五个类别评估生成器的整合、推理、逻辑、表格和回避能力,提供统一的基准测试框架,用于评估多方面能力并指导模型选择与改进。

Comments Published as a conference paper at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24867 2026-04-30 cs.CV cs.AI 57%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22910 2026-04-30 cs.CL 57%

Talent or Luck? Evaluating Attribution Bias in Large Language Models

天赋还是运气?评估大语言模型中的归因偏差

Chahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) Thomas Jefferson High School For Science and Technology(托马斯·杰斐逊科学与技术高中) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨大语言模型在事件归因中的偏差,提出基于认知的评估框架,识别模型推理差异如何放大群体偏见。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20749 2026-04-30 cs.CL 57%

Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data

LLM代理能否模拟多轮人类行为?基于真实在线客户行为数据的证据

Yuxuan Lu, Jing Huang, Yan Han, Bingsheng Yao, Sisong Bei, Jiri Gesi, Yaochen Xie, Yisi Sang, Zheshen, Wang, Qi He, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过购物案例研究,首次对先进LLM在模拟人类行为方面的准确性进行大规模定量评估,发现基于提示的LLM仅能生成11.86%的人类行为,通过微调提升至17.26%和33.86%的F1分数,建立首个严谨的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 50%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26152 2026-04-30 cs.SE 50%

AI Observability for Large Language Model Systems: A Multi-Layer Analysis of Monitoring Approaches from Confidence Calibration to Infrastructure Tracing

为大语言模型系统设计的AI可观测性:从置信度校准到基础设施追踪的多层分析

Twinkll Sisodia

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文分析了大语言模型在生产环境中的可观测性需求,探讨了从置信度校准到基础设施追踪的多层监控方法,识别了当前领域中的关键缺口。

Comments 10 pages, 2 figures, 3 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2604.26774 2026-04-30 cs.CV cs.AI 79%

MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification

MemOVCD:基于跨时间记忆推理和全局局部自适应校正的无训练开放词汇变化检测

Zuzheng Kuang, Honghao Chang, Boqiang Liang, Haoqian Wang, Lijun He, Fan Li, Haixia Bi

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MemOVCD通过跨时间记忆推理和全局局部自适应校正,解决开放词汇变化检测中时间耦合不足和局部碎片化问题,验证了其在多基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26106 2026-04-30 cs.AI 79%

Evaluating Strategic Reasoning in Forecasting Agents

评估预测代理中的战略推理

Tom Liptay, Dan Schwarz, Rafael Poyiadzi, Jack Wildman, Nikos I. Bosse

机构 * FutureSearch(未来搜索)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BTF-2基准测试,通过1417个预测问题评估代理的预测准确性及战略推理能力,发现专家预测者在评估政治和商业领袖的激励、判断其执行计划的可能性及建模制度过程方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01544 2026-04-30 cs.LG 79%

MARVIS: Modality Adaptive Reasoning over VISualizations

MARVIS:基于可视化模态自适应推理

Benjamin Feuer, Lennart Purucker, Oussama Elachqar, Chinmay Hegde

机构 * Stanford University(斯坦福大学) Prior Labs(Prior实验室) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 MARVIS通过将潜在嵌入空间转换为可视化表示,并利用VLM的空间和细粒度推理能力,实现跨视觉、音频、生物和表格域的预测,以3B参数模型在多个领域超越Gemini 2.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 67%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26779 2026-04-30 cs.LG cs.CL 62%

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

通过系统集成的推测解码加速RL训练后的 rollout

Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

机构 * NeMo-RL vLLM

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过系统集成的推测解码技术提升RL训练后rollout效率的方法,展示了在大规模模型上实现1.8倍的吞吐量提升,并通过模拟预测异步RL可实现2.5倍的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24005 2026-04-30 cs.LG cs.AI 62%

TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

TCOD:探索在线蒸馏在多轮自主代理中的时间课程

Jiaqi Wang, Wenhao Zhang, Weijie Shi, Yaliang Li, James Cheng

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TCOD框架,通过时间课程策略缓解在线蒸馏在多轮任务中的KL不稳定性,提升代理性能,实验显示性能提升达18个百分点,甚至超越教师模型。

Comments Update code, model weight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13963 2026-04-30 cs.CL cs.LG 62%

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

通过压缩镜头:探讨量化对事实知识回忆的影响

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland Informatics Campus(萨尔州信息学院) LMU Munich(慕尼黑大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Technical University of Munich(慕尼黑技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过量化技术对大型语言模型的事实知识回忆能力影响,发现量化导致信息损失,但部分模型在低精度下表现更优,BitSandBytes保留最多原始精度的知识回忆能力。

Comments TrustNLP @ ACL 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00761 2026-04-30 cs.SE cs.AI cs.CL 62%

Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models

找出阿基里斯之踵:一种用于动态揭示大语言模型事实错误的迭代方法

Wenxuan Wang, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Xiaohongshu Inc.(小红书公司) Tencent Inc.(腾讯公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HalluHunter框架,通过知识图谱和规则基NLP技术,系统揭示大语言模型的事实错误,测试表明可触发55%的问题错误。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26378 2026-04-30 cs.LG 57%

CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

CoQuant:混合精度LLM的联合权重-激活子空间投影

Zhe Ding, Su Pan, Duowei Pan

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Amazon AGI(亚马逊人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CoQuant通过联合建模权重和激活的子空间,提升混合精度LLM的量化效果,在WikiText perplexity和零样本常识推理准确率上优于现有方法。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26091 2026-04-30 cs.AI cs.CE cs.MA 57%

Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

链上语言模型代理在真实资本下的操作层控制

T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska Hoffman, Brian Bergeron, Hunter Goodreau

机构 * DX Research Group(DX研究组)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究链上语言模型代理在真实资本下的可靠性,通过操作层控制提升资本管理效能,展示从用户指令到结算的全流程评估重要性。

Comments 18 pages, 6 figures. Public onchain dashboard and supporting documentation linked in paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18239 2026-04-30 cs.CY cs.AI 57%

Can LLMs Help Allocate Public Health Resources? A Case Study on Childhood Lead Testing

大语言模型能否帮助分配公共卫生资源?一项关于儿童铅检测的案例研究

Mohamed Afane, Ying Wang, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型在分配公共卫生资源中的有效性,通过芝加哥、纽约和华盛顿特区136个社区的案例,发现LLM在处理铅暴露高风险区域时存在显著局限性。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏