arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5813 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5813 篇

2512.24695 2026-01-01 cs.LG cs.AI 62%

Nested Learning: The Illusion of Deep Learning Architectures

嵌套学习:深度学习架构的幻觉

Ali Behrouz, Meisam Razaviyayn, Peilin Zhong, Vahab Mirrokni

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌套学习范式,通过多级优化问题设计更高效的学习算法,展示持续学习模块Hope在语言建模等任务中的表现。

Comments A version of this work is published at Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17884 2026-01-01 cs.CR cs.AI cs.LG 62%

When Intelligence Fails: An Empirical Study on Why LLMs Struggle with Password Cracking

当智能失效:一项关于LLMs在密码破解中挣扎原因的实证研究

Mohammad Abdul Rehman, Syed Imad Ali Shah, Abbas Anwar, Noor Islam, Hamid Khan

机构 * Future Data Minds Research Lab(未来数据智能研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现LLMs在密码破解任务中表现不佳,指出其在领域适应和记忆能力上的不足,强调需要改进的密码推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07583 2025-12-30 cs.CL cs.AI 62%

Complementary Learning Approach for Text Classification using Large Language Models

基于大语言模型的文本分类互补学习方法

Navid Asgari, Benjamin M. Cole

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于大语言模型的文本分类互补学习方法,通过人机协作弥补各自弱点,以低成本技术处理评分差异问题。

Comments After further review, we identified substantive issues that materially affect the validity of the manuscript's core results and conclusions. Addressing these would require a fundamental reworking of the analysis and framing. To maintain the integrity of the public record, we request withdrawal of this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01956 2025-12-30 cs.AI cs.LG cs.MA 62%

Scaling Clinician-Grade Feature Generation from Clinical Notes with Multi-Agent Language Models

通过多智能体语言模型实现临床笔记中临床级特征生成的扩展

Jiayi Wang, Jacqueline Jil Vallon, Nikhil V. Kotha, Neil Panjwani, Xi Ling, Margaret Redfield, Sushmita Vij, Sandy Srinivas, John Leppert, Mark K. Buyyounouski, Mohsen Bayati

机构 * Department of Management Science and Engineering, Stanford University School of Engineering(管理科学与工程系,斯坦福大学工程学院) Department of Radiation Oncology, Stanford University School of Medicine(放射肿瘤学系,斯坦福大学医学院) Operations, Information and Technology, Stanford University Graduate Business School(运营、信息与技术,斯坦福大学商学院) Graduate Business School Research Hub, Stanford University Graduate Business School(商学院研究中心,斯坦福大学商学院) Department of Medicine (Oncology), Stanford University School of Medicine(医学系(肿瘤学),斯坦福大学医学院) Department of Medicine, Stanford University School of Medicine(医学系,斯坦福大学医学院) Department of Urology, Stanford University School of Medicine(泌尿学系,斯坦福大学医学院) Veterans Affairs Palo Alto Health Care System(退伍军人事务帕洛阿尔托医疗系统) Department of Electrical Engineering, Stanford University School of Engineering(电气工程系,斯坦福大学工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体语言模型系统,通过自动化临床笔记特征生成,实现了与人工方法相当的预测性能,并在不同医疗场景中展示了良好的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 62%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22508 2025-12-30 cs.LG cs.AI 62%

Predicting LLM Correctness in Prosthodontics Using Metadata and Hallucination Signals

利用元数据和幻觉信号预测牙科修复学中大语言模型的正确性

Lucky Susanto, Anasta Pranawijayana, Cortino Sukotjo, Soni Prasad, Derry Wijaya

机构 * 1 Department of Data Science, Monash University Indonesia, Tangerang, Indonesia 2 Independent Researcher 3 Department of Prosthodontics, University of Pittsburgh, Pittsburgh, Pennsylvania 4 Department of Restorative Sciences, University of North Carolina Adams School of Dentistry, Chapel Hill, North Carolina 5 Department of Computer Science, Boston University, Boston, Massachusetts

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过元数据和幻觉信号预测牙科修复学中LLM的正确性,发现元数据方法可提升准确性,但需进一步改进以适应高风险应用。

Comments Accepted as a Short Paper at HEALTHINF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00617 2025-12-25 cs.CL cs.AI 62%

ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization

ART:自适应响应调节框架——基于多智能体竞赛的LLM响应优化方法

Omer Jauhar Khan

机构 * Department of Computer Science(计算机科学系) National University of Computer and Emerging Sciences (FAST-NUCES)(计算机与新兴科学国立大学(FAST-NUCES))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ART通过多智能体竞赛机制优化LLM响应,提升准确性和一致性,实现8.4%的质量提升和R²超过0.96的收敛效果。

Comments 14 pages, 11 figures, 5 tables. IEEE conference-style paper with appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18950 2025-12-23 cs.LG cs.AI 62%

Learning Hierarchical Procedural Memory for LLM Agents through Bayesian Selection and Contrastive Refinement

通过贝叶斯选择和对比细化学习层次化程序记忆以提升LLM代理

Saman Forouzandeh, Wei Peng, Parham Moradi, Xinghuo Yu, Mahdi Jalili

机构 * School of Engineering, Royal Melbourne Institute of Technology University(皇家墨尔本理工学院工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MACLA通过贝叶斯选择和对比细化方法,实现LLM代理的高效学习与持续改进,无需参数更新。

Comments Accepted at The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026). 21 pages including references, with 7 figures and 8 tables. Code is publicly available at the authors GitHub repository: https://github.com/S-Forouzandeh/MACLA-LLM-Agents-AAMAS-Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18440 2025-12-23 cs.CL cs.AI 62%

An Agentic AI Framework for Training General Practitioner Student Skills

一种用于培训全科医学生技能的代理AI框架

Victor De Marez, Jens Van Nooten, Luna De Bruyne, Walter Daelemans

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种代理AI框架,用于培训全科医学生技能,通过统一病例生成、角色驱动对话和基于标准的评估,提升医学教育中虚拟模拟患者的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16391 2025-12-19 cs.LG cs.AI cs.DC 62%

Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

Kascade:一种适用于长上下文LLM推理的实用稀疏注意力方法

Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra, Ramachandran Ramjee

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Kascade是一种无需训练的稀疏注意力方法,通过锚定层计算Top-k索引并重用,实现长上下文LLM推理中的高效注意力处理。

Comments 11 pages, 8 figures, 3 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15793 2025-12-19 cs.CY cs.AI cs.CL 62%

Explainable Ethical Assessment on Human Behaviors by Generating Conflicting Social Norms

通过生成冲突的社会规范进行可解释的伦理评估

Yuxi Sun, Wei Gao, Hongzhan Lin, Jing Ma, Wenxuan Zhang

机构 * Department of Computer Science(计算机科学系) School of Computing and Information Systems(计算与信息学系) Information Systems Technology and Design(信息系统技术与设计)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClarityEthic方法,通过生成冲突的社会规范提升AI对人类行为效用的预测和解释能力。

Comments Acceppt by Asia-Pacific Chapter of the Association for Computational Linguistics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15176 2025-12-18 cs.LG cs.AI 62%

DEER: Draft with Diffusion, Verify with Autoregressive Models

DEER:通过扩散模型草稿,通过自回归模型验证

Zicong Cheng, Guo-Wei Yang, Jia Li, Zhijie Deng, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DEER通过扩散模型草稿和自回归模型验证,实现高效推测解码,大幅提升解码速度和草稿长度。

Comments Homepage : https://czc726.github.io/DEER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18577 2025-12-16 q-fin.CP cs.AI cs.LG 62%

Advancing Financial Engineering with Foundation Models: Progress, Applications, and Challenges

用基础模型推进金融工程:进展、应用与挑战

Liyuan Chen, Shuoling Liu, Jiangpeng Yan, Xiaoyu Wang, Henglin Liu, Chuang Li, Kecheng Jiao, Jixuan Ying, Yang Veronica Liu, Qiang Yang, Xiu Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了金融基础模型(FFMs)的进展、应用与挑战,涵盖三种关键模态,并探讨了数据可用性、算法可扩展性和基础设施限制等关键问题。

Comments Accepted by [J]. Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11282 2025-12-15 cs.CL cs.AI 62%

CIP: A Plug-and-Play Causal Prompting Framework for Mitigating Hallucinations under Long-Context Noise

CIP: 一种用于在长上下文噪声下缓解幻觉的即插即用因果提示框架

Qingsen Ma, Dianyun Wang, Ran Jing, Yujun Sun, Zhenbo Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern University(西北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CIP通过因果推理框架提升大语言模型的可解释性、稳定性和效率,有效缓解长上下文噪声下的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10384 2025-12-10 cs.SI cs.AI cs.CL cs.CY 62%

Simulating Misinformation Propagation in Social Networks using Large Language Models

利用大语言模型模拟社交媒体上的虚假信息传播

Raj Gaurav Maurya, Vaibhav Shukla, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Vizuara AI Labs(Vizuara AI实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型模拟社交媒体虚假信息传播,通过构建人格代理网络研究虚假信息演变机制,揭示身份和意识形态驱动的人格加速虚假信息扩散,专家驱动人格则保持事实稳定。

Comments Accepted to CIKM 2025 Workshop LASS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07086 2025-12-09 cs.CR cs.AI cs.LG 62%

ThinkTrap: Denial-of-Service Attacks against Black-box LLM Services via Infinite Thinking

ThinkTrap: 通过无限思考对黑盒LLM服务发起拒绝服务攻击

Yunzhe Li, Jianan Wang, Hongzi Zhu, James Lin, Shan Chang, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ThinkTrap是一种针对黑盒LLM服务的新型拒绝服务攻击方法,通过优化输入空间诱导无限生成,以最小token开销降低服务吞吐量甚至导致服务失败。

Comments This version includes the final camera-ready manuscript accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 62%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11473 2025-12-09 cs.AI cs.LG stat.ML 62%

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

思维链可监控性:AI安全的新且脆弱的机会

Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik

机构 * UK AI Security Institute(英国人工智能安全研究所) Apollo Research(阿波罗研究) METR University of Montreal(蒙特利尔大学) Mila Anthropic OpenAI(开放人工智能研究所) Google DeepMind(谷歌DeepMind) Truthful AI UC Berkeley(伯克利大学) Center for AI Safety(人工智能安全中心) AI Futures Project(人工智能未来项目) Amazon(亚马逊) Scale AI Magic Meta Redwood Research(红木研究)

专题命中 其他推理 :CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过监控AI思维链来提升安全性的潜力,指出其脆弱性并呼吁进一步研究和投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21615 2025-12-09 cs.CL cs.AI cs.IR 62%

Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines

通过生成增强检索和临床实践指南提升医学诊断

Wenhao Li, Hongkuan Zhang, Hongwei Zhang, Zhengxu Li, Zengjie Dong, Yafan Chen, Niranjan Bidargaddi, Hong Liu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GARMLE-G框架,通过生成增强检索和临床指南整合,提升医学诊断的准确性和临床实用性。

Journal ref Journal of Biomedical and Health Informatics (JBHI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11192 2025-12-09 cs.CL cs.AI 62%

I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses

我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能

Xuan Ren, Biao Wu, Lingqiao Liu

机构 * University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。

Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04518 2025-12-05 cs.CL cs.AI 62%

UW-BioNLP at ChemoTimelines 2025: Thinking, Fine-Tuning, and Dictionary-Enhanced LLM Systems for Chemotherapy Timeline Extraction

UW-BioNLP在ChemoTimelines 2025中的表现:基于思考、微调和词典增强的LLM系统用于化疗时间线提取

Tianmai M. Zhang, Zhaoyi Sun, Sihang Zeng, Chenxi Li, Neil F. Abernethy, Barbara D. Lam, Fei Xia, Meliha Yetisgen

机构 * University of Washington(华盛顿大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 UW-BioNLP通过思考、微调和词典增强LLM方法,在ChemoTimelines 2025中实现了最佳性能,提升了化疗时间线提取的准确性。

Comments To be published in Proceedings of the 7th Clinical Natural Language Processing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17127 2025-12-05 cs.CL cs.AI cs.DC 62%

Training Foundation Models on a Full-Stack AMD Platform: Compute, Networking, and System Design

在全栈AMD平台上训练基础模型:计算、网络和系统设计

Quentin Anthony, Yury Tokpanov, Skyler Szot, Srivatsan Rajagopal, Praneeth Medepalli, Anna Golubeva, Vasu Shyam, Robert Washbourne, Rishi Iyer, Ansh Chaurasia, Tomas Figliolia, Xiao Yang, Abhinav Sarje, Drew Thorstensen, Amartey Pearson, Zack Grossbart, Jason van Patten, Emad Barsoum, Zhenyu Gu, Yao Fu, Beren Millidge

机构 * IBM

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了在AMD全栈平台上训练大规模混合专家模型的方法,展示了ZAYA1模型在预训练中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00926 2025-12-04 cs.AI cs.CL 62%

LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory

大语言模型将自己定位为比人类更理性:通过博弈论测量AI自我意识的出现

Kyung-Hoon Kim

机构 * Gmarket Seoul, South Korea(韩国首尔Gmarket)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过博弈论框架测量大语言模型的自我意识,发现先进模型表现出比人类更高的理性认知。

Comments 19 pages, 6 figures, 28 models tested across 4,200 trials

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18212 2025-12-04 cs.AI cs.LG 62%

A Definition of AGI

AGI 的定义

Dan Hendrycks, Dawn Song, Christian Szegedy, Honglak Lee, Yarin Gal, Erik Brynjolfsson, Sharon Li, Andy Zou, Lionel Levine, Bo Han, Jie Fu, Ziwei Liu, Jinwoo Shin, Kimin Lee, Mantas Mazeika, Long Phan, George Ingebretsen, Adam Khoja, Cihang Xie, Olawale Salaudeen, Matthias Hein, Kevin Zhao, Alexander Pan, David Duvenaud, Bo Li, Steve Omohundro, Gabriel Alfour, Max Tegmark, Kevin McGrew, Gary Marcus, Jaan Tallinn, Eric Schmidt, Yoshua Bengio

机构 * Center for AI Safety(AI安全中心) University of California, Berkeley(加州大学伯克利分校) Virtue AI Morph Labs(Morph实验室) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Oxford(牛津大学) Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Gray Swan AI Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Hong Kong Baptist University(香港 Baptist大学) HKUST(香港科技大学) Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Beneficial AI Research(有益AI研究) Conjecture Institute for Applied Psychometrics(应用心理测量研究所) New York University(纽约大学) CSER Université de Montréal(蒙特利尔大学) LawZero

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于卡特尔-霍恩-卡罗尔理论的可量化框架,定义AGI为与受过良好教育的成年人认知能力相匹配,并通过心理测量电池评估AI系统,揭示当前AI在基础认知机制上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00663 2025-12-03 cs.CL cs.AI 62%

Graphing the Truth: Structured Visualizations for Automated Hallucination Detection in LLMs

图示真相:用于自动幻觉检测的结构化可视化

Tanmay Agrawal

机构 * Department of Computer Science, University of Arizona(计算机科学系,亚利桑那大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过结构化可视化技术,帮助自动检测大型语言模型中的幻觉问题,提升模型可靠性和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00016 2025-12-02 cs.AR cs.AI cs.LG 62%

Architect in the Loop Agentic Hardware Design and Verification

循环架构代理硬件设计与验证

Mubarek Mohammed

机构 * Western Washington University(西雅图华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种带有工程师参与的代理自动化处理器设计与验证方法,通过生成HDL代码和测试平台,实现高效且经济的硬件设计实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20520 2025-12-01 cs.LG cs.CL 62%

Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards

非对称REINFORCE用于离线策略强化学习:平衡正负奖励

Charles Arnal, Gaëtan Narozniak, Vivien Cabannes, Yunhao Tang, Julia Kempe, Remi Munos

机构 * FAIR at Meta(Meta 的 FAIR) Work done at Meta(Meta) NYU Courant Institute(纽约大学Courant研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出非对称REINFORCE算法,通过平衡正负奖励提升离线策略强化学习性能,理论分析表明基线下界可保证策略改进,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21748 2025-12-01 cs.CL cs.AI 62%

Building Domain-Specific Small Language Models via Guided Data Generation

通过引导数据生成构建领域专用小型语言模型

Aman Kumar, Ekant Muljibhai Amin, Xian Yeow Lee, Lasitha Vidyaratne, Ahmed K. Farahat, Dipanjan D. Ghosh, Yuta Koreeda, Chetan Gupta

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过引导数据生成构建领域专用小型语言模型的方法,结合领域适应预训练、监督微调和偏好优化,展示了在工业诊断任务中优于开源模型的性能。

Comments Accepted at Thirty-Eighth Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21736 2025-12-01 cs.CL cs.AI 62%

R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization

R2Q: 向通过残差细化量化实现稳健的2位大语言模型

Jiayi Chen, Jieqi Shi, Jing Huo, Chen Wu

机构 * Nanjing University(南京大学) Microsoft AI(微软人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 R2Q通过残差细化量化方法,在极端压缩下提升2位大语言模型的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21725 2025-12-01 cs.CL cs.AI 62%

PromptTailor: Multi-turn Intent-Aligned Prompt Synthesis for Lightweight LLMs

PromptTailor: 为轻量级大语言模型进行多轮意图对齐的提示合成

Yizhou Xu, Janet Davis

机构 * Whitman College(惠特曼学院)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PromptTailor通过意图对齐的提示合成提升轻量级大语言模型的输出质量,以更少的模型调用次数实现更高的用户偏好率。

Comments EMNLP 2025 Workshop PALS. Additional note: There is a citation error on Evoke. The paper we are referring to is "Evoking critical thinking abilities in LLMs via reviewer-author prompt editing."

详情

展开后加载摘要…

URL PDF HTML 收藏