arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2602.02195 2026-02-03 cs.LG cs.AI 62%

State Rank Dynamics in Linear Attention LLMs

线性注意力大语言模型中的状态排名动态

Ao Sun, Hongtao Zhang, Heng Zhou, Yixuan Ma, Yiran Qin, Tongrui Su, Yan Liu, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Chinese Academy of Sciences(中国科学院大学) CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了线性注意力模型中状态排名分层现象,提出联合秩-范数剪枝策略,有效降低KV缓存开销并维持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01885 2026-02-03 cs.CL cs.AI 62%

ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support

ES-MemEval:在个性化长期情感支持中评估对话代理的基准测试

Tiantian Chen, Jiaqi Lu, Ying Shen, Lin Zhang

机构 * Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ES-MemEval通过评估长期情感支持中的记忆能力,揭示了显式长期记忆对减少幻觉和提升个性化的重要性,同时指出了检索增强模型在时间动态方面的局限性。

Comments 12 pages, 7 figures. Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL 62%

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01661 2026-02-03 cs.CL cs.AI 62%

Learning the Boundary of Solvability: Aligning LLMs to Detect Unsolvable Problems

学习可解性的边界:对齐大语言模型以检测不可解的问题

Dengyun Peng, Qiguang Chen, Bofei Liu, Jiannan Guan, Libo Qin, Zheng Yan, Jinhao Liu, Jianshu Zhang, Wanxiang Che

机构 * LARG, Research Center for Social Computing and Interactive Robotics, HIT(LARG,社会计算与交互机器人研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) iFLYTEK

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UnsolvableQA数据集和UnsolvableRL框架,通过逆向构建引入逻辑矛盾,提升LLM对不可解问题的检测能力,并在Qwen3-4B-Instruct上提升可解推理准确率至69.4%。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 62%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 62%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05266 2026-02-03 cs.AR cs.CL cs.LG 62%

Understanding and Mitigating Errors of LLM-Generated RTL Code

理解并缓解LLM生成的RTL代码错误

Jiazheng Zhang, Cheng Liu, Long Cheng, Xiaowei Li, Huawei Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于LLM的框架,通过检索增强生成、规则检查、多模态转换和迭代仿真调试,显著提升了RTL代码生成的准确性。

Comments Accepted by IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03194 2026-02-03 cs.CV cs.AI cs.LG 62%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00046 2026-02-03 cs.LG cs.CL 62%

Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy

将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势

Sarthak Sattigeri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。

Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00016 2026-02-03 cs.CL cs.AI 62%

PTCBENCH: Benchmarking Contextual Stability of Personality Traits in LLM Systems

PTCBENCH: 对LLM系统中人格特质情境稳定性的基准测试

Jiongchi Yu, Yuhan Ma, Xiaoyu Zhang, Junjie Wang, Qiang Hu, Chao Shen, Xiaofei Xie

机构 * Singapore Management University(新加坡管理大学) Tianjin University(天津大学) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PTCBENCH通过评估LLM在不同情境下的人格一致性,揭示外部事件对LLM人格和推理能力的影响,为构建更稳健的心理学对齐AI系统提供新视角。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17687 2026-02-02 cs.LG cs.AI 62%

Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis

代理强化学习赋能下一代化学语言模型用于分子设计与合成

Hao Li, He Cao, Shenyao Peng, Zijing Liu, Bin Feng, Yu Wang, Zhiyuan Yan, Yonghong Tian, Yu Li, Li Yuan

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Shenzhen Graduate School, Shenzhen, 518055, China(深圳研究生院,深圳,518055,中国) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) Peng Cheng Laboratory, Shenzhen, 518000, China(鹏城实验室,深圳,518000,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChemCRAFT通过代理强化学习实现化学语言模型的高效分子设计与合成,突破传统模型在成本与隐私间的限制。

Comments Working in Progress, 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 62%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22714 2026-02-02 cs.LG cs.AI cs.CV 62%

Vision-Language Models Unlock Task-Centric Latent Actions

视觉-语言模型解锁任务导向的潜在动作

Alexander Nikulin, Ilya Zisman, Albina Klepach, Denis Tarasov, Alexander Derevyagin, Andrei Polubarov, Lyubaykin Nikita, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 62%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02295 2026-02-02 cs.CV cs.AI cs.LG 62%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22911 2026-02-02 cs.CL cs.AI 62%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02190 2026-01-30 cs.AI cs.CL 62%

Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports

Dr. Bench:一种用于深度研究代理的多维评估,从答案到报告

Yang Yao, Yixu Wang, Yuxuan Zhang, Yi Lu, Tianle Gu, Lingyu Li, Dingyi Zhao, Keming Wu, Haozhe Wang, Ping Nie, Yan Teng, Yingchun Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Dr. Bench是一种针对深度研究代理的多维评估框架,通过214个专家精选任务和参考包,全面评估DRAs在复杂任务中的表现和改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21165 2026-01-30 cs.AI cs.CY cs.LG 62%

FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks

前沿科学:评估人工智能执行专家级科学任务的能力

Miles Wang, Robi Lin, Kat Hu, Joy Jiao, Neil Chowdhury, Ethan Chang, Tejal Patwardhan

机构 * OpenAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FrontierScience是一个评估人工智能执行专家级科学任务能力的基准,通过奥林匹克和研究两个赛道,涵盖多个科学领域,采用细致的评分框架评估模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20253 2026-01-29 cs.CL cs.AI 62%

Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy

基于布卢姆分类法的领域指南驱动的自动基准生成

Si Chen, Le Huy Khiem, Annalisa Szymanski, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, USA(诺丁汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 基于布卢姆分类法的自动基准生成框架,通过专家指南生成多选题和对话,评估模型在实践领域中的上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20103 2026-01-29 cs.SE cs.AI cs.LG 62%

Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis

通过对比分析在代码环境中基准测试奖励黑客检测

Darshan Deshpande, Anand Kannappan, Rebecca Qian

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比分析提出了一种涵盖54类的奖励利用分类法,并引入TRACE基准测试,展示模型在对比设置中对奖励黑客的检测效果优于孤立分类设置。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/trace-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16669 2026-01-29 cs.CL cs.AI cs.CY 62%

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

PLawBench: 一个基于规则的法律实践评估基准

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PLawBench通过现实法律任务评估LLM的法律推理能力,揭示其在细节处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14616 2026-01-29 cs.CL cs.AI 62%

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

超越正确性:跨文化的主观写作偏好评估

Shuangshuang Ying, Yunwen Li, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Xeron Du, Tianyu Zheng, Yichi Zhang, Letian Ni, Yuyang Cheng, Zhenzhu Yang, Qiguang Chen, Jingzhe Ding, Shengda Long, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Ge Zhang, Wenhao Huang, Wanxiang Che, Chenghua Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17912 2026-01-28 cs.LG cs.AI 62%

Causal Pre-training Under the Fairness Lens: An Empirical Study of TabPFN

从公平性视角看因果预训练:对TabPFN的实证研究

Qinyi Liu, Mohammad Khalil, Naman Goel

机构 * University of Bergen Centre for the Science of Learning \& Technology (SLATE) Bergen Norway Department of Computer Science University of Oxford Alan Turing Institute Oxford United Kingdom University of Bergen University of Oxford Alan Turing Institute

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究从公平性角度评估了TabPFN的因果预训练效果,发现其在预测准确性上表现优异,但在公平性改进方面存在局限,特别是在面对缺失-不在随机协变量偏移时。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09342 2026-01-28 cs.CL cs.AI 62%

Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework

通过社区驱动的多智能体框架改进隐式仇恨言论检测

Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种社区驱动的多智能体框架,通过整合社会文化背景提升隐式仇恨言论检测的准确性和公平性。

Comments This paper has been accepted for the upcoming 18th International Conference on Agents and Artificial Intelligence (ICAART-2026), Marbella, Spain. The final published version will appear in the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-01-28 cs.CL cs.AI cs.IR 62%

LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 62%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19005 2026-01-27 cs.AI cs.CL 62%

Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark

通过经验驱动的终身学习构建自进化代理:一种框架和基准

Yuxuan Cai, Yipeng Hao, Jie Zhou, Hang Yan, Zhikai Lei, Rui Zhen, Zhenhua Han, Yutao Yang, Junsong Li, Qianjun Pan, Tianyu Huai, Qin Chen, Xin Li, Kai Chen, Bo Zhang, Xipeng Qiu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of HongKong(香港中文大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出经验驱动的终身学习框架和StuLife基准数据集,旨在构建能够持续学习和进化的自进化代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17364 2026-01-27 cs.CL cs.AI 62%

Parameter Efficient Fine Tuning Llama 3.1 for Answering Arabic Legal Questions: A Case Study on Jordanian Laws

为回答阿拉伯法律问题高效微调Llama 3.1:对约旦法律的案例研究

Mohammed Fasha, Bassam Hammo, Bilal Sowan, Husam Barham, Esam Nsour

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高效微调Llama 3.1模型,针对阿拉伯法律问题进行案例研究,展示了在资源效率和法律推理准确性方面的改进。

Comments 5 pages, resources at: https://github.com/msfasha/Research-Resources/tree/main/ArabicLegalLLM

Journal ref 2025 1st International Conference on Computational Intelligence Approaches and Applications (ICCIAA), Amman, Jordan, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 62%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20347 2026-01-27 cs.CL cs.AI 62%

SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data

SeRL:基于有限数据的大型语言模型自我对抗强化学习

Wenkai Fang, Shunyu Liu, Yang Zhou, Kongcheng Zhang, Tongya Zheng, Kaixuan Chen, Mingli Song, Dacheng Tao

机构 * Zhejiang University(浙江大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Hangzhou City University(杭州城市大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SeRL通过自我指令和自我奖励机制,在有限数据条件下提升大型语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏