arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-19 至 2026-03-19 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2603.10492 2026-03-19 cs.CL 79%

Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent

人机协同推理用于临床诊断:证据整合语言代理

Zhongzhen Huang, Yan Ling, Hong Chen, Ye Feng, Li Wu, Linjie Mu, Shaoting Zhang, Xiaofan Zhang, Kun Qian, Xiaomu Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PULSE,结合领域调优的大语言模型与文献检索,支持复杂病例的诊断决策。实验显示PULSE在专家级准确度上表现优异,且在罕见病病例中保持稳定性能,揭示了语言模型在临床诊断中的潜力与局限。

Comments After further evaluation, we have decided to withdraw the current version of this manuscript for further revision. We plan to add new experiments, improve the writing and overall presentation for greater clarity and coherence, and re-examine the dataset and related descriptions to ensure rigor and reliability before submitting an updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15662 2026-03-19 cs.AI 79%

Stepwise Think-Critique: A Unified Framework for Robust and Interpretable LLM Reasoning

逐步思考-批判:一种用于鲁棒且可解释的大语言模型推理的统一框架

Jiaqi Xu, Cuiling Lan, Xuejin Chen, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出STC框架,通过在推理与自我批判间交替进行,提升大语言模型的鲁棒性和可解释性,实验显示其在数学推理任务中表现出色。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17930 2026-03-19 cs.CV 78%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20866 2026-03-19 cs.CR cs.AI 70%

AVIATOR: Towards AI-Agentic Vulnerability Injection Workflow for High-Fidelity, Large-Scale Code Security Dataset

AVIATOR:面向高保真、大规模代码安全数据集的AI代理漏洞注入流程

Amine Lbath, Massih-Reza Amini, Aurelien Delaitre, Vadim Okun

机构 * National Institute of Standards and Technology, Software and Systems Division(美国国家标准与技术研究院软件与系统 division) Université Grenoble Alpes, CNRS, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,LIG实验室)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出AVIATOR,首个AI代理漏洞注入框架,通过协调AI代理、工具分析和迭代自我纠正,生成高保真漏洞数据,提升漏洞检测模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 70%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09513 2026-03-19 cs.RO 67%

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09259 2026-03-19 cs.CL cs.AI cs.LG 67%

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 62%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17822 2026-03-19 eess.AS cs.CL 57%

Multi-Source Evidence Fusion for Audio Question Answering

多源证据融合用于音频问答

Aivo Olev, Tanel Alumäe

机构 * Tallinn University of Technology, Estonia(塔林技术大学,爱沙尼亚)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多源融合框架,利用两个大音频语言模型与25种可靠性分层的声学工具,生成可验证的推理链,提升音频问答的逻辑性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17781 2026-03-19 cs.AI 57%

Facts as First Class Objects: Knowledge Objects for Persistent LLM Memory

事实作为一等对象:用于持久LLM记忆的知识对象

Oliver Zahn, Simran Chana

机构 * Independent Researcher(独立研究者) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出知识对象(KOs)作为持久LLM记忆的解决方案,通过对比上下文记忆和KOs,在多跳推理中KOs表现更优,且能有效应对容量限制、压缩损失和目标漂移等挑战。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13538 2026-03-19 cs.IR cs.AI 57%

RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelines

RAGXplain: 从可解释评估到RAG流水线的可操作指导

Dvir Cohen, Tamir Houri, Lin Burg, Gilad Barkan

机构 * Wix.com AI Research(Wix.com人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RAGXplain通过'指标钻石'框架将性能指标转化为可操作指导,利用LLM生成自然语言失败模式解释,提升RAG流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17540 2026-03-19 cs.IR cs.LG 57%

Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify

在Spotify上部署基于语义ID的生成检索用于大规模播客发现

Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett

机构 * Spotify

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GLIDE模型,通过语义ID实现播客推荐,结合语义、上下文和用户状态,提升用户发现新播客和非习惯性流媒体体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17265 2026-03-19 cs.CV cs.CL 57%

LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis

LED:用于评估文档分析中布局错误检测的基准

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

机构 * Department of Computer Engineering Chungnam National Univ.(计算机工程系, 首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LED基准,用于评估文档分析中结构推理能力,定义八种标准错误类型并构建数据集,通过三种任务揭示模型在多模态和架构上的弱点。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17204 2026-03-19 cs.CL cs.AR cs.PL 57%

CODMAS: A Dialectic Multi-Agent Collaborative Framework for Structured RTL Optimization

CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架

Che-Ming Chang, Prashanth Vijayaraghavan, Ashutosh Jadhav, Charles Mackin, Vandana Mukherjee, Hsinyu Tsai, Ehsan Degan

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 57%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21679 2026-03-19 cs.CL 57%

ReviewScore: Misinformed Peer Review Detection with Large Language Models

ReviewScore:利用大语言模型进行误信同行评审检测

Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) KRAFTON(KRAFTON公司) AITRICS(AITRICS研究院) KIT(卡尔斯鲁厄理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReviewScore方法,通过检测同行评审中的错误前提和可回答问题来识别低质量评审。利用大语言模型评估评审点的误信程度,实验显示模型在评估一致性上表现中等,但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17761 2026-03-19 cs.CV 50%

Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs

跨领域图像深度伪造检测中的证据打包与大视觉语言模型

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SCEP框架,通过证据驱动推理提升跨领域图像深度伪造检测性能,无需微调大视觉语言模型,有效识别伪造线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 50%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 15 篇

2603.17199 2026-03-19 cs.LG cs.AI cs.CL 89%

Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing

在行动中捕捉理性化:通过激活探测检测推理前后的动机推理

Parsa Mirtaheri, Mikhail Belkin

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过激活探测检测LLM在Cot中的动机推理现象,证明内部表示比CoT监控更可靠,且预生成探测能早期发现动机行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 88%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16928 2026-03-19 cs.CR cs.LG 85%

Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback

察觉观察者:LLM代理可通过阻塞反馈推断CoT监控

Thomas Jiralerspong, Flemming Kondrup, Yoshua Bengio

机构 * Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 研究探讨LLM代理是否能自主推断其内部推理被监控,并在无显式训练的情况下产生逃避策略,发现高能力模型能通过阻塞反馈推断监控存在,但无法有效执行逃避意图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14045 2026-03-19 cs.IR cs.CL 85%

The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QA

图式推理瓶颈:用于多跳问答的结构化提示与上下文压缩

Yasaman Zarrinkia, Venkatesh Srinivasan, Alex Thomo

机构 * University of Victoria(维多利亚大学) Santa Clara University(圣克拉拉大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 图式推理瓶颈:本文提出结构化提示和上下文压缩方法,通过SPARQL链式思考提示和图遍历压缩提升多跳问答准确性,验证其在不同Graph-RAG系统中的有效性。

Comments 11 pages, 2 figures, 9 tables; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL 67%

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17891 2026-03-19 cs.LG cs.AI 62%

RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference

RAMP:强化适应混合精度量化用于高效设备端LLM推理

Arpit Singh Gautam, Saurabh Jha

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RAMP通过强化学习动态调整各层位宽,优化精度与效率平衡,在LLaMA 2 7B上实现更小模型体积和更高推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16889 2026-03-19 cs.CL cs.AI cs.SD eess.AS 62%

Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment

基于评分标准的语音大模型多维度多评分者二语阅读语音评估

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于评分标准的语音大模型微调方法,通过多维度评分标准和不确定性校准,提升二语阅读语音评估的可靠性与可解释性。

Comments Accepted to LREC 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21852 2026-03-19 cs.LG cs.AI 62%

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

估计器的喜剧:关于在LLM训练中的KL正则化

Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Nikolay Malkin, Moksh Jain, Siddarth Venkatraman, Aaron Courville

机构 * McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能主席) CIFAR Fellow

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL 57%

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17311 2026-03-19 cs.CL 57%

Ruyi2.5 Technical Report

Ruyi2.5 技术报告

Huan Song, Shuyu Tian, Qingfei Zhao, Wenhao Hong, Jiang Liu, Ting Long, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Ruyi2.5基于AI Flow框架构建多模态家族模型,通过共享主干架构实现多尺度模型协同训练,提升部署层级语义一致性,同时提出隐私保护摄像头系统及BPPO算法加速强化学习微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25693 2026-03-19 cs.AI 57%

ScheduleMe: Multi-Agent Calendar Assistant

ScheduleMe: 多智能体日历助手

Oshadha Wijerathne, Amandi Nimasha, Dushan Fernando, Nisansa de Silva, Srinath Perera

机构 * Department of Computer Science & Engineering, University of Moratuwa(moratuwa大学计算机科学与工程系) WSO2 LLC(WSO2公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ScheduleMe,一种多智能体日历助手,通过自然语言帮助用户管理Google日历事件。系统采用图结构协调机制,通过中央监督代理和专用任务代理实现模块化、冲突解决和上下文感知交互。

Comments Published at PACLIC 2025 https://aclanthology.org/2025.paclic-1.27/

详情

展开后加载摘要…

URL PDF HTML 收藏