arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-07-31 至 2026-07-31 共收录 10
2607.28073 2026-07-31 cs.LG cs.CV 新提交

GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios

GVR-Coder:面向复杂文档与会议场景的结构化SVG生成视觉反馈框架

Yiming Xu, Jihua Kang, Chunsai Du, Qifan Zhang, Wangqiu Zhou, Yiting Wu, Tianqi Li, Qi Song

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance Inc.(字节跳动公司) Hefei University of Technology(合肥工业大学)

AI总结 针对复杂文档与会议场景文本转SVG的三大挑战,提出GVR-Coder框架,引入定制数据集DocMeetSVG-100K,结合课程微调、双渲染反馈强化学习与智能体循环,生成质量优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27929 2026-07-31 cs.AI 新提交

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

元任务:将终端任务综合转化为可扩展智能体训练的终端任务

Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27788 2026-07-31 cs.AI cs.CE 新提交

SpecCal: Ambiguity-Aware Candidate Calibration for Infrared Spectrum-Based Molecular Structure Reconstruction

SpecCal:面向红外光谱分子结构重建的歧义感知候选校准方法

Yixuan Chen, Bo Liu, Yusen Tan, Guokun Yang, Wenjie Du, Jun Xia

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Mathematics, Jilin University(吉林大学数学学院) Information Hub, HKUST(GZ)(香港科技大学(广州)信息中心) School of Chemistry, Chemical Engineering and Biotechnology (CCEB), Nanyang Technological University(南洋理工大学化学、化学工程与生物工程学院) School of Software Engineering, University of Science and Technology of China(中国科学技术大学软件学院)

AI总结 本研究针对红外光谱分子结构重建的歧义问题,提出即插即用、与模型无关的SpecCal校准框架,可提升不同基础模型在SMILES和骨架水平的top-k重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27616 2026-07-31 cs.CV 新提交

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

MPIE-Bench:解剖学上合理的多人交互编辑基准测试

Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(元石科技)

AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27075 2026-07-31 cs.CV 版本更新

BeCARE: Budgeted Cache Refresh for Diffusion Transformer Acceleration

SoftCap: 扩散Transformer加速的软预算控制

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Lin Liu, Shuo Wang, Yanbin Hao

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Anhui University of Science and Technology(安徽理工大学) University of Macau(澳门大学)

AI总结 提出一种无需训练的软预算控制层SoftCap,通过轨迹漂移观测器和软预算PI控制器动态调整全步触发阈值,在保持计算预算软上限的同时提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08405 2026-07-31 cs.CV 版本更新

SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation

SyncBreaker:面向音频驱动生成的多模态对抗攻击框架

Wenli Zhang, Xianglong Shi, Sirui Zhao, Xinqi Chen, Guo Cheng, Yifan Xu, Tong Xu, Yong Liao

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Technology(北京工业大学)

AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09411 2026-07-31 cs.CV 版本更新

RiO-DETR: DETR for Real-time Oriented Object Detection

RiO-DETR:面向实时的定向目标检测DETR

Zhangchi Hu, Yifan Zhao, Yansong Peng, Wenzhang Sun, Xiangchen Yin, Jie Chen, Peixi Wu, Hebei Li, Xinghao Wang, Dongsheng Jiang, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 RiO-DETR通过任务原生设计解决实时定向检测中的角度估计、周期性细化和密集监督问题,实现速度与精度的平衡。

Comments Accepted by ECCV 2026, 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19435 2026-07-31 cs.CL

Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection

Zhihong Pan, Kai Zhang, Yuze Zhao, Yupeng Han

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578

详情

展开后加载摘要…

URL PDF HTML 收藏