北京市行业高质量数据集典型案例丨专利技术问题高质量数据集

时间:2026-08-12

专利技术问题高质量数据集

北京八月瓜科技有限公司

一、建设路径

为深挖专利数据价值,赋能科创与人工智能应用,依托全球权威专利数据源,搭建IPC分类体系下的专利技术问题高质量数据集。项目整合国知局、IFI、LexisNexis专利数据,围绕医疗健康、化学材料、机械装备、电子信息等重点产业,制定统一数据治理标准,解析专利核心文本实现标准化管控。

针对专利文本专业性强、非结构化程度高、技术表达复杂等特点,项目建立技术问题标注规范和质量审核机制。依托Doccano完成标注语料生产,依托 PaddleNLP 训练抽取模型自动识别技术问题;构建“数据采集—数据治理—人工标注—模型训练—自动抽取—质量审核—数据发布”全链路体系,支撑专利分析、科创情报及人工智能模型训练。

二、总体成效

数据集建设情况:依托IPC国际专利分类体系搭建覆盖农业、医疗健康、化学材料、电子信息等多个重点产业领域的专利技术问题数据资源体系。项目累计汇聚专利数据2亿+条,覆盖130余个IPC大类、700余个IPC小类,产出结构化专利技术问题数据3000万条,建成20万条高质量标注样本,数据总规模超过5TB。通过统一的数据治理和质量控制体系,实现专利文本、分类信息、技术问题及关联知识的标准化管理,形成专利技术问题专题数据集。

应用场景落地:

场景一:专利智能检索与分析。基于技术问题数据集构建语义检索能力,实现从关键词检索向技术问题检索升级,提升专利检索精准度和知识发现能力。

场景二:科技情报分析与产业研究。利用结构化技术问题数据开展产业技术路线分析、关键技术识别和技术发展趋势预判,为企业研发和产业规划提供支撑。

场景三:专利大模型训练。为专利智能问答、技术痛点解析、技术方案推荐等人工智能应用提供高质量训练语料和资源,提升模型在专利领域的理解能力。

经济社会效益:经济效益,数据集应用于专利分析、科创情报、知识产权服务、AI模型训练等领域,大幅提升业务产出与交付效率。累计服务创新主体5000余家,支撑3类专利智能检索分析业务;每年为创新主体节约人工工时8000—20000小时,外部标注采购成本降低60%—80%;检索命中率提升推动毛利率上涨15%—25%,线上数据抽检一致率92%—97%,平台检索失败重试率2%—8%,推动专利原始数据转化为创新知识资产。社会效益,数据集将专利发明要点结构化拆解为标准化技术问题,降低中小企业专利解读门槛,便利技术落地、规避重复研发与技术路线误判,可支撑产业专利地图绘制、技术热点研判、产业政策评估。项目打破境外专利数据服务商垄断,缓解行业数据供给卡脖子难题,守护科创信息安全,助力高水平科技自立自强。

三、创新亮点

亮点一:搭建IPC标准化专利技术问题知识体系。依托IPC国际专利分类体系,打通技术痛点与各产业领域对应关系,形成可复用的标准化知识组织规范。

亮点二:创新人工智能辅助的数据生产模式。联动人工标注、深度学习、大模型协同处理,高效完成专利技术问题自动提取与标准化治理。

亮点三:打造高价值专利领域训练语料资源。覆盖全IPC细分领域,为专利大模型、科创情报、企业创新决策提供权威数据,挖掘专利数据价值。