赛题清晰说,方向轻松选——2026年北京数智创新大赛第二批十道赛题重点一览

时间:2026-08-13

2026 年北京数智创新大赛十八道赛题已全部发布。为帮助各参赛团队精准把握命题脉络,深入理解每道赛题的背景立意、考核目标及攻坚难点,本期特对第二批十道赛题展开系统性解读。

赛题九、民国绘画文博知识图谱构建关键技术及原型验证

出题单位:北京市文物局

赛题类型:定向问题解决类

赛题简介:研究解决领域专家构建民国绘画领域知识图谱效率不高、大语言模型在辅助知识图谱构建时数据抽取质量有待提升、民国绘画领域知识图谱应用模式尚不成熟的问题,赛题任务主要包括:民国绘画领域数据建模、民国绘画知识图谱构建、民国绘画知识图谱原型系统等。

问题现状:民国绘画领域知识分散,知识关联都是依靠专家人工整理。且目前网站信息化展示多是以单一对象(如一幅国画)的图文说明形式,无法形成知识体系,难以挖掘深层价值,难以提供便捷的文化服务。知识图谱在文物数据管理与应用领域有广泛的应用前景。但文博领域专业知识性强,构建知识图谱高度依赖领域专家,工作量大、效率低。大语言模型可辅助知识图谱构建,但在专业领域数据抽取质量有待提升。同时,民国绘画领域知识图谱的应用模式尚不成熟,需要建立标杆示范效应。

主要难点:

1. 设计民国绘画文博数据模型,需要体现文博领域的专业性;

2. 需要提升基于大语言模型信息抽取算法在领域的专业性,实现少样本或零样本的民国绘画文博关键信息抽取与关系识别;

3. 通过知识融合与对齐将抽取的三元组构建为民国绘画文博知识图谱,体现知识的关联性;

4. 需要合理设计并实现一个知识图谱原型系统,用于体现知识图谱在民国绘画领域的应用价值。

期望效果:用于验证知识图谱与大语言模型结合在文物研究阐释、资源管理和文化服务中的应用价值。同时,为民国绘画领域知识图谱的应用模式提供可参考可复制的成熟模式。

赛题十、复杂气象条件下监控图像质量增强技术

出题单位:北京市海淀区气象局

赛题类型:定向问题解决类

赛题简介:针对暴雨、大雪等复杂气象条件下监控图像模糊、对比度低、色彩失真等退化问题,构建复杂气象条件下监控图像质量增强算法。

问题现状:在暴雨、大雪等复杂气象条件下,公共安全、交通监控、城市治理等领域所使用的监控图像常出现严重退化(图像模糊、对比度低、色彩失真等),严重影响监控系统的识别与分析能力。

例如,安装在山区或重点点位的监控设备,遇到强降水、暴雪等灾害性天气时,会使监控视频变得模糊不清,影响到灾害点位的图像监测、低洼地区的水位监测等相关的图像识别和探测设备的准确性。通过使用不同技术手段,实现对复杂气象条件下监控图像的高效、自适应增强,提升图像的可识别性与可用性,是当前智慧城市、交通安全、应急指挥等领域亟待解决的关键技术问题。

与此同时,气象部门天脸识别、自动雪深观测等智能观测设备同样受雨雪天气直接干扰,山区无人值守站点的监测画面退化问题尤为突出,直接影响气象实况观测精度与灾害早期预警能力,复杂气象下的图像增强技术已成为气象观测智能化升级的核心支撑技术之一。近年来,图像增强、去噪、超分辨率重建等技术方面展现出强大潜力,为提升恶劣天气下监控图像质量提供了新的技术路径。

主要难点:

1. 需实现对暴雨、大雪等典型气象场景监控图像的自适应、精细化质量提升;

2. 需建立气象要素(降水强度、降雪量级等)与图像退化机理之间的关联建模与条件感知机制,构建具备跨气象类型、跨监控场景泛化能力的气象 AI 图像认知模型;

3. 需构建 “气象实况 — 图像增强 — 智能感知” 全链路;4. 数据挑战:需自行标注与分类退化类型

赛题目标:针对暴雨、大雪等复杂气象条件下监控图像模糊、对比度低、色彩失真等退化问题,构建复杂气象条件下监控图像质量增强算法。

1. 实现对暴雨、大雪等典型气象场景监控图像的自适应、精细化质量提升;

2. 建立气象要素(降水强度、降雪量级等)与图像退化机理之间的关联建模与条件感知机制,构建具备跨气象类型、跨监控场景泛化能力的气象 AI 图像认知模型;

3. 构建 “气象实况 — 图像增强 — 智能感知” 全链路,为多场景业务验证与推广应用提供技术支撑。

期望效果:为多场景业务验证与推广应用提供技术支撑,一是可直接应用于城市公共安全、交通监控等场景,提升恶劣天气下监控画面可用性,增强城市风险感知与应急处置能力,助力提升城市治理水平与防灾韧性;二是可深度融入气象业务,提升天脸等智能观测设备的识别精度,支撑山区无人值守站点灾害监测,强化次生灾害早期预警效能。

赛题十一、基于文保单位数据的管理和保护利用

出题单位:北京市文物局

赛题类型:定向问题解决类

赛题简介:实现多源异构文保单位基础数据的清洗、整合和标准化,建立统一的数据模型和数据字典,研发适用于文保场景的智能分析算法,包括文物病害识别等,构建可视化的数据展示和交互界面。

问题现状:北京市作为全国文化中心,拥有数量众多、价值极高的各级文物保护单位。积累了大量文保单位基础信息、文物本体数据及业务运行数据,但普遍分散于不同业务部门和独立业务系统中,存在标准不统一、更新滞后、数据孤岛严重等问题。文物本体受自然风化、极端天气、地质灾害等自然因素,以及违规建设、人为破坏等人为因素的多重影响,各类病害(裂隙、剥落、生物侵蚀等)不断发育加剧。

主要难点:

1. 需打通各业务环节数据壁垒,盘活文保单位数据资产;

2. 需利用大数据、AI、地理信息等现代信息技术实现文物科学保护和合理利用;

3. 需挖掘贴合基层文保工作实际需求、可快速落地、易推广复制的技术成果。

赛题目标:

1. 技术目标:①实现多源异构文保单位基础数据的清洗、整合和标准化,建立统一的数据模型和数据字典,解决数据格式不统一、质量参差不齐的问题。②研发适用于文保场景的智能分析算法,包括文物病害识别等,提升文物保护的智能化水平。③构建可视化的数据展示和交互界面,支持多维度数据统计,满足不同职位的使用需求。

2. 系统目标:①开发一套易部署、易操作的文保单位数据管理和保护利用管理系统,能够快速上手使用。②系统具备良好的扩展性和兼容性,支持后续功能模块的升级和数据的持续更新。③保障系统的数据安全和用户权限管理,不同角色的用户只能访问和操作其权限范围内的数据和功能。

期望效果:

1. 提升文保单位的数据管理效率,减少工作量,降低数据错误率。

2. 增强文物保护的预判和应急响应能力,及时发现和处置文物安全隐患,减少文物损失。

3. 挖掘文保单位数据的价值,为文物保护、开放利用、文化传播等提供依据。

赛题十二、基于互联网数据与路侧检测器数据融合的城市交通信号配时优化算法

出题单位:北京市公安局交通管理局

赛题类型:定向问题解决类

赛题简介:不同感知条件下的信号配时优化,不同信控场景下的信号配时优化,不同交通需求下的信号配时优化,算法具备在实际信号系统上轻量化部署的可行性,计算或推理具备较高的时效性。

问题现状:当前城市交通系统日益复杂,城市路网通行效率偏低、高峰时段拥堵频发。北京市核心城区路网密度大、交通流多元,路口信号配时缺乏数据支撑,主干路网信号协同性不足。互联网交通数据具备全天候、广覆盖的优势,能够有效补全无检测器路口及车道的数据盲区;路侧雷视检测数据则能提供车道级微观精度。亟须通过两类数据的深度融合与智能算法优化,实现有 / 无检测器场景下的全场景信号配时自适应优化,提升城市级交通信号控制的精准度和鲁棒性,助力智慧城市交通治理。

主要难点:需针对不同感知数据源条件的交通信号控制场景,研发城市交通信号配时优化算法,实现道路通行效率提升。

期望效果:

1. 不同感知条件下(完备检测器数据 + 互联网数据、部分检测器数据 + 互联网数据、互联网数据等)的信号配时优化;

2. 不同信控场景下(独立路口、子区路网(不多于 10 个路口))的信号配时优化;

3. 不同交通需求下(早晚高峰、平峰、夜间;工作日、周日等)的信号配时优化;

4. 算法具备在实际信号系统上轻量化部署的可行性,计算或推理具备较高的时效性。

赛题十三、基于大模型与深度学习的中医古籍多维度实体智能抽取与结构化

出题单位:中国中医科学院中医药信息研究所

赛题类型:定向问题解决类

赛题简介:建立中医核心实体的统一标注与抽取标准;实现古籍实体精准识别、边界切分、类型判定;产出高质量古籍实体标注数据集与技术方案。

问题现状:中医古籍是中医药传承创新的核心知识载体,包含疾病、证候、症状、中药、方剂、治法、经络、穴位、炮制、病机等大量专业实体。当前古籍知识整理高度依赖人工,存在以下痛点:

1. 文本非结构化;

2. 古汉语晦涩;

3. 实体异名多;

4. 边界模糊;

5. 标注成本高;

6. 通用模型易产生知识幻觉。

主要难点:面向中医经典古籍开展实体自动识别、精准抽取、结构化输出,需以数智技术赋能中医药古籍保护与活化利用。

期望效果:

1. 建立覆盖 10 大类中医核心实体的统一标注与抽取标准;

2. 实现古籍实体精准识别、边界切分、类型判定;

4. 核心实体抽取精确率≥80%;

5. 产出高质量古籍实体标注数据集与技术方案。

赛题十四、基于医学垂直大模型的门诊病历全流程实时内涵质控与数字化管理平台研发

出题单位:首都医科大学附属北京潞河医院

赛题类型:定向问题解决类

赛题简介:针对门诊病历人工抽检覆盖率低、质控滞后、传统规则难识别临床内涵缺陷、AI 实时推理算力成本高、干扰诊疗等痛点,提升门诊病历实时质控覆盖率、病历内涵缺陷自动检出率、门诊甲级病历率,降低病案质控人工工作量等。

问题现状:门诊病历是医疗机构接诊门诊患者时,由医师实时记录患者就诊全过程的法定医疗文书,完整记载患者主诉、病史、体格检查、辅助检查结果、初步诊断、诊疗处置、用药方案及医师诊疗意见等核心信息,是反映门诊诊疗行为、留存医疗证据、支撑医保结算、医疗质量评审与临床科研教学的基础原始记录。

开展门诊病历质控十分必要:一方面,规范病历记录能够理顺诊疗逻辑,及时纠正诊断矛盾、不合理用药等问题,减少漏诊误诊,筑牢医疗安全防线,同时完整客观的病历作为法定医疗文书,可有效规避医患纠纷举证风险;另一方面,严格的病历质控能够匹配 DRG/DIP 付费、医保基金监管要求,避免因记录不规范产生医保拒付与行政处罚,也是三甲医院评审、电子病历分级评价、公立医院绩效考核的核心硬性支撑;此外,依托质控汇总的缺陷数据可精准定位科室与医师诊疗短板,形成质量整改闭环,持续推动院内医疗管理精细化提升,标准化病历还能为临床教学、真实世界医学科研、公共卫生监测提供可靠数据基础;而传统人工抽检模式存在覆盖不全、审核滞后、评判主观等短板,推进全流程、实时化的病历内涵质控,能够实现诊疗书写阶段前置干预,全方位补齐传统质控体系的各类漏洞。

当前国内绝大多数医院门诊病历质控还处于人工质控的现状,部分医院实现形式化规则校验(漏填、格式、时限等表层问题),内涵质控长期依赖人工月度抽查,存在四大行业痛点:

1. 质控覆盖极低:人工仅能抽检,覆盖率不足 5%,主诉 - 现病史矛盾、诊断与体征不符、用药指征缺失、术语不规范等内涵缺陷无法全面排查;大量逻辑错误、诊疗不规范问题流入归档,带来医保核查、等级评审、医疗纠纷等风险。

2. 质控后置滞后:传统模式为病历提交归档后人工复核,缺陷修改成本高,无法在医生书写过程中实时纠偏;门诊节奏快、医师无暇事后批量整改,门诊病历质量难以满足国家病历质量改进目标。

3. 管理数字化薄弱:质控数据分散在 Excel、纸质台账,无统一可视化管理平台,无法自动统计科室、医师、病种缺陷分布,质控整改追踪、绩效联动、持续改进缺乏数智化支撑。

4. 传统规则引擎局限性:现有标准化规则难以覆盖内涵问题,复杂临床语义、跨字段逻辑冲突、专科个性化诊疗缺陷无法识别,规则更新周期长、适配性差。

主要难点:门诊病历实时质控机制在实际落地应用过程中,会同时受到门诊临床业务流转逻辑与 AI 算力资源两大核心条件制约,现阶段暂无法稳定、完整地实现病历全流程同步实时校验,落地实施存在明显现实瓶颈,具体约束条件分析如下:

1. 依托 AI 模型开展病历全时段同步质控校验,对服务器集群并发算力、模型推理性能要求极高。门诊场景下需同步对病历文本开展语义识别、逻辑判别、合规筛查、诊疗规范匹配等多维度 AI 智能评估任务,当前 AI 推理能力暂未达到毫秒级、秒级即时响应标准,单份病历单次完整质控评估耗时可达数分钟。若要满足全院门诊多终端同步实时质控的运行需求,需大规模扩容高性能算力硬件、搭建专属 AI 推理集群,设备采购、机房部署、长期运维的综合投入成本居高不下,项目整体投入产出比偏低,资源配置经济性不足。

2. 在病历编辑过程中或保存节点即时触发 AI 质控校验,会直接打断医师连贯的接诊诊疗流程。由于 AI 模型单次评估耗时较长,系统将出现长时间加载、延迟弹窗、规则滞后提示等交互问题,持续分散医师问诊、查体、制定诊疗方案的工作注意力,大幅拉长单例患者诊疗处置耗时,直接降低门诊整体接诊流转效率。从使用体验层面来看,频繁、长时间的 AI 校验等待会加重医师操作负担,造成患者现场就诊等待时间显著延长,双向劣化医师操作体验与群众就医感受,与门诊高效诊疗、流畅接诊的运营目标存在突出冲突。

赛题目标:

1. 门诊病历全量 100% 实时质控,替代 5% 人工抽检;

2. 病历内涵缺陷自动检出率由 18.7% 提升至 90% 以上,书写提交前拦截率≥85%;

3. 门诊甲级病历率提升至 90% 以上;

4. 病案质控人工工作量下降 80%,月度病历核查人力成本大幅缩减;

5. 医保、等级评审相关病历不合规问题下降 70%;

6. 质控管理数据自动生成,科室缺陷分析、整改追踪效率提升至 90%。

期望效果:

1. 技术前卫:采用 “规则引擎 + 医疗大模型 + 医学知识图谱” 三擎协同架构,RAG 检索增强微调垂直医疗大模型,突破传统规则质控边界,实现诊疗逻辑深度推理,解决传统系统无法识别的隐性内涵缺陷;

2. 全流程前置干预:区别于事后批量审核,嵌入门诊病历 HIS 书写界面,边写边质控、实时弹窗提示 + 标准化修正建议,真正实现 “书写即质控”;

3. 医管一体化双端平台:兼顾临床医师辅助与质控管理部门数字化监管,内置缺陷统计、科室排名、整改闭环、绩效联动、质量趋势预测等管理模块,打通 “质控 - 分析 - 整改 - 考核” 管理链路;

4. 私有化安全大模型方案:全流程院内本地部署,数据脱敏、去标识化、操作审计全覆盖,符合医疗数据合规要求;

5. 可持续自进化 AI 体系:支持上传专科指南、典型缺陷案例自动更新知识库,模型持续迭代适配医院质控新标准、新病种。

赛题十五、基于多源企业数据治理的大模型可信信息服务,释放数据要素价值

出题单位:北京羽乐创新科技有限公司

赛题类型:定向问题解决类

赛题简介:聚焦多源涉企数据在数据治理和价值挖掘方面的行业瓶颈问题,利用竞赛数据集,完成多源涉企数据治理机制、高质量可信涉企数据集、多维企业画像评估模型等任务。

问题现状:国家正全面推进数据要素市场化配置改革,加快培育数据要素市场,商事数据作为覆盖市场主体全生命周期的核心基础数据要素,是数字经济时代优化营商环境、提升政府治理效能、激发实体经济活力的重要战略资源和重要抓手。

但长期以来存在 “难治理、不可信、价值低” 的行业瓶颈:一方面,多源涉企数据标准不统一、质量参差不齐,缺乏体系化治理机制,数据要素难以高效流通与规模化复用,价值释放受阻;另一方面,企业信息失真、滞后、混淆等问题加剧了市场信息不对称,既增加了中小微企业的交易信任成本,也难以支撑政府开展精准的产业监测、市场信用监管与企业服务,制约了营商环境的数字化、普惠化升级。

通过对涉企数据的治理和价值发掘,将能够有效破解相关数据 “难治理、不可信、价值低” 的行业瓶颈,有利于激活海量沉睡的企业数据资源,释放商事数据要素的经济价值与社会价值,为数据要素市场化配置落地提供可复制、可推广的实践范式。

相关工作成果能够直接为政府产业运行动态监测、市场信用监管、惠企政策精准直达、市场主体全周期服务筑牢可信数据底座,支撑社会治理决策科学化、监管服务精准化,以数智技术持续优化市场化、法治化、国际化营商环境,切实降低全社会信息获取成本与市场交易成本,激发各类市场主体尤其是中小微企业的发展活力,助力实体经济提质增效与高质量发展。

赛题目标:围绕多源涉企数据治理和合规应用开展攻关和创新。通过涉企多源数据开展标准化治理与实体对齐,产出可规模化复用、适配大模型训练及检索增强(RAG)场景的高质量可信涉企数据集,实现涉企数据从原始零散向标准可信画像的价值升级。

通过创新涉企数据治理和应用范式,畅通商事数据要素流通与价值释放路径,为政府产业监测、市场信用监管、企业精准服务、公众信息查询、AI 大模型应用筑牢数字化可信底座,助力降低市场交易成本、激发市场主体活力,赋能实体经济高质量发展。

期望效果:参赛团队预期将完成多源涉企数据治理机制、高质量可信涉企数据集、多维企业画像评估模型三项核心交付,达成以下量化指标与成效目标:

1. 数据治理体系目标

形成覆盖数据接入、清洗标准化、实体对齐、增量更新、质量质检、合规管控、数据退市的全链路治理规范,具备跨场景复用与行业推广价值;建成自动化数据质量监控机制,异常数据识别召回率≥95%,误判率≤2%。

实现全量数据血缘可追溯,每条数据支持溯源采集来源、更新记录与校验状态,满足政务监管与合规审计要求。

2. 高质量可信数据集建设目标

完成多源涉企数据的标准化治理与融合,产出适配大模型训练、检索增强(RAG)等场景的高质量可信数据集。

核心字段(企业名称、统一社会信用代码、行业分类、经营地址、联系方式)完整率≥98%;企业基础信息准确率≥99%,联系方式有效性准确率≥98%、无效号码识别率≥99%;同名企业实体消歧准确率≥95%,企业关联关系识别准确率≥90%;数据集字段维度≥25 类,支持 24 小时增量更新,企业变更信息入库延迟≤24 小时,可支撑政务服务、市场应用等多场景需求。

3. 大模型可信应用效果目标:

基于可信数据集构建体系化的企业画像评估模型,实现企业特征的多维度量化刻画。建成覆盖基础属性、业务活跃度、风险提示等的企业标签体系,画像标签维度≥30 类;企业核心属性标签匹配准确率≥95%,经营状态动态评估准确率≥92%;企业经营活跃度分级评估准确率≥90%,异常经营风险识别召回率≥85%;单户企业全维度画像生成时延≤300ms,支持批量企业画像生成与行业级画像统计分析;模型输出具备可解释性,每项画像标签均可追溯对应的数据来源与评估规则。

4. 公共成效目标:

形成可复制推广的商事数据治理与企业画像应用实践范式,打通商事数据要素价值释放堵点,支撑数据要素市场化流通与深度应用;为政府产业运行监测、市场信用分级监管、惠企政策精准匹配、市场主体全周期服务提供可信数据底座与量化评估能力,为各类市场主体降低交易信息成本、提升经营决策效率提供普惠化数据支撑,助力营商环境数字化优化,赋能实体经济高质量发展。

赛题十六、诊疗交互范式革命:基于 AI 智能体的语音化临床系统交互 —— 从传统人机交互到全流程语音化的系统性重构

出题单位:北京市通州区卫生健康委员会

赛题类型:定向问题解决类

赛题简介:依托医疗垂直领域大模型与多智能体,构建深度嵌入医生工作站的 “智能语音医生助手”,通过智能体集群协同驱动业务流程,以自然语言交互重构传统诊疗链路。

问题现状:当前,医生工作站(HIS)的诊疗流程高度依赖鼠标点击与键盘录入,导致医生在问诊、书写病历、开立医嘱等环节面临巨大的认知负荷与操作负担。

主要难点:

1. 交互割裂与效率瓶颈:传统的图形用户界面(GUI)操作繁琐,医生需在问诊、思考与系统操作间频繁切换,打断了临床思维的连续性,导致诊疗效率低下。

2. 数据孤岛与价值挖掘不足:患者诊疗数据分散在不同模块,医生难以快速获取全景视图,且大量非结构化数据未能有效转化为辅助决策的知识。

3. 质控滞后与风险被动:医疗质量控制多为事后回顾,无法在诊疗过程中实时提供伴随式提醒,难以从源头规避医疗风险。

赛题目标:构建一个由多智能体集群驱动的 “智能语音医生助手”,将其深度嵌入 HIS 底层,作为工作流的核心驱动力,实现医生与系统的自然语言交互,将医生从繁杂的案头工作中解放,使其回归 “以患者为中心” 的核心诊疗价值。

依托医疗垂直领域大模型与多智能体(Multi-Agent)集群技术,构建深度嵌入医生工作站(HIS)底层的 “智能语音医生助手”,通过智能体集群协同驱动业务流程,以自然语言交互重构传统诊疗链路:

1. 多模态语音交互引擎:支持复杂语境下的语音指令识别,以自然语言语音交互模式,可自动提取该患者既往史、现病史等关键信息,实现患者既往信息的调阅与展示。

2. 可解释性病历生成:结合 RAG(检索增强生成)技术,在自动生成规范化病历文书段落,同时建立严格的事实核查与引用溯源机制。可标记病历描述对应的客观诊疗信息依据,有效抑制大模型 “幻觉”,保障医疗数据的真实性。

3. 主动式临床诊断质控:助手具备 “伴随式” 质控能力,在问诊环节进行逻辑校验与缺漏提醒,辅助医生完善鉴别诊断,从源头规避医疗风险,全面提升诊疗质量与同质化水平。

赛题十七、AOE 国产自主轨道编目数据

出题单位:北京开运联合信息技术集团股份有限公司

赛题类型:开放创意类

赛题简介:赛题提供 AOE 国产自主轨道编目数据,参赛方向为开发高精度轨道预测模型、航天器碰撞风险预警算法、空间碎片轨道演化推演、太空交通态势研判、轻量化星载轨道计算模型等。

AOE 太空轨道数据集为开运集团全链路自主研发、采集生产的国产化高精度空间目标轨道专业数据集,完全摆脱对境外 NASA-TLE 公开数据的依赖,具备完全自主知识产权与商用、科研使用资质,数据真实可靠、维度丰富、时效性强,可充分支撑各类太空轨道技术创新研究与算法模型研发工作。

问题现状:

1. 数据来源。AOE 太空轨道数据集全部来源于企业自建的天地一体化全域协同观测网络,为自主实测采集数据,无外部开源搬运、无境外数据嫁接。地面端依托全国及全球分布式部署的光学观测基站、望远镜阵列,形成大范围、多点位、全天候地面观测矩阵;天基端依托企业自研广视观测星座,实现高空、广域、无死角太空目标监测。通过天基、地基双体系协同互补,可精准捕获低轨、中轨、高轨全轨道层级的在轨卫星、空间微小碎片、火箭残骸、失效航天器、未知空间目标等各类空天目标的原始观测信息。所有数据经过自主研发的多源融合算法、智能滤波清洗、精密轨道解算、目标编目核验全流程处理后入库存储,从源头实现数据采集、处理、生产、应用全链条国产化自主可控。

2. 采集时间与更新机制。本数据集观测采集工作已长期常态化开展,观测网络实现全年 7×24 小时不间断巡天采集,累计沉淀数年海量原始实测数据,形成了体量庞大、样本丰富的空间轨道数据库。数据集采用动态实时迭代更新机制,依托自研算力调度系统与轨道迭代模型,对在轨目标轨道参数、运行状态进行高频刷新,实时修正轨道偏差、更新目标状态数据,能够精准捕捉航天器轨道衰减、姿态异动、近距离交汇等动态变化,彻底解决传统公开数据更新周期长、数据滞后、时效性差的问题,保障输出数据的实时性与准确性。

3. 数据集核心优势。相较于行业通用的境外 TLE 公开数据,本数据集优势突出。一是精度更高,通过多源数据融合精密定轨,大幅降低轨道预报误差,可实现七天级长周期高精度轨道预报;二是数据维度更丰富,涵盖目标轨道根数、位置速度、轨道倾角、偏心率、运行姿态、交汇态势、轨道衰减趋势等精细化参数,支持多维度分类筛选与统计分析;三是自主性更强,完全国产自研,无数据断供、版权限制与合规风险;四是可开发性高,配套标准化数据接口,支持数据批量导出、模型训练、算法迭代与二次深度开发,适配科研创新与工程应用多重场景。同时依托自主核心算法加持,具备风险研判、异常识别、轨道预测等智能化数据处理能力。

4. 主要应用方向。本数据集可支撑参赛单位开展多领域太空技术创新研究,核心应用方向广泛且贴合行业前沿需求。主要包括:太空态势感知算法优化与升级、空间目标高精度智能化编目模型研发、低轨卫星在轨智能防撞预警技术研究、空间碎片分级识别与风险研判、航天器长周期高精度轨道预报、太空交通秩序智能管控仿真、航天资产在轨安全风险评估、异常轨道目标智能识别等科研与工程创新方向,可全方位支撑各类空天智能算法、预测模型、防控体系的研发与验证工作。

期望效果:依托本数据集,可针对性解决当前国内太空数据领域与航天技术研发的各类痛点问题。一是解决传统境外 TLE 数据精度低、预报误差大、更新滞后、维度单一的行业短板;二是解决境外数据存在技术垄断、数据断供、合规受限、无法自主可控的产业风险问题;三是解决国内太空智能算法研发缺乏高精度实测样本、模型训练数据匮乏的难题;四是解决空间目标精细化管理、碎片风险精准防控、卫星在轨安全运维缺少本土化、实时化数据支撑的应用痛点;五是解决航天科研创新依赖国外数据源、核心技术研发受制于人、国产化替代进程缓慢的行业问题,助力国产太空监测、轨道预测、空间安全防控技术的自主创新与迭代升级。

赛题十八、全球企业信息数据集

出题单位:格兰德信用管理(北京)有限公司

赛题类型:开放创意类

赛题简介:依托格兰德全球企业信息数据集,围绕全球供应链韧性分析、海外市场智能信用评估、基于知识图谱的反欺诈识别、宏观经济产业迁徙预测等方向开展创新应用。

数据集总体概述:本数据集由格兰德信用管理(北京)有限公司(以下简称 “格兰德”)提供,依托格兰德深耕全球商业信用领域十余年的数据积累与治理能力。该数据集旨在为 “2026 年北京数智创新大赛” 参赛团队提供高价值、高时效、多维度的全球企业信息底座,助力参赛者在大数据挖掘、人工智能建模及商业决策智能化等领域实现突破性创新。

数据来源:本数据集严格遵循各国数据合规及隐私保护法律要求,来源渠道包含以下三类:

1. 官方公共数据源:

①各国政府工商登记注册局、商业法院公告、知识产权局(商标 / 专利)等公开数据。

②官方统计机构发布的宏观经贸数据及行业分类标准。

2. 权威商业合作数据:

①与全球多家知名信用评级机构、行业协会及第三方数据服务商建立的正规数据交换与采购合作。

②国际航运、海关进出口提单等合法流转的商业贸易数据。

3. 格兰德自有生态数据:

①格兰德自建的全球企业关联关系图谱(含股权穿透、母子公司层级)。

②格兰德多年积累的企业信用行为画像及动态风险监测标签。

4. 数据采集时间与覆盖范围:

①基准时间节点:数据集核心快照截至 2025 年 12 月 31 日。

②历史回溯跨度:为支持趋势分析与时序预测,提供自 2020 年 1 月 1 日起的历史变更记录(含注册资本变更、主要人员变动、司法诉讼记录等)。

5. 地理覆盖:

①海外版块:覆盖超过 200 + 国家和地区,重点涵盖 RCEP 成员国、欧盟及 “一带一路” 沿线国家的活跃企业。本次优先提供东南亚 10 国企业数据。

②国内版块:覆盖中国境内全部在册企业(含港澳台商投资企业),数据项完备率高达 95% 以上。

③更新频率:基础工商信息为 T+1 更新;负面舆情与司法风险信息为实时增量更新(截至发赛前)。

赛题目标:大赛组委会与格兰德联合建议,参赛团队可围绕以下四大前沿赛道进行作品设计,鼓励交叉学科创新:

1. 方向一:全球供应链韧性分析与风险预警(解决 “卡脖子” 与断链风险)

①业务痛点:地缘政治冲突和自然灾害频发,企业急需预判海外供应商的履约能力。

②建议课题:

构建基于图神经网络的全球多级供应链穿透模型,识别隐藏在二级、三级供应链中的单一依赖风险。

利用时序数据,开发供应链中断概率动态预警系统,提前 3-6 个月预测关键供应商的倒闭或出口管制风险。

2. 方向二:海外市场拓展的智能信用评估与授信决策(解决 “出海” 风控难)

①业务痛点:中国企业 “出海” 时,面对陌生的海外买方,面临账期和坏账风险。

②建议课题:

融合非结构化数据(当地新闻、诉讼文本)与结构化财务数据,构建海外中小企业的信用评分卡模型,替代传统人工尽调。

基于大语言模型(LLM)生成动态化、可解释性的企业信用评估报告,解决传统评分 “黑盒” 问题,自动输出授信额度建议。

3. 方向三:基于知识图谱的反欺诈与关联交易识别(解决 “虚假贸易” 与 “骗贷”)

①业务痛点:跨国企业利用复杂的多层股权架构隐藏实际控制人,进行违规关联交易。

②建议课题:

利用图数据库技术,自动识别环形持股、循环注资等复杂隐秘关联网络。

结合股东、地址、电话等多维弱关联信号,构建企业同质性聚类模型,精准识别 “一套人马多块牌子” 的欺诈团伙。

4. 方向四:宏观经济晴雨表及产业迁徙预测(服务政府决策与投资)

①业务痛点:宏观经济数据滞后于微观企业活动。

②建议课题:

利用格兰德数据集中的企业注册增量、注销量、招聘岗位变动等微观指标,构建区域性 / 行业性的经济先行指数。

分析企业跨区域投资流向,结合地理信息,预测新兴产业集群(如低空经济、生物制造)的下一阶段热点城市。

合规要求:

1. 数据脱敏:本数据集已进行严格的匿名化与脱敏处理,不涉及个人隐私数据。

2. 使用限制:参赛数据仅限本次大赛内部模型训练与算法验证使用,参赛者不得将原始数据用于任何商业目的或上传至公有云、公开互联网。

3. 知识产权:基于本数据集产出的算法模型成果,参赛者享有自主知识产权,格兰德拥有对数据集的最终解释权。

报名方式

(一)大赛官网报名

https://dexc.data.beijing.gov.cn

(二)微信扫码报名

640 -1.png

(三)京通 APP 扫码报名

640-2.png

2026 年北京数智创新大赛报名截止至 2026 年 8 月 28 日 24:00,诚挚期待参赛团队踊跃报名参赛,共同释放数据要素价值!去掉空行