战略总纲:以专有资产 × 智能体服务构建增长飞轮
- 员工队列
- 自然人群
- 百岁人群
- 出生
- 肿瘤
- 传感染
- 动物
- 植物
- 百万微生态
- 四极
- 长短读长基因组
- 细胞组学
- 时空组学
- 蛋白组学
- 代谢组学
- 影像组学
- 可穿戴
- 大人群 HGP2
- 百亿细胞
- 10BC
- 时空联盟 STOC
- 地球生物 EBP
- 疾病防控
- 主动健康
- 中心法则(核酸蛋白)
- 时空法则(细胞·时空)
- 健康多模态
- 病理多模态(疾病)
- Genpilot
- Cyto Coscientist
- BioLens
- Skill / MCP
- 受控工作空间
- 科研
- 医学
- 检测
- 诊断
- 药物研发
- 育种
- 健康管理
- 生物制造
1.1 战略命题:将资产转化为可复制服务
华大的优势不是某一项孤立能力,而是能够持续将稀缺样本与多组学技术转化为专有数据集,训练领域模型,并通过华大自研智能体在受控工作流中完成交付。因此,战略单元不应是单独的数据集、模型或工具,而是“数据 + 模型 + 智能体 + 领域验证”组成的可复制服务包。
六层飞轮描述的是同一套运营系统:资源与工具生产差异化数据,CNGBdb BioLens 将数据治理为可服务资产,基座模型将数据沉淀为可复用智能,DCS Cloud(含 Genpilot)与 Cyto Coscientist 将智能转化为面向客户的服务,服务结果、专家复核和新增标注再回流资产层。规模由此转化为可持续积累的生产力。
1.2 战略聚焦与边界
1.3 数据基础设施定位:资产与服务的运营系统
数据基础设施不是后台资料库,而是将五大数据产出转化为受控资产,并让华大模型与智能体安全使用这些资产的运营系统。其职责覆盖身份与标准、数据产品与 release、受控计算、Skill/MCP、证据可追溯和服务反馈。BioLens 是统一的服务与编排层,连接资产底座、DCS Cloud、Cyto Coscientist 与经授权的外部智能体接口。
五大数据产出计划:数据基础设施的核心工作领域
五大国际大科学合作项目,五年内系统性产出 5 EB 多模态数据,覆盖基因组、时空组、单细胞、病理影像等维度。数据基础设施围绕这五个方向,统一开展数据连接、治理、AI 可读与对外服务。Source: strategy.html
2.1 数据基础设施 × 五大方向
五个方向共 5 EB 数据,核心工作围绕分层标准体系展开。每个方向涉及多组学(基因组、转录组、蛋白组、代谢组、单细胞、时空等)、表型、图像与影像数据,每种数据类型均有其专业标准;这些标准进一步组装为方向级标准(如 STOC 空间组学标准体系、HGP2 人群遗传标准体系),形成「基础标准 → 方向标准」的分层架构。通过这套标准连接内部数据与外部数据源,编织跨方向数据网络。
数据流入遵循统一入口:经数据管理计划(DMP)入驻,按 AI Ready 六项标准(真实与完整、配对与对齐、标准与可复现、合规与受控、可训练与可评测、可服务与可运营)完成验收后进入管线。入库后,经标准化治理与治理扩展(本体化、版本化、派生资产管理),形成可被 AI 消费的数据产品。最终封装为Skill,供 BioLens、Cyto Coscientist、DCS Cloud(含 Genpilot 智能体)等统一调用——实现「一次治理、多处应用」。
① 标准体系(连接数据网络) → ② DMP 入口(AI Ready 验收) → ③ 治理与扩展(标准化治理 + 派生资产管理) → ④ Skill 化(数据产品封装) → ⑤ 智能体调用(BioLens / Cyto Coscientist / DCS Cloud,含 Genpilot 等)
| 方向 | 数据特征 | 数据基建支撑重点 | 对应基座模型 |
|---|---|---|---|
| STOC | 高维空间转录组,图像 + 表达矩阵混合 | 空间坐标标准化、切片对齐、海量 WSI 存储 | 病理/虚拟细胞 |
| HGP2 | 百万人级 WGS,海量变异位点 | 变异本体化、人群遗传基线、GENOS 压缩试验场 | Genos |
| EBP | 跨物种真核基因组,多样性极高 | 物种标准化、泛基因组表征、分类学本体 | Genos(扩展) |
| 10BC | 百亿级单细胞,基因表达矩阵超大 | 细胞类型本体、批次校正、大规模矩阵存储 | 虚拟细胞 |
| 100KPM | 十万例多组学 + 病理影像 | 患者级多模态对齐、分子分型索引、Token 计量 | 病理组织模型 |
2.2 AI Ready 高质量数据集与「一数多用」
数据基建产出不再以「维护了多少系统」衡量,而以「交付多少可被 AI 消费的数据产品」定义价值。据此确立两大核心标准:AI Ready 高质量数据集(数据产品形态)与「一数多用」(数据复用能力)。
AI Ready 高质量数据集:六个可验收条件
每一数据计划都须从「采得更多」升级为「交付更可用的数据产品」:
- 1真实与完整——保留原始观测、样本来源、实验协议、仪器与批次信息;关键队列覆盖纵向时间与临床/表型结局。
- 2配对与对齐——建立供体–样本–组织–空间坐标–分子–图像–分析结果的稳定关联,支撑跨层联合分析。
- 3标准与可复现——统一组织、疾病、细胞类型、表型与实验本体;冻结参考版本、处理流程与 release manifest。
- 4合规与受控——同意书、数据使用范围、许可、跨境限制与访问决策机器可读;派生数据与模型同样纳入治理。
- 5可训练与可评测——训练前完成用途确认、去重与污染检查;独立留出集、外部测试集与 Benchmark 与训练资产分离。
- 6可服务与可运营——面向科研、报证、模型与产品形成数据集、参考资源、分析工作流与 API/Skill,而非一次性文件交付。
「一数多用」:让复用成为能力,而不是口号
同一份数据可服务不同场景,但须在主体授权、用途范围、最小必要、可追溯、可撤销框架内运行。以标准数据资产 + release manifest 为单一事实源,派生为四种可控数据产品:
数据枢纽:从数据生产到 AI 服务的受控通路
数据枢纽承接五大数据产出计划,将持续产生的数据转化为受控、可复用、可服务的资产。L0 治理与 L1 接入并行发生:GigaNorn 持续发布版本化的身份、元数据、本体、质量和模态规则;DMP / DM / DCS 在计划、准入、核验与受控处理中执行这些规则,接入数据暴露的问题再反馈推动标准迭代。数据通过二者联合门禁后进入 L2 DataBrick,再由 L3 BioLens 发布服务。应用和智能体不直接连接源系统或数仓存储;BioLens Brain 作为横向编排与策略控制面覆盖全链路。
3.1 总体架构与职责边界
L0–L3 定义四类职责,而非严格串行的流水线。L0 与 L1 共同构成并行的“治理—接入域”:GigaNorn 对身份、元数据、本体、质量和模态 Profile 进行版本管理;DMP、DM 将标准落实到计划、准入、授权、权威位置与 Release,DCS 为数据画像、规范化修复和异常处理提供受控环境。接入过程中发现的 Schema 不匹配、元数据缺失、质量异常和新模态需求,反向进入 GigaNorn 的标准变更流程。只有通过身份、元数据、授权、完整性和模态 Profile 联合门禁的数据,才能进入 DataBrick。随后由 DataBrick 负责 D0–D4 产品,BioLens 负责服务契约与接口。
数据问题反馈
3.1.1 分层交付物与控制点
| 层级 | 责任组件 | 核心交付物 | 控制与验收 |
|---|---|---|---|
| 治理(并行) | GigaNorn | 版本化实体标识、元数据规范、本体映射、模态 Profile、质量规则与标准变更记录 | Owner 审批、版本一致、映射有据、敏感身份隔离、接入异常反馈闭环 |
| 接入与汇聚(并行) | DMP · DM · DCS | 符合标准的计划与登记、权威路径核验、授权决策、画像与规范化修复记录、受控工作空间及审计记录 | 与 GigaNorn 联合门禁:身份、必填元数据、本体、用途与范围、完整性、模态 QC、Release 完整性及执行可恢复 |
| 受治理数据仓 | DataBrick | D0–D4 产品清单、分模态标准对象、语义索引、队列与切片、训练物化、模型证据、产品版本与血缘 | 源端对账、格式与 Schema 校验、发布评审、切分与泄漏检查、确定性重建、生命周期与成本控制 |
| 跨层编排控制 | BioLens Brain | 任务分解、L0–L3 能力路由、策略判定、执行闸门、调用链、证据组装、降级与人工接管 | 不得绕过各层控制;最小权限、策略一致、调用链完整、有限重试、可回滚或接管、性能与成本 SLO |
| 数据服务 | CNGBdb BioLens · BioLens Search · API · MCP · Skill · 工作空间 | 面向场景的数据发现、查询、切片、队列、计算、训练批次、证据与工具服务 | 产品 Release 解析、统一契约、身份、授权、限流、SLO、审计与输出审查 |
| 应用端 | DCS Cloud(Genpilot) · Cyto Coscientist · 模型与授权合作方 | 科研、医学、检测与诊断场景结果 | 通过 L3 接口使用能力,不得绕过源端控制;结果可归因、可复核,最终决策责任明确 |
3.2 治理层 · GigaNorn 与数据标准
五大方向包含序列变异、稀疏矩阵、空间坐标与影像、表型队列及多模态病例关联。治理标准因此采用统一实体与策略核心 + 分模态 Profile:核心层对齐项目、参与者/标本、样本、实验、文件、Release、同意、质量和来源;模态 Profile 定义权威格式、坐标体系、Schema、分区索引、QC 与允许访问粒度。在保留专业结构的同时支撑跨方向服务。
3.2.1 标准落地四要素
3.2.2 面向模型的验收结果
3.2.3 GigaNorn 平台组件
GigaNorn Scientific Data Intelligence Platform(科学数据智能基础设施)通过三个协同模块落实「Identify · Understand · Converse」:Norn 负责身份与登记,Snotra 负责元数据与本体治理,Bragi 提供受控的自然语言接口。三者共享实体模型、策略和版本记录,而非建设三套独立系统:
3.3 接入与汇聚层 · DMP / DM / DCS
接入与汇聚在数据到达过程中同步执行 GigaNorn 标准:DMP 校验计划、必填元数据、模态 Profile、用途、质量目标与授权;DM 核验权威位置、完整性、实体关系和 Release 归属;DCS 为数据画像、规范化、异常修复与计算到数据提供受控环境。不符合项不能静默放行或各自打补丁,而应进入拒绝、修复、例外审批或标准变更流程。所谓汇聚,是在权威位置之上建立符合标准的统一清单与关系图,而不是把全部源文件复制到新孤岛。
目标状态:GigaNorn 与 DMP / DM / DCS 通过接口和事件同步标准、计划、权威位置、授权、质量结果与异常;通过联合门禁的数据进入 DataBrick,形成 D0–D4 产品 Release,再由 BioLens 发布服务。每次查询、训练或分析都能回答「使用哪个源 Release 与 DataBrick 产品版本、哪些实体与切片、何种用途、依据何种授权、采用何种物化、产生哪些派生结果」。
3.4 DataBrick · 受治理多模态数据仓
DataBrick 是位于 DMP、DM、DCS 与 CNGBdb BioLens 之间的受治理多模态数据仓,不替代权威源系统:DMP 管理计划、用途与授权,DM 核验权威位置与 Release,DCS 提供受控计算。DataBrick 将获批 Release 加工为版本化、可追溯的 D0–D4 数据产品;BioLens 再将其发布为面向检索、分析、训练和智能体的统一数据服务。
3.4.1 DataBrick D0–D4 数据产品模型
D0–D4 定义 DataBrick 内部的数据产品演进,与 3.1 的 L0–L3 业务架构分层不同。不同模态、不同用途可按条件分别演进;高层产品由低层派生并保持反向链接,不覆盖权威源数据。BioLens 的每次服务调用均须解析到明确的 DataBrick 产品 Release。
| 级别 | 产品内容 | 服务能力 | 发布控制 |
|---|---|---|---|
| D0 原始受控 | 权威 FASTQ/BCL、BAM/CRAM、VCF/BCF、组装文件、原始矩阵、WSI/原生影像、空间坐标、表型/临床源表、仪器与实验日志 | 目录发现、完整性核验、受控文件/范围读取、归档调取、计算到数据挂载 | 不可变 manifest、checksum、来源与保管链、同意用途、留存和访问审计;不自动承诺可用于训练 |
| D1 标准对象 | 经验证的模态 Profile:参考对齐序列与变异、组装注释对象、AnnData/Zarr 兼容稀疏矩阵、OME 兼容金字塔影像与掩膜、规范化表型及关联表 | 对象查询、基因组区间、矩阵切片、影像瓦片/区域、Schema 感知读取、跨工具交换 | 格式与 Schema 一致、坐标与参考版本一致、对象源端对账、模态 QC、版本兼容 |
| D2 语义与证据 | 实体关系表、obs/var 元数据、annotation evidence、本体映射、质量画像、来源、许可与用途限制、队列定义、可检索索引 | 实体与队列检索、多维筛选、跨版本比较、多模态关联、聚合统计、证据引用与发现 API | 语义映射有据、查询与对象一致、隐私及最小单元控制、更新责任、引用完整 |
| D3 计算与训练物化 | 用途绑定快照、特征矩阵、pseudobulk/聚合表、影像 Patch、tokenization/词表版本、经批准的 embedding、split manifest、平衡采样器、Shard、Cache 与可复现环境 | 可复现分析、本地或分布式高吞吐采样、训练/评测批次、特征读取与受控导出 | 声明用途与模型版本、训练验证测试隔离、泄漏污染检查、偏差画像、确定性重建、性能成本、到期与撤销 |
| D4 模型与决策证据 | 预测结果、扰动结果、空间邻域、检索索引、模型卡、评测报告、解释性产物、专家复核及实验/临床研究验证记录 | 模型推理、证据比较、结果回溯、场景报告、复核工作台及获批决策支持输出 | 绑定数据、模型、代码、参数、评测集与复核人;监测漂移和用途边界;临床/诊断用途另行通过质量及监管门禁 |
3.4.2 模态 Profile 与五大方向数据服务矩阵
平台统一的是契约,不是强迫所有数据转换为一种物理格式。每类数据保留权威社区格式,同时增加 BioLens Profile,明确标识、坐标、Schema、索引、分区、质量和访问模式。下表格式为目标 Profile,须经项目及领域 Owner 验证后发布。
| 方向 | 主要数据与标准对象 | 服务维度与粒度 | 代表性产品 |
|---|---|---|---|
| STOC | FASTQ/比对数据、表达矩阵、物理与分子坐标、OME 兼容金字塔影像、分割掩膜、AnnData/Zarr 兼容空间对象,以及组织、器官、时期、物种元数据 | 物种→器官→组织→切片→区域/细胞 Bin→基因/特征;提供瓦片/ROI、表达切片、空间邻域和跨切片比较 | 空间图谱检索、切片/ROI 服务、基因空间表达、组织配准、空间训练 Patch |
| HGP2 | FASTQ、BAM/CRAM、gVCF/VCF/BCF、参考与注释版本、样本/家系表、表型/暴露表及汇总统计 | 队列→参与者/家系→样本→实验→染色体/区间→变异→等位基因/基因型→表型;提供隐私保护队列计数与汇总查询 | 变异/区间查询、等位基因频率、队列构建、表型关联证据、参考面板、Genos 训练/评测快照 |
| EBP | 原始读段、FASTA 基因组组装、GFF3/GTF 注释、转录本与蛋白、适用时的组装图、QC 报告、标本/凭证元数据、分类学与采集地理信息 | 分类单元→标本→组装→染色体/Contig→基因→转录本/蛋白→直系同源组;支持分类、地理、质量、共线性与比较筛选 | 组装注释目录、分类覆盖、序列/基因检索、同源与共线、泛基因组/比较集合、跨物种模型输入 |
| 10BC | FASTQ、计数矩阵、AnnData/H5AD 与 Zarr 兼容稀疏对象、obs/var 表、细胞与样本 QC、细胞类型本体,以及适用的 embedding、扰动和空间关联 | 研究→供体→样本→实验→细胞→细胞类型/状态→基因/特征;提供队列筛选、矩阵切片、pseudobulk、采样、embedding 与扰动配对 | 细胞图谱检索、细胞/基因矩阵服务、细胞类型统计、参考映射、平衡训练批次、扰动数据集、虚拟细胞评测集 |
| 100KPM | 病理 WSI 原生文件及 DICOM/OME 兼容派生物、金字塔瓦片、标注与掩膜;DNA/RNA 组学、空间组学、规范化表型/结局表,以及参与者—标本—蜡块—切片—区域—实验关联 | 队列→参与者→事件/诊断→标本→蜡块→切片→ROI/瓦片→分子实验→特征;支持最小必要原则下的多模态筛选 | 病例/队列构建、WSI 瓦片/ROI、多模态病例包、分子分型证据、病理 embedding、预后研究集合、模型评测工作台 |
3.4.3 DataBrick 六类交付产品
3.4.4 产品契约、物化与发布
每个数据产品必须声明 Owner、允许/禁止用途、实体粒度、模态 Profile、源 Release、Schema、坐标与参考版本、质量阈值、授权策略、访问模式、更新频率、留存、SLO、单位成本及证据输出。逻辑产品引用权威源;只有当查询时延、训练吞吐、可复现或隔离需求足以证明存储及生命周期成本合理时,才创建物理物化。
3.5 CNGBdb BioLens · 统一数据服务层
BioLens 是位于 DataBrick 之上的服务层,不再建设另一套数据仓。它从获授权的 DataBrick 产品中组装面向场景的数据能力:BioLens Search 提供交互式发现与证据检索;API、MCP、Skill、查询端点与工作空间适配器提供稳定机器契约。Genpilot、Cyto Coscientist、获批准的 Claude Science 类智能体及合作方产品,均按授权范围消费同一套服务。DCS Cloud 提供面向客户的云端工作空间与执行环境,但不持有底层数据产品。每次请求必须解析到同一 DataBrick Release、策略决策和审计记录。
3.5.1 服务契约与智能体接口
| 能力类型 | 主要数据层级 | 典型操作 | 发布要求 |
|---|---|---|---|
| 发现与数据集 Skill | D1–D2 | 实体解析、目录检索、字段解释、质量概览、队列筛选、对象与版本定位 | 来源覆盖、查询准确、权限隔离、证据完整、时延与成本 |
| 分析与物化 Skill | D2–D3 | 矩阵/影像切片、统计聚合、特征构建、工作流执行、训练批次交付 | 输入输出契约、测试数据、可复现、性能、泄漏检查、回滚与 Owner 评审 |
| 证据与模型 Skill | D2–D4 | 证据检索、模型推理、结果比较、解释、评测与验证打包 | 模型与评测版本、用途边界、专家复核、漂移监测与追溯 |
| 治理与运营 Skill | D0–D4 | 授权、用途校验、发布核验、审计、成本估算、生命周期动作与使用报告 | 默认拒绝、最小权限、高风险确认闸门、回滚与完整审计 |
3.6 智能体与应用消费
消费端通过 BioLens 服务使用同一条 DataBrick 产品链的不同视图:BioLens Search 主要提供 D1–D2 的交互式发现、对象定位、队列筛选与证据引用;DCS Cloud 按授权提供 D0–D3 的受控计算、分析及训练交付;Genpilot、Cyto Coscientist 与获批准的 Claude Science 类智能体通过受控 Skill、MCP 和 API 调用 D1–D4 服务;模型复核或临床研究工作台消费获批 D4 证据。任何消费端不得把索引可见等同于载荷可访问,不得绕过 BioLens 策略或直连源系统。
3.6.1 BioLens Search(原 OmicSeek)· 交互式数据服务
BioLens Search 是 D1–D2 产品的发现与查询入口:解析基因、变异、组装、物种、参与者、样本、实验、细胞类型、组织、影像区域、表型和队列等实体,选择兼容 Release 与授权视图,调用实体、队列、区间、矩阵或影像索引,并返回带来源、版本、质量和访问条件的结构化结果。它负责发现与证据准备,不替代 DCS 受控计算或治理决策。
a. 解析意图、实体类型、粒度、模态与所需操作
b. 选择兼容产品 Release 与最小权限视图
c. 调用实体、队列、区间、矩阵、影像或证据索引并规范结果
d. 返回结构化结果及源对象、版本、质量、授权条件与引用
验收重点:实体与意图准确率、对象查询一致性、来源覆盖、权限隔离、时延与证据完整率。
• 按数据源变更频率配置定时拉取、Webhook 或版本轮询
• 检测新增、修订与撤回,生成差异记录并触发索引更新
• 更新失败进入重试与告警,重要版本需通过完整性校验后发布
验收重点:更新时延、同步成功率、版本一致性和失败可恢复性。
• 通过 BioLens 向 DCS Cloud(Genpilot)、Cyto Coscientist 及授权工具提供 REST/SSE、MCP、查询或 Skill 接口
• 支持实体、队列、基因组区间、稀疏矩阵切片、影像瓦片/ROI、证据及源数据查询,并统一身份认证、限流、版本与审计策略
验收重点:接口契约稳定性、对象与查询结果一致性、权限隔离、可观测性及兼容性测试覆盖。
3.7 BioLens Brain · 编排与控制面
BioLens Brain 是 CNGBdb BioLens 覆盖 L0–L3 的横向编排与策略控制组件:对每个请求,在 L0 解析实体、本体、用途、授权和质量规则;在 L1 核验计划、权威位置、源 Release 与受控执行环境;在 L2 选择具名的 DataBrick D0–D4 产品 Release、对象、切片、队列、物化和证据产品;在 L3 调用 BioLens Search、API、MCP、Skill、查询或工作空间服务。随后执行隐私、成本和确认闸门,记录数据、模型、工具、参数与结果的完整血缘。它不持有 DataBrick 产品或源数据,也不替代任何一层的控制与责任人。
下表是当前实现快照,不等同于目标架构契约。框架版本、模型名称、重试上限与 KPI 数量在文档发布时须从配置中心或 CMDB 同步;长期架构以接口、控制要求和服务目标定义,避免被具体技术版本锁定。
| 维度 | 实现 |
|---|---|
| 前端 | Vue2 + Quasar + cngbdb-ui,自然语言对话 |
| 后端 | Django 3.2 + DRF,SSE 实时流式推送 |
| 编排引擎 | 自研 Deep Flow,采用 Plan & Execute 四阶段流水线;错误分类后执行有限重试(最多 3 次)、降级或人工接管 |
| 模型路由 | 规划与执行模型按任务复杂度、敏感度、时延、成本和可用性进行策略化选择,并在调用链中记录模型版本 |
| 安全机制 | 工具白名单 + 执行闸门(Confirm Gate),「默认拒绝,按需授权」 |
| 可观测性 | Phoenix + OpenInference,统一 executor / call_skill 埋点,15 字段数据模型,8 类 KPI |
| 对外出口 | Open API(REST/SSE)+ MCP Server,双出口共享同一后端能力层 |
| 演进定位 | 当前以带确认闸门的辅助编排为主;目标是具备评测、人工检查点和回滚机制的有边界自动科研工作流 |
3.7.1 BioLens Brain 技术实现视图
该技术视图细化 3.1 的业务架构,不构成第二套串行模型。数据源、治理、DataBrick 数仓产品、BioLens 数据服务与应用表示能力路径;BioLens Brain 单独作为横向控制面,按任务调用各层已授权能力。
智能服务:将数据与模型转化为可验证的智能体服务
All in AI 不是把所有工作接入通用大模型,而是建立数据发布版与领域模型 → 标准能力接口 → 华大自研智能体产品 → 场景交付 → 证据反馈的运营闭环。DCS Cloud 是受控服务平台,Genpilot 与 Cyto Coscientist 是主要智能体产品;通用智能体仅通过授权接口接入。科研、医学支持、检测和诊断按照风险递增原则设置验证、审批与责任边界。
4.1 模型资产组合:分开管理现有能力与建设目标
5 EB 是五大数据产出计划的规划原始数据规模,不等同于可直接训练的语料。只有通过知情同意与授权核验、质量控制、去重去标识、训练测试隔离及血缘登记的数据发布版,方可进入模型研发。模型价值以经过验证的场景效果衡量,不以参数量或训练数据量单独衡量。
| 模型资产 | 定位 | 主要输入 | 目标输出 | 发布门槛 |
|---|---|---|---|---|
| Genos | 现有基因组研究模型 | 版本化基因组序列与功能数据 | 序列表征与基因组预测 | 固定 Benchmark、外部留出集、模型卡与指标复现 |
| Orion Geno | 现有基因组注释服务与模型 | 参考基因组与多源注释 | 基因结构、功能元件与变异证据 | 覆盖度、一致性、来源证据与版本差异验证 |
| 虚拟细胞 | 重点建设方向 | 10BC 治理后单细胞与多组学发布版 | 扰动、响应、状态迁移与互作预测 | 跨队列留出、扰动评测与湿实验验证 |
| 病理多模态模型 | 重点建设方向 | 100KPM 配对影像、空间组学与临床元数据 | 分型、预后研究与靶点发现支持 | 多中心外部验证、漂移评估、可解释性与临床边界审查 |
4.2 产品架构:平台、智能体与生态接口边界清晰
4.3 场景交付:证据与责任先于自动化
| 场景 | 智能体交付 | 必要控制 | 责任边界 |
|---|---|---|---|
| 科研 | 检索、分析方案、可复现工作流、证据报告与验证建议 | 数据授权、引用可追溯、结果可复现、专家复核 | 研究者对假设与结论负责 |
| 医学研究与临床支持 | 队列分析、标志物证据与决策支持信息 | 伦理与预期用途审查、外部验证、隐私保护、人工签署 | 不得替代有资质专业人员判断 |
| 检测与诊断 | 仅交付经验证产品边界内的获批功能 | 质量体系、分析与临床验证、监管准入、监测与召回能力 | 未经准入不得自主输出诊断结论 |
| 实验自动化 | 方案生成、排程、设备调用与质控告警 | 仿真或空跑、安全联锁、操作员批准与急停 | 智能体不得独立执行高风险实验 |
| 内部效率 | 研发、知识检索、文档与运营辅助 | 企业身份、数据分级、输出复核与成本控制 | 与对外产品收入及壁垒指标分开核算 |
4.4 AI 工程与治理:建立可追溯的发布闭环
4.5 运营指标与验收
| 维度 | 核心指标 | 验收原则 |
|---|---|---|
| 结果质量 | 任务成功率、证据完备率、复现率、专家采纳率 | 按场景设基准,并与人工或既有流程对照 |
| 安全合规 | 越权事件、高风险门禁绕过、隐私事件、审计覆盖率 | 重大边界突破零容忍,事件可追溯、可恢复 |
| 服务效率 | SLO 达成率、端到端时延、成功任务单位成本、节省人工时长 | 不得以牺牲质量和安全换取降本提速 |
| 产品经营 | 活跃机构、付费任务转化、续约、交付毛利、支持成本 | 收入可归因到产品、场景与服务协议 |
| 反馈飞轮 | 采纳标注、新增评测样本、复用工作流、模型可量化提升 | 只有经授权和质量复核的反馈进入新数据与模型发布版 |
数智基建:数据枢纽与 All in AI 的运行底座
IT 基础设施是高质量数据「流转」与「转化」的关键管道和载体。当前资源形态为区域化本地 HPC、存储与云端/超算租赁 AI 算力的混合体。目标架构演进为云为主、本地为辅。弹性资源以工作负载吞吐、排队时延、单位成本和服务 SLO 验证,不公开名义峰值与资产规模。华大算力网连接获批片区和云地域,支撑策略受控、数据就近执行。
5.1 云优先架构与工作负载放置
基础设施不是简单的云/本地二分,而是依据数据分级、服务目标、弹性需求、依赖位置、全生命周期成本与恢复要求放置工作负载。DCS Cloud 是主要云服务环境;数据枢纽提供受治理的 Release 与策略;算力网连接采集端和本地例外区与云服务,且不得绕过访问控制。注:下文 L0–L3 为 IT 底座视角(云基础→统一控制→平台→应用);第三章则是 L0 治理与 L1 接入并行协同,通过联合门禁后进入 DataBrick 数仓与 BioLens 服务。
| 工作负载 | 默认放置 | 本地例外条件 | 必备控制 |
|---|---|---|---|
| AI 训练、推理与智能体服务 | 云上弹性 GPU / 托管推理 | 受限数据不可出域、确定性低时延或经验证的长期稳定利用率优势 | 获批数据 Release、配额与预算、模型版本、调用链与回滚 |
| 科研分析与协同 | DCS Cloud 受控工作空间 | 仪器近端处理或敏感数据安全区 | 用途绑定访问、可复现环境、输出审查与到期回收 |
| 数据接入与留存 | 云对象存储与托管归档 | 采集缓冲、法定留存或带宽限制 | 清单、校验、分级、加密、副本与恢复演练 |
| 平台控制服务 | 多地域云托管服务 | 离线连续性要求 | 身份联邦、审计日志、SLO、备份与故障切换演练 |
5.2 存 · 大规模容量工程与数据生命周期
五大方向长期数据产出应作为逻辑原始数据产出估算,不能直接等同于受治理资产、有效训练数据或物理容量需求。容量工程分别对账原始产出、压缩去重后的物理留存、AI Ready 发布与实际消费;记录数据量、样本或病例、Release、质量与授权状态,并追踪任务、有效样本、结果产物及证据完整度。
| 台账 / 层级 | 内容 | 治理策略 | 验收指标 |
|---|---|---|---|
| 原始产出与合规留存 | 下机数据、源文件、合规副本 | 清单、校验、分级、生命周期分层、副本与恢复 | 逻辑/物理字节数、清单完整率、校验通过率、副本及恢复成功率 |
| 受治理标准 Release | 标准化且质控通过的数据、元数据与索引 | 版本发布、语义映射、质量画像、权限与血缘 | 验收样本/病例数、元数据完整率、质控通过率、可复现率、检索 SLA |
| AI Ready 训练与评测资产 | 训练集、验证集、Benchmark、特征与任务缓存 | 独立版本、泄漏与污染检查、缓存生命周期管理 | 有效样本或 Token、污染检查通过率、覆盖度、训练吞吐、评测稳定性 |
| 服务消费与派生资产 | Skill、MCP、API 调用及结果、模型、报告 | 关联请求、策略、输入 Release、调用链、成本和输出版本 | 任务/调用量、消费数据或 Token、证据完整率、成功率、单位成本、复用率 |
GENOS 压缩(研发选项):「仅存模型预测偏差」的路线可能降低基因组存储量,但必须通过可复现实验验证无损性、解压一致性、吞吐、计算成本、格式长期可维护性与恢复风险,方可纳入容量假设。
5.3 管 · 机房基建与全生命周期资产化管理
「管」维度覆盖区域化核心机房基建与数据/设备全生命周期资产管理。它是连接存、算、传、安的运营基座,确保物理资源有账可查、数据有主可认、闲置资源盘活利用。
5.4 算 · 云优先弹性调度
云上 GPU/CPU 是训练、推理、批量分析和智能体服务的默认执行池。统一调度器依据获批数据位置、敏感度、工作负载 SLA、排队时延、资源供给、价格以及适用的碳/能耗约束,选择云地域、加速卡类型、执行队列或本地例外区。本地 HPC 用于获批的稳定基线和例外场景,不作为默认扩容路径。
5.5 传 · 数据流动与跨区连接
网络连接采集点、本地例外区、云地域与灾备位置。目标不是让所有数据无差别流动,而是通过计算到数据减少传输;对获批副本、Release 分发与恢复流量,明确带宽、加密、校验与成本策略。骨干规模仅保留在受控网络报表中;后续容量由实测峰值入库、副本窗口和恢复目标驱动。
5.6 安 · 云安全、合规与韧性
云优先不等于责任外包。研究院仍对数据分级、同意与用途控制、身份治理、密钥归属、配置基线、访问复核、证据留存和事件响应负责;云厂商仅对共享责任模型中约定的服务范围负责。高风险服务须明确 RTO/RPO、备份恢复演练、事件预案,并定期复核访问权限和恢复能力。
5.7 平台支撑、运营与验收
IT 设施以云原生、策略受控的方式支撑数据枢纽与 All in AI。运营单元是服务,而非设备:每项服务都有 Owner、数据分级、工作负载放置决策、SLO、成本中心、安全基线、恢复目标和证据链。基础设施以可信服务交付与单位经济性验收,而不以设备数量或名义容量单独验收。
| 能力 | 对数据枢纽的支撑 | 对 All in AI 的支撑 | 运营验收 |
|---|---|---|---|
| 存 | 云对象存储、归档、Release 仓库、生命周期策略与受控本地例外存储 | 训练/评测资产、特征库、模型产物与证据留存 | Release 可用性、恢复成功率、留存合规率与单位存储成本 |
| 算 | DCS Cloud 受控工作空间与计算到数据执行 | 弹性训练、评测、推理与智能体编排 | 排队时延、作业成功率、可复现率、GPU/CPU 效率与单位任务成本 |
| 传 | 获批的接入、副本、Release 分发与恢复路径 | 数据就近执行与受控结果交付 | 链路可用性、传输成功率、完整性、恢复窗口达标率与出云成本 |
| 安 | 身份、用途控制、审计证据、加密与合规映射 | 模型/数据访问控制、智能体工具闸门、调用链留存与事件响应 | 访问复核完成率、配置合规率、事件响应、恢复演练结果与审计证据完整率 |
5.7.1 智能化运维:从监控到受控自动化
Linux 自动巡检机器人纳入云优先底座的运营能力。现有材料已展示多指标采集、动态基线研判、根因报告,以及跨监控系统汇总存储节点状态。它的战略价值是闭合「遥测 → 诊断 → 获批动作 → 验证 → 证据」的运营链路,而不是让大模型直接控制生产系统。
| 级别 | 允许动作 | 示例 | 控制要求 |
|---|---|---|---|
| L0 | 观察与摘要 | 采集健康指标、归并告警、生成日报 | 只读凭证、数据最小化、调用链留存 |
| L1 | 建议与创建工单 | 根因假设、容量风险、处置建议 | 引用原始信号与置信度;人工承担决策 |
| L2 | 执行预批准低风险 Runbook | 重试采集、轮转非关键日志、重启获批无状态任务 | 白名单、变更窗口、范围限制、自动验证与回滚 |
| L3 | 人工批准的高风险变更 | 存储迁移、网络策略变更、数据删除、权限提升 | 双人审批、工单关联、备份/恢复检查、变更后复盘 |
5.7.2 大规模基础设施交付路径
| 阶段 | 核心交付物 | 验收证据 |
|---|---|---|
| 基线与控制 | 对账存、算、网、数据台账;定义数据分级、工作负载放置、RTO/RPO、云落地区基线和观察/建议模式运维试点 | 关键服务 Owner 明确;成本与利用率基线;恢复演练;带来源链接的运维报告 |
| 云优先服务运行 | 云对象/归档生命周期、DCS Cloud 调度策略、FinOps 配额与分摊、获批数据流动路径及低风险自动化试点 | 台账周期性对账;Release 可用性与恢复 SLO 可量化;作业成功率和单位成本看板;获批 Runbook 验证通过 |
| 规模化与韧性 | 规模化运行云优先留存与计算服务;多地域恢复演练;策略受控本地例外区;运维证据回流容量规划 | 恢复目标经演练达成;本地例外定期复核;成本偏差受控;服务和智能体 SLO 达标;高风险变更全程可审计 |
组织与人才:40 人双团队能力配置
数据中心在统一 O3 责权下管理数据枢纽与数智基建两个团队,各 20 人。人员不按小组平均分配,而按服务责任和工作负载配置;团队负责人和组长均计入 40 人编制,两名团队负责人由组长兼任。整体能力覆盖五大数据产出、BioLens 与智能体服务、云优先运营及 5 EB 存管算传安工程。
6.1 编制分配总盘
| 团队 | 小组 | 人数 | 岗位构成 | 核心责任 |
|---|---|---|---|---|
| 数据枢纽 · 20 | 数据运营与商业化 | 7 | 负责人 1;数据产品与领域运营 3;市场生态 1;解决方案销售 1;客户成功 1 | 方向接入、产品组合、对外市场、销售转化、交付运营与反馈回流 |
| 应用研发 | 8 | 架构负责人 1;后端与数据平台 3;AI/Skill/MCP 2;前端与检索 1;质量与发布工程 1 | GigaNorn、DMP/DM、BioLens、Skill/MCP/API、证据链与平台可靠性 | |
| 数据管理 | 5 | 负责人 1;标准与本体 2;质量与血缘 1;授权与合规 1 | 身份、元数据、本体、质量规则、血缘、发布、授权与治理验收 | |
| 数智基建 · 20 | 系统运维 | 8 | 负责人/SRE Owner 1;云平台与 SRE 3;存储/HPC 2;可观测与 AIOps 1;备份容灾 1 | DCS Cloud、本地例外区、存算平台、SLO、自动化与恢复 |
| 资源管理 | 6 | 负责人 1;存算容量工程 2;FinOps 1;CMDB 与资产生命周期 1;服务目录与供应商管理 1 | 5 EB 容量规划、配额成本、资产台账、采购、利用率、服务目录与供应商 SLA | |
| 网络安全 | 6 | 负责人 1;网络与云网络 2;安全工程与运营 2;IAM 与合规 1 | 算力网、跨区传输、零信任、身份权限、数据安全、合规与事件响应 |
6.2 岗位能力与交付矩阵
| 岗位簇 | 人数 | 必备能力 | 明确交付物 | 主要衡量 |
|---|---|---|---|---|
| 数据运营管理、产品与领域运营 | 4 | 组合管理、生命科学领域理解、产品设计、DMP、Release 运营、需求管理、跨方向协同 | 组合看板、数据产品路线图、发布计划、服务目录、使用报告 | 组合交付、发布及时率、采用率、复用率、合作方满意度 |
| 市场与生态 | 1 | 市场研究、生命科学行业洞察、内容与活动策划、合作生态、线索运营 | 市场地图、价值主张、市场材料、有效线索、合作管线 | 有效线索、获客成本、商机贡献、伙伴激活 |
| 解决方案销售 | 1 | 顾问式销售、数据与 AI 方案设计、投标合同协同、定价、合规边界意识 | 商机计划、解决方案、报价、合同输入、收入预测 | 商机金额、赢单率、签约收入、毛利、销售周期 |
| 客户成功与交付运营 | 1 | 客户入驻、项目交付、服务采用、问题协调、续约、证据化反馈 | 成功计划、验收包、使用复盘、续约计划、产品反馈 | 激活率、交付验收率、续约率、服务健康度、客户满意度 |
| 应用与数据平台研发 | 6 | 架构、前后端工程、数据服务、检索、云原生、质量工程、CI/CD、可观测性 | GigaNorn、DMP/DM、BioLens 应用、API、自动化测试与发布产物 | 路线图达成、可用性、缺陷逃逸率、发布频率、恢复时长 |
| AI、Skill 与 MCP 工程 | 2 | 智能体编排、工具契约、检索、评测、提示注入防护、模型服务集成 | 版本化 Skill、MCP 服务、评测集、调用链与安全闸门 | 任务成功率、契约测试覆盖、复用率、时延、单位成本、安全事件 |
| 数据治理 | 5 | 元数据与本体、数据质量、血缘、隐私、授权、发布治理、领域标准 | 标准、字典、映射、质量规则、血缘记录、发布与授权证据 | 元数据完整率、规则通过率、血缘覆盖率、审核时长、审计发现 |
| 云平台、SRE、存储、HPC 与容灾 | 7 | 云架构、Kubernetes、Linux、存储、调度器、基础设施即代码、SLO、备份恢复 | DCS Cloud 运行环境、存算服务、Runbook、监控、备份与恢复证据 | SLO 达成率、作业成功率、MTTR、恢复成功率、容量效率、单位成本 |
| 可观测与 AIOps | 1 | 指标、日志、调用链、事件关联、自动化、本地模型、Runbook 编排、安全回滚 | 统一遥测、巡检智能体、获批自动化、事件与容量报告 | 覆盖率、告警准确率、研判时长、自动化成功率、回滚成功率 |
| 容量、FinOps、资产与供应商 | 6 | 容量建模、云经济性、采购、CMDB、资产生命周期、合同、SLA、供应商管理 | 5 EB 容量模型、预算预测、成本分摊、资产台账、服务目录、供应商评分 | 预测准确率、预算偏差、利用率、台账准确率、采购周期、供应商 SLA |
| 网络、安全、IAM 与合规 | 6 | 云与数据中心网络、零信任、IAM、安全工程、SOC、数据安全、事件响应、合规 | 算力网服务、访问策略、安全基线、检测规则、响应预案、合规证据 | 链路可用性、变更成功率、权限复核完成率、响应时长、漏洞与重大事件 |
6.3 跨团队责任矩阵
A · 最终负责R · 主责执行C · 必须协作I · 知会每项能力只设一个最终负责小组,可有多个执行小组,不设多个最终 Owner。
| 核心能力 | 数据运营 | 应用研发 | 数据管理 | 系统运维 | 资源管理 | 网络安全 |
|---|---|---|---|---|---|---|
| 五大方向产品组合与需求准入 | A/R | C | C | I | I | C |
| 对外市场、解决方案销售与客户成功 | A/R | C | C | I | C | C |
| 数据标准、质量、血缘、授权与发布 | C | R | A/R | C | I | C |
| BioLens、DMP/DM、Skill、MCP 与 API | C | A/R | R | C | I | C |
| DCS Cloud 运行环境与生产 SLO | I | C | I | A/R | C | R |
| 5 EB 存算传容量与单位经济性 | I | C | C | R | A/R | R |
| AIOps、可观测、事件、备份与恢复 | I | C | I | A/R | C | R |
| 身份、网络、数据与智能体安全及合规 | C | R | R | R | I | A/R |
6.4 人员能力分布矩阵
L3 · 架构与牵引L2 · 独立交付L1 · 正确协作矩阵定义小组应达到的能力深度,不要求所有成员成为全栈专家。
| 小组 | 领域理解 | 数据产品治理 | 软件平台 | AI/Skill/MCP | 云/SRE/自动化 | 安全合规 | 商业化 |
|---|---|---|---|---|---|---|---|
| 数据运营与商业化 | L3 | L3 | L1 | L2 | L1 | L2 | L3 |
| 应用研发 | L2 | L2 | L3 | L3 | L2 | L2 | L1 |
| 数据管理 | L2 | L3 | L2 | L2 | L1 | L3 | L1 |
| 系统运维 | L1 | L1 | L2 | L2 | L3 | L2 | L1 |
| 资源管理 | L1 | L2 | L1 | L1 | L2 | L2 | L2 |
| 网络安全 | L1 | L2 | L2 | L2 | L2 | L3 | L1 |
6.5 交叉领域能力要求
人员采用T 型能力标准:每人至少具备一个 L3/L2 主专业、一个不低于 L2 的相邻专业,并达到全链路协作所需的共同基础。目标不是人人精通所有领域,而是确保科研意图、数据语义、软件、AI、基础设施与合规在交接过程中不失真。
| 能力域 | 全员共同底线 | 数据枢纽进阶要求 | 数智基建进阶要求 | 能力验收证据 |
|---|---|---|---|---|
| 生命科学与生物信息 | 理解参与者—样本—实验—文件关系,以及主要组学模态、参考组装、批次、对照和科研/临床边界 | 至少能独立定义一种模态的元数据、QC 与数据产品要求 | 能将测序与分析流程转化为存算传及恢复要求 | 完成一个真实数据集全链路讲解并识别科研与工程失效点 |
| 统计与科研严谨性 | 理解抽样、偏差、混杂、泄漏、训练测试隔离、不确定性与可复现 | 与领域专家设计质量画像、Benchmark 数据集和验收标准 | 理解基础设施故障、重试与非确定性对科研结果的影响 | 用版本化数据、代码、参数和环境复现一个公开或内部基线 |
| 数据工程与治理 | 正确使用标识、Schema、元数据、血缘、版本、校验和、授权范围、留存与 Release 概念 | 设计数据契约、本体、质量规则、Release 及 Skill/API 产品 | 实现生命周期、放置、副本、完整性与数据就近计算控制 | 交付一个从源登记到授权消费全程可追溯的 Release |
| 软件与平台工程 | 掌握 Git、代码评审、测试、问题跟踪、文档、密钥和可复现环境 | 构建版本化 API、工作流、检索、数据服务、契约测试与可观测性 | 使用 IaC、GitOps、配置管理、自动化、SLO 与回滚 | 通过代码评审、自动测试、部署、观测与回滚演练 |
| AI 与智能体工程 | 理解模型局限、事实依据、工具授权、评测、人工复核、成本与隐私风险 | 设计检索、Skill、MCP 工具、智能体工作流、评测集与证据包 | 运营训练推理负载、模型网关、遥测、配额、隔离与 AIOps 控制 | 用固定评测数据演示任务成功、证据追溯、成本计量与失败处置 |
| 云计算、大数据与规模工程 | 理解数据引力、对象/文件存储、分布式计算、队列、带宽、弹性、SLO、RTO/RPO 与单位成本 | 设计云感知数据产品与计算到数据工作流 | 设计并运营云优先混合放置、容量、韧性、FinOps 与跨地域传输 | 完成容量成本测算、负载测试、故障演练与恢复验证 |
| 安全、隐私与合规 | 掌握数据分级、最小权限、用途限制、去标识、审计、事件报告及禁止行为 | 将同意、授权、输出审查和责任人边界嵌入产品 | 实施 IAM、零信任、加密、网络隔离、检测响应、备份恢复控制 | 通过场景化授权、数据导出、事件响应和恢复演练 |
| 产品、服务与经营 | 理解用户、场景、服务 Owner、SLA、验收、成本与反馈闭环 | 将数据与 AI 能力转化为服务目录、解决方案、采用与收入 | 提供透明的容量、可靠性、安全、供应商与单位经济性证据 | 完成一次覆盖价值、质量、风险、成本和迭代决策的服务复盘 |
6.5.1 团队级能力覆盖与单点风险控制
| 覆盖要求 | 数据枢纽团队 · 20 | 数智基建团队 · 20 |
|---|---|---|
| 领域覆盖 | 五大方向均有明确主责;基因组、单细胞、时空组、病理、生物多样性各至少 2 人能够正确协作 | 至少 4 人能将生信工作流转化为存算传需求;每个关键平台均有主备 Owner |
| 工程覆盖 | 至少 6 人能独立交付生产代码或数据管线;至少 2 人可承担 AI、Skill、MCP 与评测工程 | 至少 6 人可独立承担云、SRE、存储、HPC 或容灾工作;至少 2 人可维护 IaC 与自动化框架 |
| 安全合规覆盖 | 至少 2 人可设计数据授权、隐私与发布控制;每名产品 Owner 能定义预期用途与禁止用途 | 至少 4 人可承担安全或韧性事件指挥;IAM、网络、SOC、恢复均有主备覆盖 |
| 商业与服务覆盖 | 市场、销售、客户成功与数据产品 Owner、解决方案工程师组成客户小队;不得脱离技术验证对外承诺 | 容量、成本、SLO、安全与供应商承诺有明确 Owner,在合同或上线前参与方案评审 |
| 连续性 | 关键标准、代码库、数据产品与客户采用主备制,形成交接文档并按季度演练 | 关键服务、凭证、Runbook、供应商和事件指挥均设主备,生产系统不得单人依赖 |
6.5.2 能力建设与上岗门槛
6.6 作战单元与绩效机制
| 评价层级 | 核心指标 | 不作为结果的代理指标 |
|---|---|---|
| 数据枢纽团队 | Release 时效与质量、平台 SLO、能力复用、活跃用户/机构、付费转化、交付验收、客户续约 | 页面数、数据库数、会议数、一次性接口数 |
| 数智基建团队 | 服务 SLO、作业/传输成功率、恢复成功率、安全事件、容量利用率、自动化覆盖率、单位成本 | 设备数量、名义容量、告警数量、人工工单量 |
| 个人 | 责任交付物、质量安全、复用贡献、协作证据、AI 工具带来的可量化改进 | 单独使用 Token 消耗量或模型调用量 |
工程路线图:从基线验证到规模化运营
这是一个采用滚动规划 + 阶段门的多年工程:五年定方向,滚动维护未来 12–18 个月基线,只对下一季度做详细计划。5 EB 是规划上限,不是一次性建设目标;投资根据需求、风险、服务水平、恢复能力和单位经济性分批批准。
7.1 五条工程主线
| 工程主线 | 目标结果 | 主责 |
|---|---|---|
| 数据产品与治理 | 五大方向持续产出版本化、可追溯、可授权、可评测的数据 Release | 数据枢纽 |
| BioLens 能力平台 | DMP、DM、BioLens、Skill、MCP、API 形成统一受控能力链 | 数据枢纽 |
| AI 与智能体服务 | 以受控数据与模型支撑可追溯、可评测、责任明确的智能体服务 | 智能体/模型产品 Owner,数据枢纽供给能力 |
| 云优先 5 EB 基础设施 | 形成弹性、可恢复、安全、成本可观测的存算传服务 | 数智基建 |
| 服务运营与验证 | 每项服务具备 Owner、服务水平、成本模型、验收证据和用户反馈 | 数据运营与商业化、服务 Owner |
7.2 阶段推进与治理
| 阶段 | 核心交付 | 退出条件 |
|---|---|---|
| P0 基线 · 0–3 个月 | 明确范围、架构、台账、产出预测、成本基线、责任人、风险与试点标准 | 范围、预算包络、安全边界、依赖及量化验收标准联合获批 |
| P1 参考实现 · 3–9 个月 | 一个方向完成从受治理 Release 到 BioLens/智能体消费的生产级纵向切片 | 科研、数据、平台、SRE、安全 Owner 联合确认追溯、SLO、恢复、成本及支持就绪 |
| P2 受控复制 · 9–24 个月 | 2–3 个方向复用统一标准和平台组件,容量、成本与服务运营实现可度量 | 至少两类模态通过同一门禁,无重大安全或恢复遗留,接入周期和单位成本下降 |
| P3 规模运营 · 24–60 个月 | 合格方向分批进入服务,容量与智能体服务按已验证需求扩展 | 年度投资具备服务水平、恢复、安全、采用、价值和单位经济性证据 |
7.3 数据枢纽季度发布列车
Y1Q1 指项目基线正式批准后的第一个完整季度。未来四个季度形成承诺发布基线,后续季度作为滚动目标,每半年重新校准。每季度只定义一个组织可识别的标志性发布,内部可包含多个迭代;只有通过适用阶段门,并具备发布说明、验收证据、Owner 和运营支持,才计为正式发布。
| 年度目标 | Q1 | Q2 | Q3 | Q4 |
|---|---|---|---|---|
| Y1 · 建立参考架构 | 项目基线发布 架构、标准核心、RACI、台账与试点标准获批 | DMP / DM v1.0 计划准入、权威路径核验与授权记录生产运行 | Norn Registry v1.0 项目、参与者、样本、实验、文件与 Release 统一身份 | 参考数据产品 v1.0 一个方向完成治理发布、BioLens 消费与证据回流 |
| Y2 · 公共平台可复用 | BioLens Search v1.0 授权发现、检索、引用与来源追溯 | Gigaskill / MCP Gateway v1.0 Skill 登记、契约测试、评测、授权与审计 | 第二模态数据产品 v1.0 差异模态通过同一发布与服务门 | BioLens Platform v2.0 2–3 个方向共享身份、策略、证据与服务运营 |
| Y3 · 形成五方向产品体系 | Snotra Semantics v1.0 本体映射、语义质检与版本差异服务 | 多模态关联服务 v1.0 参与者—样本—实验—文件关联支撑授权联合分析 | 评测与证据中心 v1.0 评测集、泄漏检查、模型/智能体证据与复现记录 | 五方向数据产品目录 v1.0 符合条件的方向发布有 Owner、有版本的数据产品及服务边界 |
| Y4 · 规模化智能体与对外服务 | BioLens Brain v2.0 策略路由、执行闸门、证据编排与失败恢复 | Bragi AI Interface v1.0 面向 Genpilot、Cyto 与授权客户端的稳定评测接口 | 合作服务门户 v1.0 租户接入、授权、计量、SLA、支持与交付证据 | 数据服务组合 v2.0 按采用、质量、风险、收入和单位经济性评审场景服务包 |
| Y5 · 形成生态级数据服务 | 联邦数据接入 v1.0 跨获批外部节点执行策略一致的发现与计算到数据 | 数据资产观测台 v1.0 按 Release 观测质量、使用、血缘、成本、风险与价值 | 跨方向科研数据发布 v1.0 可追溯、获授权的多模态 Release 支撑经验证跨方向问题 | BioLens Major Release v3.0 五年架构、产品、运营、经济性与风险控制通过独立评审 |