战略目标:把数据和模型转为持续服务
华大的核心资产是稀缺样本、规模化多组学数据和领域模型。数据基础设施负责把这些资产转为标准化、受控、可复用的数据与模型服务;DCS Cloud、Genpilot 和 Cyto Coscientist 负责面向用户交付。
规模化多模态数据、领域模型、受控智能体服务和公共工程能力。
不以一次性交付、孤立数据文件和脱离专有资产的通用智能体作为主要增长模式。
数据受控、计算到数据、版本可追溯、结果有证据、高风险有人审。
五大方向:统一治理,分模态交付
五大方向规划产出约 5 EB。统一身份、授权、版本、质量和血缘;针对序列、矩阵、空间影像、表型队列和病理病例分别建设数据产品。
| 方向 | 规划量 | 主要数据 | 基础设施重点 | 主要服务 |
|---|---|---|---|---|
| STOC | 0.5 EB | 空间表达矩阵、坐标、组织影像、分割结果 | 坐标体系、切片对齐、影像金字塔、跨物种本体 | 图谱检索、ROI、空间表达、影像切片 |
| HGP2 | 1.5 EB | FASTQ、BAM/CRAM、VCF、表型与队列 | 样本关联、参考版本、变异规范化、隐私计算 | 区间/变异查询、频率统计、队列构建、关联证据 |
| EBP | 1 EB | FASTA、GFF/GTF、转录本、蛋白、标本信息 | 物种身份、组装质量、注释版本、分类学对齐 | 组装与注释目录、序列查询、直系同源、比较基因组 |
| 10BC | 1 EB | 稀疏矩阵、AnnData/Zarr、细胞注释与 QC | 供体—样本—细胞关联、细胞本体、批次与分层抽样 | 细胞图谱、矩阵切片、参考映射、训练批次、扰动分析 |
| 100KPM | 1 EB | WSI、ROI/Mask、DNA/RNA/空间组学、结局 | 病例—标本—蜡块—切片—分子检测对齐 | 病例队列、影像瓦片、跨模态病例、分型与预后研究 |
AI Ready 验收
源数据、协议、仪器、批次和样本来源齐全。
参与者、样本、实验、文件、影像和结果关系稳定。
本体、参考版本、流程和 Release 固定。
同意、用途、许可、跨境和访问策略机器可执行。
完成去重、污染检查、数据切分和独立评测。
形成数据集、查询、计算、API/Skill 和服务指标。
数据枢纽:从源数据到数据服务
数据枢纽统一管理身份、标准、接入、质量、授权、版本和服务。L0–L3 构成数据产品主链;BioLens Brain 是覆盖四层的横向编排与策略控制面,不是主链中的串行节点。
D0–D4 数据产品
| 等级 | 产品内容 | 服务方式 | 关键控制 |
|---|---|---|---|
| D0 受控源 | 原始序列、比对、原生影像、矩阵、表型源表、日志 | 目录、完整性核验、归档、计算到数据 | 不可变清单、Checksum、来源、同意、留存、审计 |
| D1 标准对象 | 标准序列/变异、AnnData/Zarr、影像金字塔、规范表型 | 区间、矩阵、Tile/ROI、Schema 感知访问 | 格式、坐标、Schema、对象关系校验 |
| D2 语义证据 | 实体关系、本体映射、注释证据、QC、队列与索引 | 实体、队列、跨版本、跨模态、聚合查询 | 语义一致、查询权限、隐私与用途限制 |
| D3 训练物化 | 用途绑定快照、特征矩阵、Patch、Token、Split、Shard | 分析批次、训练流、特征服务、受控导出 | 防泄漏、可重建、版本、成本、到期撤销 |
| D4 模型证据 | 预测、Embedding、模型卡、评测、解释、专家复核 | 推理、证据回链、结果追踪、验证报告 | 数据—模型—参数—结果闭环,漂移与用途审查 |
公共服务平面
数据集、实体、版本、质量、授权和可用服务。
文件、区间、矩阵、影像瓦片、ROI 和分页访问。
跨数据集筛选、聚合、关系查询和证据检索。
计算到数据、沙箱工作空间、输出审查和审计。
版本化批次、采样、特征、Benchmark 与复现环境。
模型结果、来源引用、专家复核和验证记录。
智能服务:平台统一,产品分工
All in AI 的重点不是增加通用工具,而是使用华大数据和模型交付可验证、可计量的智能体服务。
| 组件 | 定位 | 主要责任 |
|---|---|---|
| CNGBdb BioLens | 受控数据与能力层 | 数据发现、访问、计算、训练产品、证据和接口 |
| DCS Cloud | 科研与 AI 服务平台 | 身份、工作空间、算力、应用交付、计量和客户运营 |
| Genpilot | 通用科研智能体 | 检索、方案、分析、代码、工作流和报告 |
| Cyto Coscientist | 生命科学专业智能体 | 单细胞/空间组学分析、解释、证据与实验建议 |
| Claude Code / Codex / Kimi | 授权外部工具 | 研发和知识工作提效,不承载未经批准的敏感数据 |
场景与责任边界
| 场景 | 可交付能力 | 必须控制 | 责任人 |
|---|---|---|---|
| 科研 | 检索、分析方案、可复现工作流、证据报告 | 授权、引用、复现、专家复核 | 研究者负责假设与结论 |
| 医学研究 | 队列分析、标志物证据、决策支持信息 | 伦理、预期用途、外部验证、隐私、人工签署 | 专业人员负责判断 |
| 检测诊断 | 仅限经验证和获批的产品功能 | 质量体系、临床验证、监管、监测与召回 | 未经准入不得输出诊断结论 |
| 内部研发 | 代码、知识检索、文档、运维辅助 | 企业身份、数据分级、输出复核和成本控制 | 业务 Owner 对结果负责 |
数智基建:云为主,本地为辅
新增弹性计算、AI 训练推理和协同分析默认上云。本地保留采集近端、受限数据、确定性低时延、持续高利用率或连续性关键负载。所有例外必须记录依据、成本、恢复目标和退出路径。
| 领域 | 建设任务 | 验收指标 |
|---|---|---|
| 存 | 建立热、温、冷、归档层级;按 Release、访问和法规执行生命周期;维护原始、物理、AI Ready、消费四本台账。 | 容量对账率、完整性、恢复成功率、PB 月成本 |
| 算 | DCS Cloud 统一调度云 CPU/GPU;本地集群纳入例外管理;支持数据就近计算、配额和 FinOps。 | 作业成功率、排队时延、GPU 利用率、成功任务成本 |
| 传 | 建设跨区域传输通道、断点续传、校验、带宽调度和审计;大规模迁移先做样板。 | 传输成功率、端到端时延、校验通过率、单位传输成本 |
| 安 | 统一 IAM、最小权限、加密、网络隔离、数据分级、检测响应、备份和灾备。 | 越权事件、审计覆盖、补丁时效、RTO/RPO 演练 |
| 管 | 统一 CMDB、服务目录、资产、容量、成本、供应商 SLA、变更和事件管理。 | 台账准确率、SLO、MTTR、容量预测偏差、成本偏差 |
5 EB 容量原则
5 EB 是逻辑原始数据规划量,不等于一次性物理采购量。容量按数据保留策略、压缩去重、访问热度、副本、恢复、网络与年度产出滚动核算,分批批准。
运维自动化
采集指标、归并告警、生成日报;只读。
根因假设、容量风险、处置建议;人工决策。
执行预批准低风险 Runbook;白名单、验证、回滚。
迁移、删数、网络与权限变更;双人审批、全程审计。
组织能力:40 人双团队配置
数据中心在统一 O3 责权下管理数据枢纽和数智基建两个团队,各 20 人。编制按服务责任分配,不按小组平均分配。
| 团队 | 小组 | 人数 | 岗位构成 | 主要责任 |
|---|---|---|---|---|
| 数据枢纽 20 人 | 数据运营与商业化 | 7 | 负责人 1;产品/领域运营 3;市场 1;销售 1;客户成功 1 | 方向接入、产品组合、市场销售、交付和反馈 |
| 应用研发 | 8 | 架构 1;后端/平台 3;AI/Skill/MCP 2;前端/检索 1;质量发布 1 | GigaNorn、DMP/DM、BioLens、接口、评测和平台可靠性 | |
| 数据管理 | 5 | 负责人 1;标准本体 2;质量血缘 1;授权合规 1 | 身份、标准、本体、质量、血缘、Release 和授权 | |
| 数智基建 20 人 | 系统运维 | 8 | 负责人/SRE 1;云平台/SRE 3;存储/HPC 2;AIOps 1;容灾 1 | DCS Cloud、本地例外区、存算平台、SLO、自动化和恢复 |
| 资源管理 | 6 | 负责人 1;容量工程 2;FinOps 1;CMDB 1;服务/供应商 1 | 5 EB 容量、配额成本、资产、采购、服务目录和 SLA | |
| 网络安全 | 6 | 负责人 1;网络/云网络 2;安全工程运营 2;IAM/合规 1 | 算力网、跨区传输、身份、数据安全、合规和事件响应 |
团队级能力要求
五大方向均有主责;关键领域至少两人可协作;至少四人能把生信工作流转为存算传需求。
数据枢纽至少六人可独立交付生产代码或管线;数智基建至少六人可独立承担云、SRE、存储、HPC 或容灾。
至少两人负责 Skill、MCP、检索与评测工程;所有产品 Owner 掌握模型边界和证据要求。
关键权限、平台、Runbook、客户和供应商均设主备;生产系统不得单人依赖。
市场、销售、客户成功、产品和方案工程组成客户小队,技术验证先于对外承诺。
生产权限以 Release、部署、评测、演练或客户验收等实操证据为准。
工程路线:阶段门与季度发布
五年确定方向,滚动维护 12–18 个月基线,只对下一季度做详细计划。每项发布必须有 Owner、Release Note、验收证据和运营支持。
阶段门
0–3 月明确范围、架构、台账、成本、责任、风险与试点。范围、预算、安全边界和验收标准获批。
3–9 月一个方向完成从受治理 Release 到 BioLens/智能体消费的生产级纵向切片。追溯、SLO、恢复、成本、安全和支持联合验收。
9–24 月2–3 个方向复用统一标准和平台,容量、成本与服务可度量。至少两类模态通过同一门禁,接入周期和单位成本下降。
24–60 月五大方向分批运营,容量与智能体服务按真实需求扩展。年度投资具备服务、恢复、安全、采用、收入和单位经济性证据。
数据枢纽季度发布列车
| 年度 | Q1 | Q2 | Q3 | Q4 |
|---|---|---|---|---|
| Y1 参考架构 | 项目基线 | DMP / DM v1.0 | Norn Registry v1.0 | 首个参考数据产品 |
| Y2 平台复用 | BioLens Search v1.0 | Skill / MCP Gateway v1.0 | 第二模态数据产品 | BioLens Platform v2.0 |
| Y3 五向产品 | 语义服务 v1.0 | 多模态关联 v1.0 | 评测与证据中心 | 五方向产品目录 |
| Y4 对外服务 | BioLens Brain v2.0 | 智能体数据接口 | 合作服务门户 | 数据服务组合 v2.0 |
| Y5 生态运营 | 联邦数据接入 | 数据资产观测台 | 跨方向科研 Release | BioLens v3.0 |