第295篇:算力网络(Computing First Network)概念
关键词
算力网络、Computing First Network、CFN、算力路由、算力感知、算力调度、边缘计算、云边协同、算网融合
一、算力网络的定义与背景
1.1 什么是算力网络
算力网络(Computing First Network, CFN)是网络与计算深度融合的新型信息基础设施:
算力网络核心理念:
传统模式:用户 → 网络 → 特定的服务器(固定 IP) ┌─ 用户访问某个 IP,请求只能到达指定服务器 ├─ 不考虑计算资源状态 └─ 网络只做传输,不感知计算
算力网络模式:用户 → 网络选择最优的算力节点 ┌─ 用户请求"处理一段视频" → 网络找到最合适的节点 ├─ 综合考虑:算力负载、网络带宽、时延、能耗 ├─ 用户不关心具体哪个服务器处理 └─ 网络感知计算状态 + 算力感知路由
| 用户需求: "帮我处理这个视频" ▼ ┌────────────────────────────────────┐ └────────────────────────────────────┘ ▼ 处理结果返回用户 | 算力网络调度 检查各节点算力状态: ┌─ 中心云:CPU 80%, 时延 20ms ├─ 边缘 A:CPU 20%, 时延 3ms ✅ ├─ 边缘 B:CPU 60%, 时延 5ms └─ 选择:边缘 A(最空闲+最近) 路由到边缘 A 处理 | |
|---|---|---|
1.2 算力网络的驱动力
算力网络发展的驱动力:
1. 算力泛在化
┌─ 云、边、端多级算力
├─ 中心云:大规模训练/存储
├─ 边缘云:低时延处理(MEC)
├─ 终端设备:AI 推理(手机/IoT)
└─ 算力碎片化严重
2. 业务需求多样化
┌─ AI 训练:需要 GPU 集群(大算力)
├─ 自动驾驶:< 5ms 时延(边缘算力)
├─ 云游戏:低时延 + 高算力
├─ IoT:海量小任务(分散算力)
└─ 没有单一节点满足所有需求
3. 网络与计算融合
┌─ 算力在哪里,网络怎么路由
├─ 动态选择最优算力节点
├─ 算力状态变化影响路由决策
└─ 网络需要感知计算状态
4. 算力运营化
┌─ 计算资源像水电一样按需使用
├─ 算力交易市场
├─ 算力 SLA(算力质量保障)
└─ 算力计费
二、算力网络架构
2.1 ITU-T / IETF 参考架构
算力网络逻辑架构:
| 算力网络管理层 ┌────────────────────────────────────┐ └────────────────────────────────────┘ | 算力调度平台(Orchestrator) ┌─ 算力资源管理 ├─ 算力发现与注册 ├─ 算力调度策略 ├─ 算力 SLA 管理 └─ 算力计费 | |
|---|---|---|
| 算力网络控制层 ┌───────────────┴────────────────────┐ └───────────────┬────────────────────┘ | Controller(控制器) ┌─ 算力路由计算 ├─ 流量调度策略 ├─ 网络切片 + 算力协同 └─ 北向对接管理层 | |
| 算力网络转发层 ┌───────────────┴────────────────────┐ └────────────────────────────────────┘ | 路由器/交换机(算力感知能力) ┌─ 算力通告(类似路由协议) ├─ 算力选路(基于算力+网络) ├─ 算力按需引流 └─ 随流检测(服务质量) | |
| 算力资源层 ┌───────────────┴──────────────┐ | 中心云 边缘 端侧 算力池 HPC/GPU MEC 终端 异构 |
2.2 华为算力网络方案
华为算力网络方案(Computing First Network):
| 方案组件 ┌─ CFN Controller:算力调度核心 ├─ CFN Router:算力感知路由器 └─ CFN Agent:算力节点代理 ├─ 部署在每台算力服务器 ├─ 采集 CPU/GPU/内存/存储/网络状态 └─ 上报给 CFN Controller | ├─ 算力资源池化管理 ├─ 实时算力状态感知 └─ 智能调度策略(AI 驱动) ├─ 算力通告(通过 BGP/IGP 扩展) ├─ 算力选路(ECMP + 算力权重) ├─ 按时延+算力综合选路 └─ SRv6 算力路径编程 |
|---|---|
三、算力路由关键技术
3.1 算力通告
算力信息通告——使网络感知计算资源状态:
类似路由协议的方式通告算力信息:
| 算力节点 A(GPU 空闲 80%) ▼ ┌────────────────────────────────────┐ └──────────┬─────────────────────────┘ ┌──────┴──────┐ ▼ ▼ 路由器 A 路由器 B 算力路由表: 算力路由表: 节点 A: 80% 节点 A: 80% 节点 B: 50% 节点 B: 50% 节点 C: 30% 节点 C: 30% | 通告:GPU=80%, CPU=60%, MEM=40%, 时延=5ms 算力网络控制器 维护全网算力拓扑 | |
|---|---|---|
| 通告方式: | ||
| ┌─ BGP 扩展:通过 BGP NSR(Network Service Route) | ||
| ├─ IGP 扩展:ISIS/OSPF 扩展 TLVs | ||
| ├─ 控制器分发:控制器算力拓扑下发 | ||
| └─ 更新频率:1-10 秒(避免震荡) |
3.2 算力选路
算力路由算法——选择最优的算力+路径:
综合度量公式: Score = w1 × 1/时延 + w2 × 算力余量 + w3 × 带宽余量 - w4 × 成本
示例:视频处理请求
| 算力节点 | 时延 | GPU余量 | 带宽 | 得分 | ||
|---|---|---|---|---|---|---|
| 边缘 A 边缘 B 中心云 终端 C | 3ms 5ms 20ms 1ms | 80% 50% 90% 10% | 10Gbps 5Gbps 100Gbp - | 95 70 60 40 | ✅ |
选择边缘 A:时延低 + GPU 空闲多
策略类型: ┌─ 时延优先:URLLC 业务(自动驾驶) ├─ 算力优先:AI 训练(需要 GPU 集群) ├─ 成本优先:批处理业务(低成本) ├─ 负载均衡:避免单节点过载 └─ 混合策略:多目标优化
3.3 SRv6 与算力网络
SRv6 是算力网络的理想转发技术:
| SRv6 算力路径编程 用户请求 → 算力控制器 计算最优路径 ┌─ 节点 A(边缘:算力充足) ├─ 节点 B(中间:低时延链路) └─ 节点 C(终端:处理完成) 生成 SRv6 Policy Segment List: 封装到 IPv6 扩展头 ┌────────────────────────────────────┐ └────────────────────────────────────┘ SRv6 优势: ┌─ 灵活编程:任意指定路径 + 算力节点 ├─ 随流检测:内嵌 SFC 能力 ├─ 无状态:中间节点无需维护会话状态 └─ 原生 IPv6:部署方便 | IPv6 头 | SRH (SL=3) | 原始数据 Segment List: [0] = A (算力处理节点) [1] = B (中转) [2] = C (结果返回) | | | --- | --- | --- |
四、算力网络应用场景
4.1 云边协同
场景:AI 推理业务(人脸识别)
架构: | 摄像头(端侧) ▼ 抓拍图片 ┌────────────────────────────────────┐ └────────────────────────────────────┘ ▼ ┌────────────────────────────────────┐ └────────────────────────────────────┘ | 边缘节点(MEC) ┌─ 轻量级 AI 模型(第一轮检测) ├─ 低时延:< 100ms └─ 处理 80% 简单场景 复杂场景转中心云 中心云(GPU 集群) ┌─ 大规模 AI 模型(精细识别) ├─ 高算力:20% 复杂场景 └─ 时延:200-500ms | | | --- | --- | --- | | | | | | 算力网络的作用: | | | | ┌─ 自动判断:简单场景→边缘,复杂→中心云 | | | | ├─ 动态调度:边缘负载高→转中心云 | | | | ├─ 算力协同:边缘预检测 + 中心精细识别 | | | | └─ 按需分配算力资源 | | |
4.2 算力交易市场
算力交易市场场景:
┌──────────────────────────────────────────┐
│ 算力消费者: │
│ ┌─ 短视频公司:需要 GPU 做视频转码 │
│ ├─ AI 初创:训练模型需要 100 块 GPU │
│ └─ 游戏公司:云游戏渲染需要 GPU │
│ │
│ 算力提供者: │
│ ┌─ 运营商:MEC 机房 GPU 节点 │
│ ├─ 云厂商:弹性 GPU 实例 │
│ └─ 企业:闲置算力(共享) │
│ │
│ 算力网络平台: │
│ ┌─ 算力注册、发布、查询 │
│ ├─ 算力 SLA(价格/质量) │
│ ├─ 算力交易匹配 │
│ ├─ 算力路由调度 │
│ ├─ 算力计费结算 │
│ └─ 服务质量保障 │
└──────────────────────────────────────────┘
五、算力网络面临的挑战
算力网络当前挑战:
1. 标准尚未统一
┌─ ITU-T / IETF / CCSA 多组织并行
├─ 算力路由协议尚无标准
├─ 算力信息模型未统一
└─ 跨域互通困难
2. 算力度量标准化
┌─ 异构算力:CPU/GPU/NPU/FPGA 无法统一度量
├─ 什么算"1 单位算力"
├─ 时延敏感性:不同任务对相同算力感受不同
└─ 需要任务感知的算力度量
3. 实时性挑战
┌─ 算力状态变化快(秒级)
├─ 网络状态变化快(毫秒级)
├─ 全局算力同步开销大
└─ 分布式决策 vs 集中式调度平衡
4. 安全与隐私
┌─ 算力状态暴露可能被攻击
├─ 用户数据跨节点流转的安全
├─ 算力节点可信认证
└─ 多租户算力隔离
六、算力网络展望
算力网络演进路径:
┌──────────────────────────────────────────┐
│ 近期(1-2 年):算力路由试点 │
│ ┌─ 基于 SRv6 的算力编程 │
│ ├─ 边缘计算场景 MEC 落地 │
│ ├─ 云边协同业务调度 │
│ └─ 标准逐步完善 │
│ │
│ 中期(3-5 年):算网融合 │
│ ┌─ 算力路由协议标准化 │
│ ├─ 全网算力统一调度 │
│ ├─ 跨运营商/跨厂商算力互通 │
│ ├─ 算力交易市场成型 │
│ └─ AI 驱动的算力调度 │
│ │
│ 远期(5-10 年):算力即服务 │
│ ┌─ 算力随需而用(水电模式) │
│ ├─ 网络 = 算力总线 │
│ ├─ 算力抽象为"1 单位" │
│ └─ 6G 内生算力网络 │
└──────────────────────────────────────────┘
总结
| 关键点 | 说明 |
|---|---|
| 算力网络定义 | 网络感知计算状态,动态选择最优算力节点 |
| 核心驱动力 | 算力泛在化、业务多样化、网算融合 |
| 架构分层 | 管理层 → 控制层 → 转发层 → 资源层 |
| 关键技术 | 算力通告、算力选路、SRv6 编程 |
| 主要场景 | 云边协同、AI 推理、算力交易 |
| 演进方向 | 近期试点 → 中期融合 → 远期算力即服务 |
思考
- 算力网络和传统网络的核心区别是什么?
- 算力信息通告的原理是什么?类似什么协议?
- 算力选路综合考虑哪些因素?如何为不同业务选择算法?
- SRv6 如何支持算力网络的路径编程?
- 算力网络的典型应用场景有哪些?
- 算力网络面临的主要挑战是什么?
下篇预告:第296篇 - 算力感知路由与负载分发,深入算力路由的算法、协议扩展和负载分发策略。