算力破局亮相云栖|飞凌嵌入式RK1828四卡级联方案,端侧跑通27B/31B大模型
9 月 22 日至 24 日,2026 云栖大会在杭州国际博览中心举行。瑞芯微电子以"双芯架构,加速端侧 AI 落地"为主题集中展示多卡级联方案等创新成果,飞凌嵌入式作为生态合作伙伴,携
RK3588 + RK1828×4 四卡级联方案亮相瑞芯微展区。
该方案已于 9 月通过飞凌嵌入式官方渠道正式发布,完成 27B/31B 级大语言模型在边缘端的完整跑通。此次亮相云栖大会,是与瑞芯微及生态伙伴同台的一次集中展示,让更多行业客户与开发者能够现场了解方案的成熟度与落地能力。
主控 + 4 卡:重构边缘算力架构
方案以 飞凌嵌入式 OK3588-C 开发板作为主控,通过高速 PCIe 总线连接 4 路 RK1828 AI 加速卡,构建出一套体积紧凑的边缘 AI 推理集群。其中,OK3588-C 承担系统调度、外设管理与上层业务逻辑,RK1828 加速卡专注神经网络推理计算,单卡即可通过 PCIe 为主控补足独立 AI 算力;4 张加速卡协同工作后算力无缝拼接、性能线性提升,让原本依赖服务器级 GPU 的大参数模型,真正落到体积与功耗都受限的边缘设备中。
依托瑞芯微官方 RK182X_AI_SDK_V1.1.0 技术栈,RK1828 算力卡已全面支持多卡 PCIe 级联推理,从底层驱动到上层部署工具链形成完整闭环,开发者无需从头适配即可投入业务验证。客户可根据业务算力需求灵活选型:从 2 卡轻量配置起步,随模型规模与并发需求增长平滑扩展至 4 卡满配,主控平台保持不变,既控制了初期硬件投入,也为后续模型升级预留了充足的扩展空间:
OK3588-C 主控 + 4 路 RK1828 加速卡架构示意
| 级联方案 | 主控平台 | 加速卡配置 | 已适配大语言模型 |
|---|---|---|---|
| 4 卡满配 | OK3588-C 开发板 | RK1828 × 4 | Qwen3.5-27B、Qwen3.8-27B、gemma-4-31B-it |
| 2 卡轻量 | OK3588-C 开发板 | RK1828 × 2 | Qwen3.5-9B、gemma-4-12B-it |
模型适配清单基于 RK182X_AI_SDK_V1.1.0 技术栈实测验证
流水线并行 + 混合量化,多卡高效分工
流水线并行
基于 RKNN3 SDK 完成模型并行切分:在 Transformer 层边界将 LLM 精准拆分为多个片段,每段独立部署在一张 RK1828 加速卡上,多卡接力完成全链路推理,推理负载均衡、协同效率拉满;SDK 原生支持 LoRA 微调与 SpeedUP 推理加速。
混合量化
采用精细化混合量化策略:Transformer 层使用 W4A16/group32 量化,lm_head 层使用 W6A16/group32 量化,final norm 保留 FP16 精度,压缩显存占用的同时最大程度保留模型输出精度。
极致能效
能效比是边缘场景的核心考核指标:单张 RK1828 卡功耗仅约 10W,4 卡满载推理总功耗控制在 40W 左右,无需庞大散热系统,即可在嵌入式设备有限的空间与供电条件下长期稳定运行,以嵌入式级功耗承载百亿参数模型。
三大场景实测:端侧大模型的真实生产力
以 Qwen3.8-27B 大模型为核心,方案完成了三个递进式场景的实测验证,全方位检验 RK1828 四卡级联方案的实战能力。
AI 编程助手
在 RK3588 上使用 rknn-toolkit2 部署 YOLOv8n 并编写完整 Python 异步推理服务,模型一次性生成数百行完整代码框架,上下文连贯、模块清晰。
产品手册 RAG
以《RK182X_AI_SDK用户手册》为本地知识库实现文档智能问答,检索精准定位章节并返回操作步骤与 PDF 页码,所有回答可溯源、可核验。
行业私有知识库
基于《高速铁路信号维护规则》等资料构建本地向量知识库,"精确匹配 + 全文检索 + 向量召回"三路召回,敏感文档全程不离开本地环境。
- 首 Token 延迟 819ms,代码生成速度达 13 tokens/s,交互体验流畅;
- 手册问答首字响应约 1.2 秒,生成速度约 13 tokens/s,达到日常交互可用水平;
- 行业知识库检索 Top-5 命中率超过 90%,答案同步标注资料名称、章节与页码。
数据不出域,私有化部署的新路径
对于工业制造、轨道交通、金融等强监管领域,数据合规、实时响应与长期成本是云端大模型落地的三道坎;而 7B 级小模型又难以胜任复杂推理、代码生成与行业知识库等硬核任务。RK1828 四卡级联方案让 27B/31B 级大模型在边缘端原生运行,为"数据不出域"的私有化大模型部署提供了高性价比路径。
边缘本地运行 27B/31B 大模型,释放复杂推理能力,摆脱对云端算力的依赖
40W 级功耗承载百亿参数模型,私有化部署具备极高性价比优势
支持流水线并行、混合量化、LoRA 微调,适配不同行业定制化需求
覆盖 AI 编程、产品问答、行业知识库三大典型场景,落地能力已验证
未来,飞凌嵌入式将持续深耕 RK1828 生态,陆续推出更多模型适配指南、性能优化方案与行业标杆案例。关于方案的更多技术细节,可查阅往期文章《4卡级联算力破局|RK1828端侧跑通27B/31B大模型》。
相关产品 >
-
FET3588-C核心板
RK3588芯片系列是Rockchip推出的旗舰级工业级产品,采用先进的8nm制程工艺,集成4核Cortex-A76+4核Cortex-A55架构,A76主频高达2.4GHz,A55核主频高达1.8GHz,能够提供强大的性能支撑。飞凌FET3588-C核心板经过了严苛的环境温度测试和压力测试,确保在高端应用中能够稳定运行。您可以通过飞凌提供的rk3588开发套件充分评估和验证其性能。
了解详情
-
RK1820/RK1828 M.2算力卡
飞凌嵌入式RK1820/RK1828 M.2算力卡,20TOPS INT8算力,内置2.5GB/5GB 3D堆叠DRAM,支持3B-7B大模型离线推理,M.2 2280即插即用,适配RK3588/RK3576等平台。立即咨询获取专属方案。 了解详情
