产品组图
产品缩略图

AI 模型全栈矩阵

让AI真正落地,

从硬件适配、系统优化到场景方案,

全程赋能客户智能化升级

覆盖视觉、语音、语言与多模态

持续集成前沿架构

CPU:
架构:
主频:
内存:
ROM:
系统:

  • 概述特点
  • 规格参数
  • 资料下载
  • 订购方式
选型对比选型对比
  • AI 模型清单
    覆盖图像、语音、文本、多模态 — 全栈端侧 AI 模型能力一览
    13
    能力类别
    40+
    可用模型
    5
    模态覆盖
    LLM
    大语言模型
    Large Language Models
    Qwen 系列 — 通义千问开源大语言模型家族
    Qwen2.5-0.5B
    覆盖不同参数规模
    Qwen2.5-3B
    覆盖不同参数规模
    Qwen2.5-7B
    覆盖不同参数规模
    Qwen3-0.6B
    覆盖不同参数规模
    Qwen3-1.7B
    覆盖不同参数规模
    Qwen3-4B
    覆盖不同参数规模
    Qwen3-8B
    覆盖不同参数规模
    Tencent 系列 — 腾讯开发的轻量级对话与语言模型
    HY-MT1.5-1.8B
    适合私有化部署及垂直领域微调
    Youtu-LLM-2B
    适合私有化部署及垂直领域微调
    GLM 系列 — 智谱AI开发的轻量级对话与语言模型
    GLM-Edge-1.5B-Chat
    专为终端设备的离线智能助手设计
    VLM
    视觉语言模型 (VLM)
    Vision-Language Models
    QwenVL 系列 — 通义千问视觉语言模型
    Qwen2.5-VL-3B
    支持图文理解、交互与生成任务
    Qwen2.5-VL-7B
    支持图文理解、交互与生成任务
    Qwen2.5-Omni-3B (Thinker)
    支持图文理解、交互与生成任务
    Qwen3-VL-2B
    支持图文理解、交互与生成任务
    Qwen3-VL-4B
    支持图文理解、交互与生成任务
    InternVL 系列 — 高性能开源视觉语言模型
    InternVL3-2B
    高性能开源视觉语言模型
    InternVL3_5-Driving-4B
    包含面向自动驾驶场景的专用版本
    MiMo 系列 — 小米开源视觉语言模型
    MiMo-VL-7B-RL
    小米开源的一款7B参数视觉语言模型,拥有卓越的GUI理解和基础能力
    HuggingFaceTB 系列 — 轻量级多模态模型
    SmolVLM-500M-Instruct
    由HuggingFace开发的轻量级多模态模型,可用于包含文本查询以及一个或多个图像的多模态任务的推理
    ByteDance 系列 — GUI专用视觉语言模型
    UI-TARS-2B-SFT
    字节跳动推出的GUI专用视觉语言模型
    Alibaba-NLP 系列 — 多模态检索与语义匹配
    gme-Qwen2-VL-2B-Instruct
    阿里NLP团队推出的嵌入模型,专为多模态检索与语义匹配优化,支持图文混合查询
    CLS
    图像分类
    Image Classification
    分类
    MobileNet
    专为移动端和嵌入式设备设计的轻量级网络,适用于资源受限场景下的实时分类任务
    分类
    ResNet
    经典的图像分类骨干网络,兼顾效率与精度
    DET
    物体检测
    Object Detection
    检测
    YOLOv5
    主流的实时物体检测模型
    检测
    YOLOv6
    主流的实时物体检测模型
    检测
    YOLOv7
    主流的实时物体检测模型
    检测
    YOLOv8
    主流的实时物体检测模型
    检测
    YOLOv8-OBB
    YOLOv8的旋转框检测变体,专门针对遥感图像、倾斜文本等需要角度回归的场景
    检测
    YOLOv10
    主流的实时物体检测模型
    检测
    YOLO11
    主流的实时物体检测模型
    检测
    YOLOX
    主流的实时物体检测模型家族,支持检测、分割及旋转框等多种任务变体
    检测
    PPYOLOE
    百度PaddleDetection推出的高效检测模型,在保持高精度的同时显著提升了推理速度,适合端侧部署
    检测
    YOLO-World
    开放词汇物体检测模型,可检测训练时未见过的物体类别
    SEG
    图像分割
    Image Segmentation
    分割
    YOLOv5-Seg
    YOLOv5目标检测基础上增加了像素级分割功能,能同时完成目标定位、分类和轮廓分割
    分割
    YOLOv8-Seg
    YOLOv8目标检测基础上增加了像素级分割功能,能同时完成目标定位、分类和轮廓分割
    分割
    PPSeg
    高效的图像分割模型,分别侧重语义分割与轻量级掩码生成
    分割
    MobileSAM
    专为移动设备和边缘计算优化的轻量化图像分割模型
    POS
    姿态估计
    Pose Estimation
    姿态
    YOLOv8-Pose (Body Pose)
    专注于人体姿态估计的模型,用于识别人体关键点。
    FACE
    人脸关键点
    Face Landmark Detection
    人脸
    RetinaFace
    高精度的人脸检测与关键点定位模型
    LPR
    车牌识别
    License Plate Recognition
    车牌
    LPRNet
    专用于车牌识别的端到端深度学习模型
    OCR
    文本检测与识别
    Text Detection & Recognition
    检测
    PPOCR-Det
    用于文本检测的OCR专用模型
    识别
    PPOCR-Rec
    用于文本识别的OCR专用模型
    CLIP
    图文匹配
    Image-Text Matching
    匹配
    CLIP
    强大的图文跨模态匹配模型,用于理解图像与文本的对应关系
    ASR
    语音识别 (ASR)
    Automatic Speech Recognition
    ASR
    Wav2Vec2
    基于自监督学习的语音表征模型,用于将语音转换为文本
    ASR
    Whisper
    基于Encoder-Decoder架构,具备极强的抗噪能力和多语言转写/翻译能力
    ASR
    Zipformer
    新一代流式/非流式ASR模型,适合实时语音交互与端侧部署
    AUD
    语音分类
    Audio Classification
    音频
    YAMNet
    通用的音频事件分类模型,可识别多种环境声音
    TTS
    文本转语音 (TTS)
    Text-to-Speech
    TTS
    MMS-TTS
    多语言文本转语音(TTS)模型,用于语音合成
  • 咨询立即获得专属报价

    华北区负责人二维码

    华北区负责人

    华东区负责人二维码

    华东区负责人

    华南区负责人二维码

    华南区负责人

    中西区负责人二维码

    中西区负责人