- 概述特点
- 规格参数
- 资料下载
- 订购方式
-
AI 模型清单覆盖图像、语音、文本、多模态 — 全栈端侧 AI 模型能力一览13能力类别40+可用模型5模态覆盖大语言模型Large Language ModelsQwen 系列 — 通义千问开源大语言模型家族Qwen2.5-0.5B覆盖不同参数规模Qwen2.5-3B覆盖不同参数规模Qwen2.5-7B覆盖不同参数规模Qwen3-0.6B覆盖不同参数规模Qwen3-1.7B覆盖不同参数规模Qwen3-4B覆盖不同参数规模Qwen3-8B覆盖不同参数规模Tencent 系列 — 腾讯开发的轻量级对话与语言模型HY-MT1.5-1.8B适合私有化部署及垂直领域微调Youtu-LLM-2B适合私有化部署及垂直领域微调GLM 系列 — 智谱AI开发的轻量级对话与语言模型GLM-Edge-1.5B-Chat专为终端设备的离线智能助手设计视觉语言模型 (VLM)Vision-Language ModelsQwenVL 系列 — 通义千问视觉语言模型Qwen2.5-VL-3B支持图文理解、交互与生成任务Qwen2.5-VL-7B支持图文理解、交互与生成任务Qwen2.5-Omni-3B (Thinker)支持图文理解、交互与生成任务Qwen3-VL-2B支持图文理解、交互与生成任务Qwen3-VL-4B支持图文理解、交互与生成任务InternVL 系列 — 高性能开源视觉语言模型InternVL3-2B高性能开源视觉语言模型InternVL3_5-Driving-4B包含面向自动驾驶场景的专用版本MiMo 系列 — 小米开源视觉语言模型MiMo-VL-7B-RL小米开源的一款7B参数视觉语言模型,拥有卓越的GUI理解和基础能力HuggingFaceTB 系列 — 轻量级多模态模型SmolVLM-500M-Instruct由HuggingFace开发的轻量级多模态模型,可用于包含文本查询以及一个或多个图像的多模态任务的推理ByteDance 系列 — GUI专用视觉语言模型UI-TARS-2B-SFT字节跳动推出的GUI专用视觉语言模型Alibaba-NLP 系列 — 多模态检索与语义匹配gme-Qwen2-VL-2B-Instruct阿里NLP团队推出的嵌入模型,专为多模态检索与语义匹配优化,支持图文混合查询图像分类Image Classification分类ResNet经典的图像分类骨干网络,兼顾效率与精度物体检测Object Detection检测YOLOv5主流的实时物体检测模型检测YOLOv6主流的实时物体检测模型检测YOLOv7主流的实时物体检测模型检测YOLOv8主流的实时物体检测模型检测YOLOv8-OBBYOLOv8的旋转框检测变体,专门针对遥感图像、倾斜文本等需要角度回归的场景检测YOLOv10主流的实时物体检测模型检测YOLO11主流的实时物体检测模型检测YOLOX主流的实时物体检测模型家族,支持检测、分割及旋转框等多种任务变体检测PPYOLOE百度PaddleDetection推出的高效检测模型,在保持高精度的同时显著提升了推理速度,适合端侧部署检测YOLO-World开放词汇物体检测模型,可检测训练时未见过的物体类别图像分割Image Segmentation分割YOLOv5-SegYOLOv5目标检测基础上增加了像素级分割功能,能同时完成目标定位、分类和轮廓分割分割YOLOv8-SegYOLOv8目标检测基础上增加了像素级分割功能,能同时完成目标定位、分类和轮廓分割分割PPSeg高效的图像分割模型,分别侧重语义分割与轻量级掩码生成姿态估计Pose Estimation姿态YOLOv8-Pose (Body Pose)专注于人体姿态估计的模型,用于识别人体关键点。人脸关键点Face Landmark Detection人脸RetinaFace高精度的人脸检测与关键点定位模型车牌识别License Plate Recognition车牌LPRNet专用于车牌识别的端到端深度学习模型文本检测与识别Text Detection & Recognition检测PPOCR-Det用于文本检测的OCR专用模型识别PPOCR-Rec用于文本识别的OCR专用模型图文匹配Image-Text Matching匹配CLIP强大的图文跨模态匹配模型,用于理解图像与文本的对应关系语音识别 (ASR)Automatic Speech RecognitionASRWav2Vec2基于自监督学习的语音表征模型,用于将语音转换为文本ASRWhisper基于Encoder-Decoder架构,具备极强的抗噪能力和多语言转写/翻译能力ASRZipformer新一代流式/非流式ASR模型,适合实时语音交互与端侧部署语音分类Audio Classification音频YAMNet通用的音频事件分类模型,可识别多种环境声音文本转语音 (TTS)Text-to-SpeechTTSMMS-TTS多语言文本转语音(TTS)模型,用于语音合成
-
-
-


