AI | CHEGVA

在模型推理时首先需要存储模型本身的参数，其占用的显存计算公式为：参数量 x 参数精度。常用的参数精度有FP32（4字节）、FP16（2字节）、BF16 （2字节）。对于大语言模型，模型参数通常采用FP16或BF16。因此，以参数精度为FP16，参数量为7B的模型为例，其所需显存为：7B × 2...

nvidia-smi工具详解及使用示例

2026年2月11日 by anzhihe·0评论 · 1,011 人阅读

nvidia-smi（NVIDIA System Management Interface）是NVIDIA官方提供的GPU管理工具，提供管理和监控 GPU 的接口。其核心功能包括NVIDIA GPU运行状况、工作负载、硬件状态诊断和资源调度管理。

核心功能

功能模块具体能力适用场景实时监控显存占用、温度、功耗、时钟频率深度学习训练过程监控进程管理查看/终止占用GPU的进程资源泄漏应急处理计算模式控制切...Continue reading >>

用通俗的方式介绍大语言模型训练过程

2026年1月18日 by anzhihe·0评论 · 1,051 人阅读

站在大语言模型外部看需要准备些什么样的训练数据，分什么阶段，怎样去训练大语言模型，把大语言模型看成一个黑盒。

LLM都是如何训练出来的呢？

GPT的训练分为以下3个阶段：

1、预训练Pretrain

2、监督微调SFT (Supervised Fine-Tuning)

3、基于反馈的强化学习RLHF（包含了Reward Model、PPO (Proximal Policy Optimization)

一、Pr...

vLLM 部署Qwen2.5 LLM & VLM 大模型

2026年1月5日 by anzhihe·0评论 · 1,403 人阅读

Qwen2.5-32B 和 Qwen2.5-VL-32B 是通义千问（Qwen）系列中的两个大模型，分别对应纯语言模型（LLM）和多模态视觉-语言模型（VLM）。Docker环境安装与配置 NVIDIA Container Toolk，下载大模型参考 Docker部署bge-m3/bge-reranker模型。

模型简介

模型名称类型参数量特点Qwen2.5-32B纯文本...Continue reading >>