From 95573dd66caae68c0b6e4f78d53f96d50f6b77ca Mon Sep 17 00:00:00 2001
From: SCheekati <88806457+SCheekati@users.noreply.github.com>
Date: Sat, 19 Oct 2024 21:07:12 -0400
Subject: [PATCH] Fixed mistake in readme

---
 inference/huggingface/zero_inference/README.md | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/inference/huggingface/zero_inference/README.md b/inference/huggingface/zero_inference/README.md
index f6dd4850e..acca9404e 100644
--- a/inference/huggingface/zero_inference/README.md
+++ b/inference/huggingface/zero_inference/README.md
@@ -90,7 +90,7 @@ deepspeed --num_gpus 1 run_model.py --model bigscience/bloom-7b1 --batch-size 8
 Here is an example of running `meta-llama/Llama-2-7b-hf` with Zero-Inference using 4-bit model weights and offloading kv cache to CPU:
 
 ```sh
-deepspeed --num_gpus 1 run_model.py --model meta-llama/Llama-2-7b-hf` --batch-size 8 --prompt-len 512 --gen-len 32 --cpu-offload --quant-bits 4 --kv-offload
+deepspeed --num_gpus 1 run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 8 --prompt-len 512 --gen-len 32 --cpu-offload --quant-bits 4 --kv-offload
 ```
 
 ## Performance Tuning Tips