diff --git a/gguf-converter/.gitignore b/gguf-converter/.gitignore new file mode 100644 index 0000000..9d001c1 --- /dev/null +++ b/gguf-converter/.gitignore @@ -0,0 +1,2 @@ +params.json +.venv diff --git a/gguf-converter/Dockerfile b/gguf-converter/Dockerfile new file mode 100644 index 0000000..77eafdd --- /dev/null +++ b/gguf-converter/Dockerfile @@ -0,0 +1,34 @@ +ARG BASE_IMAGE=substratusai/base:latest +FROM nvidia/cuda:12.2.0-devel-ubuntu22.04 as build + +RUN --mount=type=cache,target=/var/cache/apt --mount=type=cache,target=/var/lib/apt \ + apt-get update && \ + apt-get -y --no-install-recommends install \ + python3 python3-pip python3-venv git build-essential gcc wget && \ + mkdir -p /etc/OpenCL/vendors && echo "libnvidia-opencl.so.1" > /etc/OpenCL/vendors/nvidia.icd && \ + rm -rf /var/lib/apt/lists/* + +RUN mkdir /build +WORKDIR /build +RUN git clone https://github.com/ggerganov/llama.cpp.git +RUN cd llama.cpp && make quantize + +FROM ${BASE_IMAGE} + +RUN mkdir -p /content/src /content/data /content/bin +WORKDIR /content + +COPY requirements.txt . +RUN pip install --no-cache-dir -r requirements.txt +RUN git clone https://github.com/ggerganov/llama.cpp.git +RUN pip install --no-cache-dir -r llama.cpp/requirements.txt +COPY --from=build /build/llama.cpp/quantize /content/bin + +ENV PATH="$PATH:/content/scripts:/content/bin" + +# Copy in build dependencies only since the build will take a while. +COPY ./scripts/ ./scripts +COPY ./src/ ./src + +ENTRYPOINT ["/tini", "--", "/content/scripts/entrypoint.sh"] +CMD convert.sh diff --git a/gguf-converter/README.md b/gguf-converter/README.md new file mode 100644 index 0000000..1138970 --- /dev/null +++ b/gguf-converter/README.md @@ -0,0 +1,24 @@ +# Dataset Loader HTTP + +Load existing files into Substratus by downloading using HTTP + +## Usage + +Build the image locally: + +```sh +docker build -t gguf-converter . +``` + +Explore and develop with a Jupyter Lab: +```sh +# create test params.json +cat > params.json <, path_model=PosixPath('/content/downloaded-model'))\n", + "Loading vocab file '/content/downloaded-model/tokenizer.model', type 'spm'\n", + "Permuting layer 0\n", + "Permuting layer 1\n", + "Permuting layer 2\n", + "Permuting layer 3\n", + "Permuting layer 4\n", + "Permuting layer 5\n", + "Permuting layer 6\n", + "Permuting layer 7\n", + "Permuting layer 8\n", + "Permuting layer 9\n", + "Permuting layer 10\n", + "Permuting layer 11\n", + "Permuting layer 12\n", + "Permuting layer 13\n", + "Permuting layer 14\n", + "Permuting layer 15\n", + "Permuting layer 16\n", + "Permuting layer 17\n", + "Permuting layer 18\n", + "Permuting layer 19\n", + "Permuting layer 20\n", + "Permuting layer 21\n", + "Permuting layer 22\n", + "Permuting layer 23\n", + "Permuting layer 24\n", + "Permuting layer 25\n", + "Permuting layer 26\n", + "Permuting layer 27\n", + "Permuting layer 28\n", + "Permuting layer 29\n", + "Permuting layer 30\n", + "Permuting layer 31\n", + "model.embed_tokens.weight -> token_embd.weight | F16 | [32000, 4096]\n", + "model.layers.0.self_attn.q_proj.weight -> blk.0.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.0.self_attn.k_proj.weight -> blk.0.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.0.self_attn.v_proj.weight -> blk.0.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.0.self_attn.o_proj.weight -> blk.0.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.0.mlp.gate_proj.weight -> blk.0.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.0.mlp.up_proj.weight -> blk.0.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.0.mlp.down_proj.weight -> blk.0.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.0.input_layernorm.weight -> blk.0.attn_norm.weight | F16 | [4096]\n", + "model.layers.0.post_attention_layernorm.weight -> blk.0.ffn_norm.weight | F16 | [4096]\n", + "model.layers.1.self_attn.q_proj.weight -> blk.1.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.1.self_attn.k_proj.weight -> blk.1.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.1.self_attn.v_proj.weight -> blk.1.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.1.self_attn.o_proj.weight -> blk.1.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.1.mlp.gate_proj.weight -> blk.1.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.1.mlp.up_proj.weight -> blk.1.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.1.mlp.down_proj.weight -> blk.1.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.1.input_layernorm.weight -> blk.1.attn_norm.weight | F16 | [4096]\n", + "model.layers.1.post_attention_layernorm.weight -> blk.1.ffn_norm.weight | F16 | [4096]\n", + "model.layers.2.self_attn.q_proj.weight -> blk.2.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.2.self_attn.k_proj.weight -> blk.2.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.2.self_attn.v_proj.weight -> blk.2.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.2.self_attn.o_proj.weight -> blk.2.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.2.mlp.gate_proj.weight -> blk.2.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.2.mlp.up_proj.weight -> blk.2.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.2.mlp.down_proj.weight -> blk.2.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.2.input_layernorm.weight -> blk.2.attn_norm.weight | F16 | [4096]\n", + "model.layers.2.post_attention_layernorm.weight -> blk.2.ffn_norm.weight | F16 | [4096]\n", + "model.layers.3.self_attn.q_proj.weight -> blk.3.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.3.self_attn.k_proj.weight -> blk.3.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.3.self_attn.v_proj.weight -> blk.3.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.3.self_attn.o_proj.weight -> blk.3.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.3.mlp.gate_proj.weight -> blk.3.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.3.mlp.up_proj.weight -> blk.3.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.3.mlp.down_proj.weight -> blk.3.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.3.input_layernorm.weight -> blk.3.attn_norm.weight | F16 | [4096]\n", + "model.layers.3.post_attention_layernorm.weight -> blk.3.ffn_norm.weight | F16 | [4096]\n", + "model.layers.4.self_attn.q_proj.weight -> blk.4.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.4.self_attn.k_proj.weight -> blk.4.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.4.self_attn.v_proj.weight -> blk.4.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.4.self_attn.o_proj.weight -> blk.4.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.4.mlp.gate_proj.weight -> blk.4.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.4.mlp.up_proj.weight -> blk.4.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.4.mlp.down_proj.weight -> blk.4.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.4.input_layernorm.weight -> blk.4.attn_norm.weight | F16 | [4096]\n", + "model.layers.4.post_attention_layernorm.weight -> blk.4.ffn_norm.weight | F16 | [4096]\n", + "model.layers.5.self_attn.q_proj.weight -> blk.5.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.5.self_attn.k_proj.weight -> blk.5.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.5.self_attn.v_proj.weight -> blk.5.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.5.self_attn.o_proj.weight -> blk.5.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.5.mlp.gate_proj.weight -> blk.5.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.5.mlp.up_proj.weight -> blk.5.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.5.mlp.down_proj.weight -> blk.5.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.5.input_layernorm.weight -> blk.5.attn_norm.weight | F16 | [4096]\n", + "model.layers.5.post_attention_layernorm.weight -> blk.5.ffn_norm.weight | F16 | [4096]\n", + "model.layers.6.self_attn.q_proj.weight -> blk.6.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.6.self_attn.k_proj.weight -> blk.6.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.6.self_attn.v_proj.weight -> blk.6.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.6.self_attn.o_proj.weight -> blk.6.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.6.mlp.gate_proj.weight -> blk.6.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.6.mlp.up_proj.weight -> blk.6.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.6.mlp.down_proj.weight -> blk.6.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.6.input_layernorm.weight -> blk.6.attn_norm.weight | F16 | [4096]\n", + "model.layers.6.post_attention_layernorm.weight -> blk.6.ffn_norm.weight | F16 | [4096]\n", + "model.layers.7.self_attn.q_proj.weight -> blk.7.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.7.self_attn.k_proj.weight -> blk.7.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.7.self_attn.v_proj.weight -> blk.7.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.7.self_attn.o_proj.weight -> blk.7.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.7.mlp.gate_proj.weight -> blk.7.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.7.mlp.up_proj.weight -> blk.7.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.7.mlp.down_proj.weight -> blk.7.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.7.input_layernorm.weight -> blk.7.attn_norm.weight | F16 | [4096]\n", + "model.layers.7.post_attention_layernorm.weight -> blk.7.ffn_norm.weight | F16 | [4096]\n", + "model.layers.8.self_attn.q_proj.weight -> blk.8.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.8.self_attn.k_proj.weight -> blk.8.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.8.self_attn.v_proj.weight -> blk.8.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.8.self_attn.o_proj.weight -> blk.8.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.8.mlp.gate_proj.weight -> blk.8.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.8.mlp.up_proj.weight -> blk.8.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.8.mlp.down_proj.weight -> blk.8.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.8.input_layernorm.weight -> blk.8.attn_norm.weight | F16 | [4096]\n", + "model.layers.8.post_attention_layernorm.weight -> blk.8.ffn_norm.weight | F16 | [4096]\n", + "model.layers.9.self_attn.q_proj.weight -> blk.9.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.9.self_attn.k_proj.weight -> blk.9.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.9.self_attn.v_proj.weight -> blk.9.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.9.self_attn.o_proj.weight -> blk.9.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.9.mlp.gate_proj.weight -> blk.9.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.9.mlp.up_proj.weight -> blk.9.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.9.mlp.down_proj.weight -> blk.9.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.9.input_layernorm.weight -> blk.9.attn_norm.weight | F16 | [4096]\n", + "model.layers.9.post_attention_layernorm.weight -> blk.9.ffn_norm.weight | F16 | [4096]\n", + "model.layers.10.self_attn.q_proj.weight -> blk.10.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.10.self_attn.k_proj.weight -> blk.10.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.10.self_attn.v_proj.weight -> blk.10.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.10.self_attn.o_proj.weight -> blk.10.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.10.mlp.gate_proj.weight -> blk.10.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.10.mlp.up_proj.weight -> blk.10.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.10.mlp.down_proj.weight -> blk.10.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.10.input_layernorm.weight -> blk.10.attn_norm.weight | F16 | [4096]\n", + "model.layers.10.post_attention_layernorm.weight -> blk.10.ffn_norm.weight | F16 | [4096]\n", + "model.layers.11.self_attn.q_proj.weight -> blk.11.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.11.self_attn.k_proj.weight -> blk.11.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.11.self_attn.v_proj.weight -> blk.11.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.11.self_attn.o_proj.weight -> blk.11.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.11.mlp.gate_proj.weight -> blk.11.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.11.mlp.up_proj.weight -> blk.11.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.11.mlp.down_proj.weight -> blk.11.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.11.input_layernorm.weight -> blk.11.attn_norm.weight | F16 | [4096]\n", + "model.layers.11.post_attention_layernorm.weight -> blk.11.ffn_norm.weight | F16 | [4096]\n", + "model.layers.12.self_attn.q_proj.weight -> blk.12.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.12.self_attn.k_proj.weight -> blk.12.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.12.self_attn.v_proj.weight -> blk.12.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.12.self_attn.o_proj.weight -> blk.12.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.12.mlp.gate_proj.weight -> blk.12.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.12.mlp.up_proj.weight -> blk.12.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.12.mlp.down_proj.weight -> blk.12.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.12.input_layernorm.weight -> blk.12.attn_norm.weight | F16 | [4096]\n", + "model.layers.12.post_attention_layernorm.weight -> blk.12.ffn_norm.weight | F16 | [4096]\n", + "model.layers.13.self_attn.q_proj.weight -> blk.13.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.13.self_attn.k_proj.weight -> blk.13.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.13.self_attn.v_proj.weight -> blk.13.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.13.self_attn.o_proj.weight -> blk.13.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.13.mlp.gate_proj.weight -> blk.13.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.13.mlp.up_proj.weight -> blk.13.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.13.mlp.down_proj.weight -> blk.13.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.13.input_layernorm.weight -> blk.13.attn_norm.weight | F16 | [4096]\n", + "model.layers.13.post_attention_layernorm.weight -> blk.13.ffn_norm.weight | F16 | [4096]\n", + "model.layers.14.self_attn.q_proj.weight -> blk.14.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.14.self_attn.k_proj.weight -> blk.14.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.14.self_attn.v_proj.weight -> blk.14.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.14.self_attn.o_proj.weight -> blk.14.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.14.mlp.gate_proj.weight -> blk.14.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.14.mlp.up_proj.weight -> blk.14.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.14.mlp.down_proj.weight -> blk.14.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.14.input_layernorm.weight -> blk.14.attn_norm.weight | F16 | [4096]\n", + "model.layers.14.post_attention_layernorm.weight -> blk.14.ffn_norm.weight | F16 | [4096]\n", + "model.layers.15.self_attn.q_proj.weight -> blk.15.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.15.self_attn.k_proj.weight -> blk.15.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.15.self_attn.v_proj.weight -> blk.15.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.15.self_attn.o_proj.weight -> blk.15.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.15.mlp.gate_proj.weight -> blk.15.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.15.mlp.up_proj.weight -> blk.15.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.15.mlp.down_proj.weight -> blk.15.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.15.input_layernorm.weight -> blk.15.attn_norm.weight | F16 | [4096]\n", + "model.layers.15.post_attention_layernorm.weight -> blk.15.ffn_norm.weight | F16 | [4096]\n", + "model.layers.16.self_attn.q_proj.weight -> blk.16.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.16.self_attn.k_proj.weight -> blk.16.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.16.self_attn.v_proj.weight -> blk.16.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.16.self_attn.o_proj.weight -> blk.16.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.16.mlp.gate_proj.weight -> blk.16.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.16.mlp.up_proj.weight -> blk.16.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.16.mlp.down_proj.weight -> blk.16.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.16.input_layernorm.weight -> blk.16.attn_norm.weight | F16 | [4096]\n", + "model.layers.16.post_attention_layernorm.weight -> blk.16.ffn_norm.weight | F16 | [4096]\n", + "model.layers.17.self_attn.q_proj.weight -> blk.17.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.17.self_attn.k_proj.weight -> blk.17.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.17.self_attn.v_proj.weight -> blk.17.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.17.self_attn.o_proj.weight -> blk.17.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.17.mlp.gate_proj.weight -> blk.17.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.17.mlp.up_proj.weight -> blk.17.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.17.mlp.down_proj.weight -> blk.17.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.17.input_layernorm.weight -> blk.17.attn_norm.weight | F16 | [4096]\n", + "model.layers.17.post_attention_layernorm.weight -> blk.17.ffn_norm.weight | F16 | [4096]\n", + "model.layers.18.self_attn.q_proj.weight -> blk.18.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.18.self_attn.k_proj.weight -> blk.18.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.18.self_attn.v_proj.weight -> blk.18.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.18.self_attn.o_proj.weight -> blk.18.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.18.mlp.gate_proj.weight -> blk.18.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.18.mlp.up_proj.weight -> blk.18.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.18.mlp.down_proj.weight -> blk.18.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.18.input_layernorm.weight -> blk.18.attn_norm.weight | F16 | [4096]\n", + "model.layers.18.post_attention_layernorm.weight -> blk.18.ffn_norm.weight | F16 | [4096]\n", + "model.layers.19.self_attn.q_proj.weight -> blk.19.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.19.self_attn.k_proj.weight -> blk.19.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.19.self_attn.v_proj.weight -> blk.19.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.19.self_attn.o_proj.weight -> blk.19.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.19.mlp.gate_proj.weight -> blk.19.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.19.mlp.up_proj.weight -> blk.19.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.19.mlp.down_proj.weight -> blk.19.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.19.input_layernorm.weight -> blk.19.attn_norm.weight | F16 | [4096]\n", + "model.layers.19.post_attention_layernorm.weight -> blk.19.ffn_norm.weight | F16 | [4096]\n", + "model.layers.20.self_attn.q_proj.weight -> blk.20.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.20.self_attn.k_proj.weight -> blk.20.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.20.self_attn.v_proj.weight -> blk.20.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.20.self_attn.o_proj.weight -> blk.20.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.20.mlp.gate_proj.weight -> blk.20.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.20.mlp.up_proj.weight -> blk.20.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.20.mlp.down_proj.weight -> blk.20.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.20.input_layernorm.weight -> blk.20.attn_norm.weight | F16 | [4096]\n", + "model.layers.20.post_attention_layernorm.weight -> blk.20.ffn_norm.weight | F16 | [4096]\n", + "model.layers.21.self_attn.q_proj.weight -> blk.21.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.21.self_attn.k_proj.weight -> blk.21.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.21.self_attn.v_proj.weight -> blk.21.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.21.self_attn.o_proj.weight -> blk.21.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.21.mlp.gate_proj.weight -> blk.21.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.21.mlp.up_proj.weight -> blk.21.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.21.mlp.down_proj.weight -> blk.21.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.21.input_layernorm.weight -> blk.21.attn_norm.weight | F16 | [4096]\n", + "model.layers.21.post_attention_layernorm.weight -> blk.21.ffn_norm.weight | F16 | [4096]\n", + "model.layers.22.self_attn.q_proj.weight -> blk.22.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.22.self_attn.k_proj.weight -> blk.22.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.22.self_attn.v_proj.weight -> blk.22.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.22.self_attn.o_proj.weight -> blk.22.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.22.mlp.gate_proj.weight -> blk.22.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.22.mlp.up_proj.weight -> blk.22.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.22.mlp.down_proj.weight -> blk.22.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.22.input_layernorm.weight -> blk.22.attn_norm.weight | F16 | [4096]\n", + "model.layers.22.post_attention_layernorm.weight -> blk.22.ffn_norm.weight | F16 | [4096]\n", + "model.layers.23.self_attn.q_proj.weight -> blk.23.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.23.self_attn.k_proj.weight -> blk.23.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.23.self_attn.v_proj.weight -> blk.23.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.23.self_attn.o_proj.weight -> blk.23.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.23.mlp.gate_proj.weight -> blk.23.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.23.mlp.up_proj.weight -> blk.23.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.23.mlp.down_proj.weight -> blk.23.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.23.input_layernorm.weight -> blk.23.attn_norm.weight | F16 | [4096]\n", + "model.layers.23.post_attention_layernorm.weight -> blk.23.ffn_norm.weight | F16 | [4096]\n", + "model.layers.24.self_attn.q_proj.weight -> blk.24.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.24.self_attn.k_proj.weight -> blk.24.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.24.self_attn.v_proj.weight -> blk.24.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.24.self_attn.o_proj.weight -> blk.24.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.24.mlp.gate_proj.weight -> blk.24.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.24.mlp.up_proj.weight -> blk.24.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.24.mlp.down_proj.weight -> blk.24.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.24.input_layernorm.weight -> blk.24.attn_norm.weight | F16 | [4096]\n", + "model.layers.24.post_attention_layernorm.weight -> blk.24.ffn_norm.weight | F16 | [4096]\n", + "model.layers.25.self_attn.q_proj.weight -> blk.25.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.25.self_attn.k_proj.weight -> blk.25.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.25.self_attn.v_proj.weight -> blk.25.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.25.self_attn.o_proj.weight -> blk.25.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.25.mlp.gate_proj.weight -> blk.25.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.25.mlp.up_proj.weight -> blk.25.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.25.mlp.down_proj.weight -> blk.25.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.25.input_layernorm.weight -> blk.25.attn_norm.weight | F16 | [4096]\n", + "model.layers.25.post_attention_layernorm.weight -> blk.25.ffn_norm.weight | F16 | [4096]\n", + "model.layers.26.self_attn.q_proj.weight -> blk.26.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.26.self_attn.k_proj.weight -> blk.26.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.26.self_attn.v_proj.weight -> blk.26.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.26.self_attn.o_proj.weight -> blk.26.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.26.mlp.gate_proj.weight -> blk.26.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.26.mlp.up_proj.weight -> blk.26.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.26.mlp.down_proj.weight -> blk.26.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.26.input_layernorm.weight -> blk.26.attn_norm.weight | F16 | [4096]\n", + "model.layers.26.post_attention_layernorm.weight -> blk.26.ffn_norm.weight | F16 | [4096]\n", + "model.layers.27.self_attn.q_proj.weight -> blk.27.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.27.self_attn.k_proj.weight -> blk.27.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.27.self_attn.v_proj.weight -> blk.27.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.27.self_attn.o_proj.weight -> blk.27.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.27.mlp.gate_proj.weight -> blk.27.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.27.mlp.up_proj.weight -> blk.27.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.27.mlp.down_proj.weight -> blk.27.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.27.input_layernorm.weight -> blk.27.attn_norm.weight | F16 | [4096]\n", + "model.layers.27.post_attention_layernorm.weight -> blk.27.ffn_norm.weight | F16 | [4096]\n", + "model.layers.28.self_attn.q_proj.weight -> blk.28.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.28.self_attn.k_proj.weight -> blk.28.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.28.self_attn.v_proj.weight -> blk.28.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.28.self_attn.o_proj.weight -> blk.28.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.28.mlp.gate_proj.weight -> blk.28.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.28.mlp.up_proj.weight -> blk.28.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.28.mlp.down_proj.weight -> blk.28.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.28.input_layernorm.weight -> blk.28.attn_norm.weight | F16 | [4096]\n", + "model.layers.28.post_attention_layernorm.weight -> blk.28.ffn_norm.weight | F16 | [4096]\n", + "model.layers.29.self_attn.q_proj.weight -> blk.29.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.29.self_attn.k_proj.weight -> blk.29.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.29.self_attn.v_proj.weight -> blk.29.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.29.self_attn.o_proj.weight -> blk.29.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.29.mlp.gate_proj.weight -> blk.29.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.29.mlp.up_proj.weight -> blk.29.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.29.mlp.down_proj.weight -> blk.29.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.29.input_layernorm.weight -> blk.29.attn_norm.weight | F16 | [4096]\n", + "model.layers.29.post_attention_layernorm.weight -> blk.29.ffn_norm.weight | F16 | [4096]\n", + "model.layers.30.self_attn.q_proj.weight -> blk.30.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.30.self_attn.k_proj.weight -> blk.30.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.30.self_attn.v_proj.weight -> blk.30.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.30.self_attn.o_proj.weight -> blk.30.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.30.mlp.gate_proj.weight -> blk.30.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.30.mlp.up_proj.weight -> blk.30.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.30.mlp.down_proj.weight -> blk.30.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.30.input_layernorm.weight -> blk.30.attn_norm.weight | F16 | [4096]\n", + "model.layers.30.post_attention_layernorm.weight -> blk.30.ffn_norm.weight | F16 | [4096]\n", + "model.layers.31.self_attn.q_proj.weight -> blk.31.attn_q.weight | F16 | [4096, 4096]\n", + "model.layers.31.self_attn.k_proj.weight -> blk.31.attn_k.weight | F16 | [4096, 4096]\n", + "model.layers.31.self_attn.v_proj.weight -> blk.31.attn_v.weight | F16 | [4096, 4096]\n", + "model.layers.31.self_attn.o_proj.weight -> blk.31.attn_output.weight | F16 | [4096, 4096]\n", + "model.layers.31.mlp.gate_proj.weight -> blk.31.ffn_gate.weight | F16 | [11008, 4096]\n", + "model.layers.31.mlp.up_proj.weight -> blk.31.ffn_up.weight | F16 | [11008, 4096]\n", + "model.layers.31.mlp.down_proj.weight -> blk.31.ffn_down.weight | F16 | [4096, 11008]\n", + "model.layers.31.input_layernorm.weight -> blk.31.attn_norm.weight | F16 | [4096]\n", + "model.layers.31.post_attention_layernorm.weight -> blk.31.ffn_norm.weight | F16 | [4096]\n", + "model.norm.weight -> output_norm.weight | F16 | [4096]\n", + "lm_head.weight -> output.weight | F16 | [32000, 4096]\n", + "Writing /content/model/weaviate-gorilla-random-split-f16.gguf, format 1\n", + "gguf: Setting special token type bos to 1\n", + "gguf: Setting special token type eos to 2\n", + "gguf: Setting special token type unk to 0\n", + "[ 1/291] Writing tensor token_embd.weight | size 32000 x 4096 | type F16 | T+ 0\n", + "[ 2/291] Writing tensor blk.0.attn_q.weight | size 4096 x 4096 | type F16 | T+ 0\n", + "[ 3/291] Writing tensor blk.0.attn_k.weight | size 4096 x 4096 | type F16 | T+ 0\n", + "[ 4/291] Writing tensor blk.0.attn_v.weight | size 4096 x 4096 | type F16 | T+ 0\n", + "[ 5/291] Writing tensor blk.0.attn_output.weight | size 4096 x 4096 | type F16 | T+ 0\n", + "[ 6/291] Writing tensor blk.0.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 0\n", + "[ 7/291] Writing tensor blk.0.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 8/291] Writing tensor blk.0.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 1\n", + "[ 9/291] Writing tensor blk.0.attn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 10/291] Writing tensor blk.0.ffn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 11/291] Writing tensor blk.1.attn_q.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 12/291] Writing tensor blk.1.attn_k.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 13/291] Writing tensor blk.1.attn_v.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 14/291] Writing tensor blk.1.attn_output.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 15/291] Writing tensor blk.1.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 16/291] Writing tensor blk.1.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 17/291] Writing tensor blk.1.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 1\n", + "[ 18/291] Writing tensor blk.1.attn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 19/291] Writing tensor blk.1.ffn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 20/291] Writing tensor blk.2.attn_q.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 21/291] Writing tensor blk.2.attn_k.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 22/291] Writing tensor blk.2.attn_v.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 23/291] Writing tensor blk.2.attn_output.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 24/291] Writing tensor blk.2.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 25/291] Writing tensor blk.2.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 26/291] Writing tensor blk.2.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 1\n", + "[ 27/291] Writing tensor blk.2.attn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 28/291] Writing tensor blk.2.ffn_norm.weight | size 4096 | type F32 | T+ 1\n", + "[ 29/291] Writing tensor blk.3.attn_q.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 30/291] Writing tensor blk.3.attn_k.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 31/291] Writing tensor blk.3.attn_v.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 32/291] Writing tensor blk.3.attn_output.weight | size 4096 x 4096 | type F16 | T+ 1\n", + "[ 33/291] Writing tensor blk.3.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 34/291] Writing tensor blk.3.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 1\n", + "[ 35/291] Writing tensor blk.3.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 2\n", + "[ 36/291] Writing tensor blk.3.attn_norm.weight | size 4096 | type F32 | T+ 2\n", + "[ 37/291] Writing tensor blk.3.ffn_norm.weight | size 4096 | type F32 | T+ 2\n", + "[ 38/291] Writing tensor blk.4.attn_q.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 39/291] Writing tensor blk.4.attn_k.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 40/291] Writing tensor blk.4.attn_v.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 41/291] Writing tensor blk.4.attn_output.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 42/291] Writing tensor blk.4.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 2\n", + "[ 43/291] Writing tensor blk.4.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 2\n", + "[ 44/291] Writing tensor blk.4.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 2\n", + "[ 45/291] Writing tensor blk.4.attn_norm.weight | size 4096 | type F32 | T+ 2\n", + "[ 46/291] Writing tensor blk.4.ffn_norm.weight | size 4096 | type F32 | T+ 2\n", + "[ 47/291] Writing tensor blk.5.attn_q.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 48/291] Writing tensor blk.5.attn_k.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 49/291] Writing tensor blk.5.attn_v.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 50/291] Writing tensor blk.5.attn_output.weight | size 4096 x 4096 | type F16 | T+ 2\n", + "[ 51/291] Writing tensor blk.5.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 2\n", + "[ 52/291] Writing tensor blk.5.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 2\n", + "[ 53/291] Writing tensor blk.5.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 3\n", + "[ 54/291] Writing tensor blk.5.attn_norm.weight | size 4096 | type F32 | T+ 3\n", + "[ 55/291] Writing tensor blk.5.ffn_norm.weight | size 4096 | type F32 | T+ 3\n", + "[ 56/291] Writing tensor blk.6.attn_q.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 57/291] Writing tensor blk.6.attn_k.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 58/291] Writing tensor blk.6.attn_v.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 59/291] Writing tensor blk.6.attn_output.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 60/291] Writing tensor blk.6.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 3\n", + "[ 61/291] Writing tensor blk.6.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 3\n", + "[ 62/291] Writing tensor blk.6.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 3\n", + "[ 63/291] Writing tensor blk.6.attn_norm.weight | size 4096 | type F32 | T+ 3\n", + "[ 64/291] Writing tensor blk.6.ffn_norm.weight | size 4096 | type F32 | T+ 3\n", + "[ 65/291] Writing tensor blk.7.attn_q.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 66/291] Writing tensor blk.7.attn_k.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 67/291] Writing tensor blk.7.attn_v.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 68/291] Writing tensor blk.7.attn_output.weight | size 4096 x 4096 | type F16 | T+ 3\n", + "[ 69/291] Writing tensor blk.7.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 3\n", + "[ 70/291] Writing tensor blk.7.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 3\n", + "[ 71/291] Writing tensor blk.7.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 4\n", + "[ 72/291] Writing tensor blk.7.attn_norm.weight | size 4096 | type F32 | T+ 4\n", + "[ 73/291] Writing tensor blk.7.ffn_norm.weight | size 4096 | type F32 | T+ 4\n", + "[ 74/291] Writing tensor blk.8.attn_q.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 75/291] Writing tensor blk.8.attn_k.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 76/291] Writing tensor blk.8.attn_v.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 77/291] Writing tensor blk.8.attn_output.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 78/291] Writing tensor blk.8.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 4\n", + "[ 79/291] Writing tensor blk.8.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 4\n", + "[ 80/291] Writing tensor blk.8.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 4\n", + "[ 81/291] Writing tensor blk.8.attn_norm.weight | size 4096 | type F32 | T+ 4\n", + "[ 82/291] Writing tensor blk.8.ffn_norm.weight | size 4096 | type F32 | T+ 4\n", + "[ 83/291] Writing tensor blk.9.attn_q.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 84/291] Writing tensor blk.9.attn_k.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 85/291] Writing tensor blk.9.attn_v.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 86/291] Writing tensor blk.9.attn_output.weight | size 4096 x 4096 | type F16 | T+ 4\n", + "[ 87/291] Writing tensor blk.9.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 4\n", + "[ 88/291] Writing tensor blk.9.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 4\n", + "[ 89/291] Writing tensor blk.9.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 4\n", + "[ 90/291] Writing tensor blk.9.attn_norm.weight | size 4096 | type F32 | T+ 5\n", + "[ 91/291] Writing tensor blk.9.ffn_norm.weight | size 4096 | type F32 | T+ 5\n", + "[ 92/291] Writing tensor blk.10.attn_q.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[ 93/291] Writing tensor blk.10.attn_k.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[ 94/291] Writing tensor blk.10.attn_v.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[ 95/291] Writing tensor blk.10.attn_output.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[ 96/291] Writing tensor blk.10.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 5\n", + "[ 97/291] Writing tensor blk.10.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 5\n", + "[ 98/291] Writing tensor blk.10.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 5\n", + "[ 99/291] Writing tensor blk.10.attn_norm.weight | size 4096 | type F32 | T+ 5\n", + "[100/291] Writing tensor blk.10.ffn_norm.weight | size 4096 | type F32 | T+ 5\n", + "[101/291] Writing tensor blk.11.attn_q.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[102/291] Writing tensor blk.11.attn_k.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[103/291] Writing tensor blk.11.attn_v.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[104/291] Writing tensor blk.11.attn_output.weight | size 4096 x 4096 | type F16 | T+ 5\n", + "[105/291] Writing tensor blk.11.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 5\n", + "[106/291] Writing tensor blk.11.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 5\n", + "[107/291] Writing tensor blk.11.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 6\n", + "[108/291] Writing tensor blk.11.attn_norm.weight | size 4096 | type F32 | T+ 6\n", + "[109/291] Writing tensor blk.11.ffn_norm.weight | size 4096 | type F32 | T+ 6\n", + "[110/291] Writing tensor blk.12.attn_q.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[111/291] Writing tensor blk.12.attn_k.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[112/291] Writing tensor blk.12.attn_v.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[113/291] Writing tensor blk.12.attn_output.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[114/291] Writing tensor blk.12.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 6\n", + "[115/291] Writing tensor blk.12.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 6\n", + "[116/291] Writing tensor blk.12.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 6\n", + "[117/291] Writing tensor blk.12.attn_norm.weight | size 4096 | type F32 | T+ 6\n", + "[118/291] Writing tensor blk.12.ffn_norm.weight | size 4096 | type F32 | T+ 6\n", + "[119/291] Writing tensor blk.13.attn_q.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[120/291] Writing tensor blk.13.attn_k.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[121/291] Writing tensor blk.13.attn_v.weight | size 4096 x 4096 | type F16 | T+ 6\n", + "[122/291] Writing tensor blk.13.attn_output.weight | size 4096 x 4096 | type F16 | T+ 7\n", + "[123/291] Writing tensor blk.13.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 7\n", + "[124/291] Writing tensor blk.13.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 7\n", + "[125/291] Writing tensor blk.13.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 7\n", + "[126/291] Writing tensor blk.13.attn_norm.weight | size 4096 | type F32 | T+ 7\n", + "[127/291] Writing tensor blk.13.ffn_norm.weight | size 4096 | type F32 | T+ 7\n", + "[128/291] Writing tensor blk.14.attn_q.weight | size 4096 x 4096 | type F16 | T+ 7\n", + "[129/291] Writing tensor blk.14.attn_k.weight | size 4096 x 4096 | type F16 | T+ 7\n", + "[130/291] Writing tensor blk.14.attn_v.weight | size 4096 x 4096 | type F16 | T+ 7\n", + "[131/291] Writing tensor blk.14.attn_output.weight | size 4096 x 4096 | type F16 | T+ 7\n", + "[132/291] Writing tensor blk.14.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 7\n", + "[133/291] Writing tensor blk.14.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 8\n", + "[134/291] Writing tensor blk.14.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 8\n", + "[135/291] Writing tensor blk.14.attn_norm.weight | size 4096 | type F32 | T+ 8\n", + "[136/291] Writing tensor blk.14.ffn_norm.weight | size 4096 | type F32 | T+ 8\n", + "[137/291] Writing tensor blk.15.attn_q.weight | size 4096 x 4096 | type F16 | T+ 8\n", + "[138/291] Writing tensor blk.15.attn_k.weight | size 4096 x 4096 | type F16 | T+ 8\n", + "[139/291] Writing tensor blk.15.attn_v.weight | size 4096 x 4096 | type F16 | T+ 8\n", + "[140/291] Writing tensor blk.15.attn_output.weight | size 4096 x 4096 | type F16 | T+ 8\n", + "[141/291] Writing tensor blk.15.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 8\n", + "[142/291] Writing tensor blk.15.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 8\n", + "[143/291] Writing tensor blk.15.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 9\n", + "[144/291] Writing tensor blk.15.attn_norm.weight | size 4096 | type F32 | T+ 9\n", + "[145/291] Writing tensor blk.15.ffn_norm.weight | size 4096 | type F32 | T+ 9\n", + "[146/291] Writing tensor blk.16.attn_q.weight | size 4096 x 4096 | type F16 | T+ 9\n", + "[147/291] Writing tensor blk.16.attn_k.weight | size 4096 x 4096 | type F16 | T+ 9\n", + "[148/291] Writing tensor blk.16.attn_v.weight | size 4096 x 4096 | type F16 | T+ 9\n", + "[149/291] Writing tensor blk.16.attn_output.weight | size 4096 x 4096 | type F16 | T+ 9\n", + "[150/291] Writing tensor blk.16.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 9\n", + "[151/291] Writing tensor blk.16.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 9\n", + "[152/291] Writing tensor blk.16.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 9\n", + "[153/291] Writing tensor blk.16.attn_norm.weight | size 4096 | type F32 | T+ 10\n", + "[154/291] Writing tensor blk.16.ffn_norm.weight | size 4096 | type F32 | T+ 10\n", + "[155/291] Writing tensor blk.17.attn_q.weight | size 4096 x 4096 | type F16 | T+ 10\n", + "[156/291] Writing tensor blk.17.attn_k.weight | size 4096 x 4096 | type F16 | T+ 10\n", + "[157/291] Writing tensor blk.17.attn_v.weight | size 4096 x 4096 | type F16 | T+ 10\n", + "[158/291] Writing tensor blk.17.attn_output.weight | size 4096 x 4096 | type F16 | T+ 10\n", + "[159/291] Writing tensor blk.17.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 10\n", + "[160/291] Writing tensor blk.17.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 11\n", + "[161/291] Writing tensor blk.17.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 11\n", + "[162/291] Writing tensor blk.17.attn_norm.weight | size 4096 | type F32 | T+ 11\n", + "[163/291] Writing tensor blk.17.ffn_norm.weight | size 4096 | type F32 | T+ 11\n", + "[164/291] Writing tensor blk.18.attn_q.weight | size 4096 x 4096 | type F16 | T+ 11\n", + "[165/291] Writing tensor blk.18.attn_k.weight | size 4096 x 4096 | type F16 | T+ 11\n", + "[166/291] Writing tensor blk.18.attn_v.weight | size 4096 x 4096 | type F16 | T+ 11\n", + "[167/291] Writing tensor blk.18.attn_output.weight | size 4096 x 4096 | type F16 | T+ 11\n", + "[168/291] Writing tensor blk.18.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 11\n", + "[169/291] Writing tensor blk.18.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 11\n", + "[170/291] Writing tensor blk.18.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 11\n", + "[171/291] Writing tensor blk.18.attn_norm.weight | size 4096 | type F32 | T+ 12\n", + "[172/291] Writing tensor blk.18.ffn_norm.weight | size 4096 | type F32 | T+ 12\n", + "[173/291] Writing tensor blk.19.attn_q.weight | size 4096 x 4096 | type F16 | T+ 12\n", + "[174/291] Writing tensor blk.19.attn_k.weight | size 4096 x 4096 | type F16 | T+ 12\n", + "[175/291] Writing tensor blk.19.attn_v.weight | size 4096 x 4096 | type F16 | T+ 12\n", + "[176/291] Writing tensor blk.19.attn_output.weight | size 4096 x 4096 | type F16 | T+ 12\n", + "[177/291] Writing tensor blk.19.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 12\n", + "[178/291] Writing tensor blk.19.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 12\n", + "[179/291] Writing tensor blk.19.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 12\n", + "[180/291] Writing tensor blk.19.attn_norm.weight | size 4096 | type F32 | T+ 13\n", + "[181/291] Writing tensor blk.19.ffn_norm.weight | size 4096 | type F32 | T+ 13\n", + "[182/291] Writing tensor blk.20.attn_q.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[183/291] Writing tensor blk.20.attn_k.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[184/291] Writing tensor blk.20.attn_v.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[185/291] Writing tensor blk.20.attn_output.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[186/291] Writing tensor blk.20.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 13\n", + "[187/291] Writing tensor blk.20.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 13\n", + "[188/291] Writing tensor blk.20.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 13\n", + "[189/291] Writing tensor blk.20.attn_norm.weight | size 4096 | type F32 | T+ 13\n", + "[190/291] Writing tensor blk.20.ffn_norm.weight | size 4096 | type F32 | T+ 13\n", + "[191/291] Writing tensor blk.21.attn_q.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[192/291] Writing tensor blk.21.attn_k.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[193/291] Writing tensor blk.21.attn_v.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[194/291] Writing tensor blk.21.attn_output.weight | size 4096 x 4096 | type F16 | T+ 13\n", + "[195/291] Writing tensor blk.21.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 13\n", + "[196/291] Writing tensor blk.21.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 14\n", + "[197/291] Writing tensor blk.21.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 14\n", + "[198/291] Writing tensor blk.21.attn_norm.weight | size 4096 | type F32 | T+ 14\n", + "[199/291] Writing tensor blk.21.ffn_norm.weight | size 4096 | type F32 | T+ 14\n", + "[200/291] Writing tensor blk.22.attn_q.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[201/291] Writing tensor blk.22.attn_k.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[202/291] Writing tensor blk.22.attn_v.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[203/291] Writing tensor blk.22.attn_output.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[204/291] Writing tensor blk.22.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 14\n", + "[205/291] Writing tensor blk.22.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 14\n", + "[206/291] Writing tensor blk.22.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 14\n", + "[207/291] Writing tensor blk.22.attn_norm.weight | size 4096 | type F32 | T+ 14\n", + "[208/291] Writing tensor blk.22.ffn_norm.weight | size 4096 | type F32 | T+ 14\n", + "[209/291] Writing tensor blk.23.attn_q.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[210/291] Writing tensor blk.23.attn_k.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[211/291] Writing tensor blk.23.attn_v.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[212/291] Writing tensor blk.23.attn_output.weight | size 4096 x 4096 | type F16 | T+ 14\n", + "[213/291] Writing tensor blk.23.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 15\n", + "[214/291] Writing tensor blk.23.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 15\n", + "[215/291] Writing tensor blk.23.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 15\n", + "[216/291] Writing tensor blk.23.attn_norm.weight | size 4096 | type F32 | T+ 15\n", + "[217/291] Writing tensor blk.23.ffn_norm.weight | size 4096 | type F32 | T+ 15\n", + "[218/291] Writing tensor blk.24.attn_q.weight | size 4096 x 4096 | type F16 | T+ 15\n", + "[219/291] Writing tensor blk.24.attn_k.weight | size 4096 x 4096 | type F16 | T+ 15\n", + "[220/291] Writing tensor blk.24.attn_v.weight | size 4096 x 4096 | type F16 | T+ 15\n", + "[221/291] Writing tensor blk.24.attn_output.weight | size 4096 x 4096 | type F16 | T+ 15\n", + "[222/291] Writing tensor blk.24.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 16\n", + "[223/291] Writing tensor blk.24.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 16\n", + "[224/291] Writing tensor blk.24.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 16\n", + "[225/291] Writing tensor blk.24.attn_norm.weight | size 4096 | type F32 | T+ 16\n", + "[226/291] Writing tensor blk.24.ffn_norm.weight | size 4096 | type F32 | T+ 16\n", + "[227/291] Writing tensor blk.25.attn_q.weight | size 4096 x 4096 | type F16 | T+ 16\n", + "[228/291] Writing tensor blk.25.attn_k.weight | size 4096 x 4096 | type F16 | T+ 16\n", + "[229/291] Writing tensor blk.25.attn_v.weight | size 4096 x 4096 | type F16 | T+ 16\n", + "[230/291] Writing tensor blk.25.attn_output.weight | size 4096 x 4096 | type F16 | T+ 16\n", + "[231/291] Writing tensor blk.25.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 16\n", + "[232/291] Writing tensor blk.25.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 16\n", + "[233/291] Writing tensor blk.25.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 16\n", + "[234/291] Writing tensor blk.25.attn_norm.weight | size 4096 | type F32 | T+ 16\n", + "[235/291] Writing tensor blk.25.ffn_norm.weight | size 4096 | type F32 | T+ 16\n", + "[236/291] Writing tensor blk.26.attn_q.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[237/291] Writing tensor blk.26.attn_k.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[238/291] Writing tensor blk.26.attn_v.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[239/291] Writing tensor blk.26.attn_output.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[240/291] Writing tensor blk.26.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 17\n", + "[241/291] Writing tensor blk.26.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 17\n", + "[242/291] Writing tensor blk.26.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 17\n", + "[243/291] Writing tensor blk.26.attn_norm.weight | size 4096 | type F32 | T+ 17\n", + "[244/291] Writing tensor blk.26.ffn_norm.weight | size 4096 | type F32 | T+ 17\n", + "[245/291] Writing tensor blk.27.attn_q.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[246/291] Writing tensor blk.27.attn_k.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[247/291] Writing tensor blk.27.attn_v.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[248/291] Writing tensor blk.27.attn_output.weight | size 4096 x 4096 | type F16 | T+ 17\n", + "[249/291] Writing tensor blk.27.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 17\n", + "[250/291] Writing tensor blk.27.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 18\n", + "[251/291] Writing tensor blk.27.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 18\n", + "[252/291] Writing tensor blk.27.attn_norm.weight | size 4096 | type F32 | T+ 18\n", + "[253/291] Writing tensor blk.27.ffn_norm.weight | size 4096 | type F32 | T+ 18\n", + "[254/291] Writing tensor blk.28.attn_q.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[255/291] Writing tensor blk.28.attn_k.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[256/291] Writing tensor blk.28.attn_v.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[257/291] Writing tensor blk.28.attn_output.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[258/291] Writing tensor blk.28.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 18\n", + "[259/291] Writing tensor blk.28.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 18\n", + "[260/291] Writing tensor blk.28.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 18\n", + "[261/291] Writing tensor blk.28.attn_norm.weight | size 4096 | type F32 | T+ 18\n", + "[262/291] Writing tensor blk.28.ffn_norm.weight | size 4096 | type F32 | T+ 18\n", + "[263/291] Writing tensor blk.29.attn_q.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[264/291] Writing tensor blk.29.attn_k.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[265/291] Writing tensor blk.29.attn_v.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[266/291] Writing tensor blk.29.attn_output.weight | size 4096 x 4096 | type F16 | T+ 18\n", + "[267/291] Writing tensor blk.29.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 19\n", + "[268/291] Writing tensor blk.29.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 19\n", + "[269/291] Writing tensor blk.29.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 19\n", + "[270/291] Writing tensor blk.29.attn_norm.weight | size 4096 | type F32 | T+ 19\n", + "[271/291] Writing tensor blk.29.ffn_norm.weight | size 4096 | type F32 | T+ 19\n", + "[272/291] Writing tensor blk.30.attn_q.weight | size 4096 x 4096 | type F16 | T+ 19\n", + "[273/291] Writing tensor blk.30.attn_k.weight | size 4096 x 4096 | type F16 | T+ 19\n", + "[274/291] Writing tensor blk.30.attn_v.weight | size 4096 x 4096 | type F16 | T+ 19\n", + "[275/291] Writing tensor blk.30.attn_output.weight | size 4096 x 4096 | type F16 | T+ 19\n", + "[276/291] Writing tensor blk.30.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 19\n", + "[277/291] Writing tensor blk.30.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 19\n", + "[278/291] Writing tensor blk.30.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 19\n", + "[279/291] Writing tensor blk.30.attn_norm.weight | size 4096 | type F32 | T+ 20\n", + "[280/291] Writing tensor blk.30.ffn_norm.weight | size 4096 | type F32 | T+ 20\n", + "[281/291] Writing tensor blk.31.attn_q.weight | size 4096 x 4096 | type F16 | T+ 20\n", + "[282/291] Writing tensor blk.31.attn_k.weight | size 4096 x 4096 | type F16 | T+ 20\n", + "[283/291] Writing tensor blk.31.attn_v.weight | size 4096 x 4096 | type F16 | T+ 20\n", + "[284/291] Writing tensor blk.31.attn_output.weight | size 4096 x 4096 | type F16 | T+ 20\n", + "[285/291] Writing tensor blk.31.ffn_gate.weight | size 11008 x 4096 | type F16 | T+ 20\n", + "[286/291] Writing tensor blk.31.ffn_up.weight | size 11008 x 4096 | type F16 | T+ 20\n", + "[287/291] Writing tensor blk.31.ffn_down.weight | size 4096 x 11008 | type F16 | T+ 20\n", + "[288/291] Writing tensor blk.31.attn_norm.weight | size 4096 | type F32 | T+ 20\n", + "[289/291] Writing tensor blk.31.ffn_norm.weight | size 4096 | type F32 | T+ 20\n", + "[290/291] Writing tensor output_norm.weight | size 4096 | type F32 | T+ 20\n", + "[291/291] Writing tensor output.weight | size 32000 x 4096 | type F16 | T+ 21\n", + "Wrote /content/model/weaviate-gorilla-random-split-f16.gguf\n", + "total 13G\n", + "4.0K drwxr-xr-x 2 root root 4.0K Sep 4 03:43 .\n", + "8.0K drwxr-xr-x 1 root root 4.0K Sep 4 03:43 ..\n", + " 13G -rw-r--r-- 1 root root 13G Sep 4 03:43 weaviate-gorilla-random-split-f16.gguf\n" + ] + } + ], + "source": [ + "import os\n", + "# have to use this hack otherwise the python3 command won't work\n", + "os.environ[\"MODEL_PATH\"] = model_path\n", + "outfile = f\"{output_path}/{name}-f16.gguf\"\n", + "os.environ[\"OUTFILE\"] = outfile\n", + "\n", + "! mkdir -p {output_path}\n", + "! ls -lash {model_path}\n", + "! python3 /content/llama.cpp/convert.py \\\n", + " --outfile $OUTFILE \\\n", + " --outtype f16 $MODEL_PATH\n", + "\n", + "! ls -lash {output_path}" + ] + }, + { + "cell_type": "markdown", + "id": "f3ef3201-3508-4042-afae-a4a252b1f263", + "metadata": {}, + "source": [ + "Upload the model if param `push_to_hub` was set" + ] + }, + { + "cell_type": "code", + "execution_count": 5, + "id": "5acda74c-56bb-462d-bc8d-a616a615eaea", + "metadata": {}, + "outputs": [ + { + "name": "stdout", + "output_type": "stream", + "text": [ + "Creating HuggingFace repo substratusai/weaviate-gorilla-v4-random-split-gguf\n" + ] + } + ], + "source": [ + "from huggingface_hub import HfApi\n", + "from pathlib import Path\n", + "\n", + "push_to_hub = params.get(\"push_to_hub\")\n", + "if push_to_hub:\n", + " hf_api = HfApi()\n", + " model_id = push_to_hub\n", + " print(f\"Creating HuggingFace repo {model_id}\")\n", + " hf_api.create_repo(model_id, exist_ok=True, repo_type=\"model\")\n", + "\n", + "def push_to_huggingface(file):\n", + " hf_api.upload_file(\n", + " path_or_fileobj=file,\n", + " path_in_repo=Path(file).name,\n", + " repo_id=model_id,\n", + " )" + ] + }, + { + "cell_type": "code", + "execution_count": 6, + "id": "515857d2-0d49-4091-9d08-01ecc94dbdba", + "metadata": {}, + "outputs": [ + { + "data": { + "application/vnd.jupyter.widget-view+json": { + "model_id": "d4f1ada0d1864a028f3f79532ef3a77b", + "version_major": 2, + "version_minor": 0 + }, + "text/plain": [ + "weaviate-gorilla-random-split-f16.gguf: 0%| | 0.00/13.5G [00:00 70.31 MB | hist: \n", + "[ 2/ 291] blk.0.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 3/ 291] blk.0.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 4/ 291] blk.0.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 5/ 291] blk.0.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 6/ 291] blk.0.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 7/ 291] blk.0.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 8/ 291] blk.0.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 9/ 291] blk.0.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 10/ 291] blk.0.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 11/ 291] blk.1.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 12/ 291] blk.1.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 13/ 291] blk.1.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 14/ 291] blk.1.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 15/ 291] blk.1.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 16/ 291] blk.1.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 17/ 291] blk.1.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 18/ 291] blk.1.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 19/ 291] blk.1.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 20/ 291] blk.2.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 21/ 291] blk.2.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 22/ 291] blk.2.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 23/ 291] blk.2.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 24/ 291] blk.2.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 25/ 291] blk.2.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 26/ 291] blk.2.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 27/ 291] blk.2.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 28/ 291] blk.2.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 29/ 291] blk.3.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 30/ 291] blk.3.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 31/ 291] blk.3.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 32/ 291] blk.3.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 33/ 291] blk.3.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 34/ 291] blk.3.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 35/ 291] blk.3.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 36/ 291] blk.3.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 37/ 291] blk.3.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 38/ 291] blk.4.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 39/ 291] blk.4.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 40/ 291] blk.4.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 41/ 291] blk.4.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 42/ 291] blk.4.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 43/ 291] blk.4.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 44/ 291] blk.4.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 45/ 291] blk.4.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 46/ 291] blk.4.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 47/ 291] blk.5.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 48/ 291] blk.5.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 49/ 291] blk.5.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 50/ 291] blk.5.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 51/ 291] blk.5.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 52/ 291] blk.5.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 53/ 291] blk.5.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 54/ 291] blk.5.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 55/ 291] blk.5.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 56/ 291] blk.6.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 57/ 291] blk.6.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 58/ 291] blk.6.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 59/ 291] blk.6.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 60/ 291] blk.6.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 61/ 291] blk.6.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 62/ 291] blk.6.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 63/ 291] blk.6.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 64/ 291] blk.6.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 65/ 291] blk.7.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 66/ 291] blk.7.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 67/ 291] blk.7.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 68/ 291] blk.7.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 69/ 291] blk.7.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 70/ 291] blk.7.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 71/ 291] blk.7.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 72/ 291] blk.7.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 73/ 291] blk.7.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 74/ 291] blk.8.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 75/ 291] blk.8.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 76/ 291] blk.8.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 77/ 291] blk.8.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 78/ 291] blk.8.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 79/ 291] blk.8.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 80/ 291] blk.8.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 81/ 291] blk.8.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 82/ 291] blk.8.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 83/ 291] blk.9.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 84/ 291] blk.9.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 85/ 291] blk.9.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 86/ 291] blk.9.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 87/ 291] blk.9.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 88/ 291] blk.9.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 89/ 291] blk.9.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 90/ 291] blk.9.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 91/ 291] blk.9.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 92/ 291] blk.10.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 93/ 291] blk.10.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 94/ 291] blk.10.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 95/ 291] blk.10.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 96/ 291] blk.10.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 97/ 291] blk.10.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 98/ 291] blk.10.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 99/ 291] blk.10.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 100/ 291] blk.10.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 101/ 291] blk.11.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 102/ 291] blk.11.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 103/ 291] blk.11.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 104/ 291] blk.11.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 105/ 291] blk.11.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 106/ 291] blk.11.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 107/ 291] blk.11.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 108/ 291] blk.11.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 109/ 291] blk.11.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 110/ 291] blk.12.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 111/ 291] blk.12.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 112/ 291] blk.12.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 113/ 291] blk.12.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 114/ 291] blk.12.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 115/ 291] blk.12.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 116/ 291] blk.12.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 117/ 291] blk.12.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 118/ 291] blk.12.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 119/ 291] blk.13.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 120/ 291] blk.13.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 121/ 291] blk.13.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 122/ 291] blk.13.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 123/ 291] blk.13.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 124/ 291] blk.13.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 125/ 291] blk.13.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 126/ 291] blk.13.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 127/ 291] blk.13.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 128/ 291] blk.14.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 129/ 291] blk.14.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 130/ 291] blk.14.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 131/ 291] blk.14.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 132/ 291] blk.14.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 133/ 291] blk.14.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 134/ 291] blk.14.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 135/ 291] blk.14.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 136/ 291] blk.14.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 137/ 291] blk.15.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 138/ 291] blk.15.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 139/ 291] blk.15.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 140/ 291] blk.15.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 141/ 291] blk.15.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 142/ 291] blk.15.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 143/ 291] blk.15.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 144/ 291] blk.15.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 145/ 291] blk.15.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 146/ 291] blk.16.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 147/ 291] blk.16.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 148/ 291] blk.16.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 149/ 291] blk.16.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 150/ 291] blk.16.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 151/ 291] blk.16.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 152/ 291] blk.16.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 153/ 291] blk.16.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 154/ 291] blk.16.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 155/ 291] blk.17.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 156/ 291] blk.17.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 157/ 291] blk.17.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 158/ 291] blk.17.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 159/ 291] blk.17.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 160/ 291] blk.17.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 161/ 291] blk.17.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 162/ 291] blk.17.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 163/ 291] blk.17.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 164/ 291] blk.18.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 165/ 291] blk.18.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 166/ 291] blk.18.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 167/ 291] blk.18.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 168/ 291] blk.18.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 169/ 291] blk.18.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 170/ 291] blk.18.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 171/ 291] blk.18.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 172/ 291] blk.18.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 173/ 291] blk.19.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 174/ 291] blk.19.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 175/ 291] blk.19.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 176/ 291] blk.19.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 177/ 291] blk.19.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 178/ 291] blk.19.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 179/ 291] blk.19.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 180/ 291] blk.19.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 181/ 291] blk.19.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 182/ 291] blk.20.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 183/ 291] blk.20.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 184/ 291] blk.20.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 185/ 291] blk.20.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 186/ 291] blk.20.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 187/ 291] blk.20.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 188/ 291] blk.20.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 189/ 291] blk.20.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 190/ 291] blk.20.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 191/ 291] blk.21.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 192/ 291] blk.21.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 193/ 291] blk.21.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 194/ 291] blk.21.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 195/ 291] blk.21.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 196/ 291] blk.21.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 197/ 291] blk.21.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 198/ 291] blk.21.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 199/ 291] blk.21.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 200/ 291] blk.22.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 201/ 291] blk.22.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 202/ 291] blk.22.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 203/ 291] blk.22.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 204/ 291] blk.22.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 205/ 291] blk.22.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 206/ 291] blk.22.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 207/ 291] blk.22.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 208/ 291] blk.22.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 209/ 291] blk.23.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 210/ 291] blk.23.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 211/ 291] blk.23.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 212/ 291] blk.23.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 213/ 291] blk.23.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 214/ 291] blk.23.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 215/ 291] blk.23.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 216/ 291] blk.23.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 217/ 291] blk.23.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 218/ 291] blk.24.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 219/ 291] blk.24.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 220/ 291] blk.24.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 221/ 291] blk.24.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 222/ 291] blk.24.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 223/ 291] blk.24.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 224/ 291] blk.24.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 225/ 291] blk.24.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 226/ 291] blk.24.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 227/ 291] blk.25.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 228/ 291] blk.25.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 229/ 291] blk.25.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 230/ 291] blk.25.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 231/ 291] blk.25.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 232/ 291] blk.25.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 233/ 291] blk.25.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 234/ 291] blk.25.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 235/ 291] blk.25.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 236/ 291] blk.26.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 237/ 291] blk.26.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 238/ 291] blk.26.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 239/ 291] blk.26.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 240/ 291] blk.26.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 241/ 291] blk.26.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 242/ 291] blk.26.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 243/ 291] blk.26.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 244/ 291] blk.26.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 245/ 291] blk.27.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 246/ 291] blk.27.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 247/ 291] blk.27.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 248/ 291] blk.27.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 249/ 291] blk.27.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 250/ 291] blk.27.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 251/ 291] blk.27.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 252/ 291] blk.27.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 253/ 291] blk.27.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 254/ 291] blk.28.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 255/ 291] blk.28.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 256/ 291] blk.28.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 257/ 291] blk.28.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 258/ 291] blk.28.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 259/ 291] blk.28.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 260/ 291] blk.28.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 261/ 291] blk.28.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 262/ 291] blk.28.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 263/ 291] blk.29.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 264/ 291] blk.29.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 265/ 291] blk.29.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 266/ 291] blk.29.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 267/ 291] blk.29.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 268/ 291] blk.29.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 269/ 291] blk.29.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 270/ 291] blk.29.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 271/ 291] blk.29.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 272/ 291] blk.30.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 273/ 291] blk.30.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 274/ 291] blk.30.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 275/ 291] blk.30.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 276/ 291] blk.30.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 277/ 291] blk.30.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 278/ 291] blk.30.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 279/ 291] blk.30.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 280/ 291] blk.30.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 281/ 291] blk.31.attn_q.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 282/ 291] blk.31.attn_k.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 283/ 291] blk.31.attn_v.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 32.00 MB -> 13.12 MB | hist: \n", + "[ 284/ 291] blk.31.attn_output.weight - [ 4096, 4096, 1, 1], type = f16, quantizing to q4_K .. size = 32.00 MB -> 9.00 MB | hist: \n", + "[ 285/ 291] blk.31.ffn_gate.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 286/ 291] blk.31.ffn_up.weight - [ 4096, 11008, 1, 1], type = f16, quantizing to q4_K .. size = 86.00 MB -> 24.19 MB | hist: \n", + "[ 287/ 291] blk.31.ffn_down.weight - [11008, 4096, 1, 1], type = f16, quantizing to q6_K .. size = 86.00 MB -> 35.27 MB | hist: \n", + "[ 288/ 291] blk.31.attn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 289/ 291] blk.31.ffn_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 290/ 291] output_norm.weight - [ 4096, 1, 1, 1], type = f32, size = 0.016 MB\n", + "[ 291/ 291] output.weight - [ 4096, 32000, 1, 1], type = f16, quantizing to q6_K .. size = 250.00 MB -> 102.54 MB | hist: \n", + "llama_model_quantize_internal: model size = 12853.02 MB\n", + "llama_model_quantize_internal: quant size = 3891.24 MB\n", + "\n", + "main: quantize time = 117198.26 ms\n", + "main: total time = 117198.26 ms\n" + ] + }, + { + "data": { + "application/vnd.jupyter.widget-view+json": { + "model_id": "f17c40e1e25740d8aafdfe3778c98110", + "version_major": 2, + "version_minor": 0 + }, + "text/plain": [ + "weaviate-gorilla-random-split-Q4_K_M.gguf: 0%| | 0.00/4.08G [00:00