diff --git a/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-sycl.json b/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-sycl.json new file mode 100644 index 0000000..6121f58 --- /dev/null +++ b/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-sycl.json @@ -0,0 +1,16 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-6-27b", + "quant": "q4_k_m", + "runtime": "llamacpp", + "runtimeVersion": "b11026 (b49650adb)", + "runtimeFlags": "sycl backend, -ngl 99 -fa 1 -p 512 -n 256 -r 5, single request", + "decodeTps": 26.635976, + "promptTps": 312.574979, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream ggml-org/llama.cpp at b49650adb, clean tree, sycl backend. Weights unsloth/Qwen3.6-27B-GGUF. decodeTps is tg256 averaged over 5 runs, one request at a time." +} diff --git a/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-vulkan.json b/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-vulkan.json new file mode 100644 index 0000000..05b41b8 --- /dev/null +++ b/results/shacortes/qwen3-6-27b-llamacpp-q4_k_m-vulkan.json @@ -0,0 +1,16 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-6-27b", + "quant": "q4_k_m", + "runtime": "llamacpp", + "runtimeVersion": "b11026 (b49650adb)", + "runtimeFlags": "vulkan backend, -ngl 99 -fa 1 -p 512 -n 256 -r 5, single request", + "decodeTps": 11.492122, + "promptTps": 679.700179, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream ggml-org/llama.cpp at b49650adb, clean tree, vulkan backend. Weights unsloth/Qwen3.6-27B-GGUF. decodeTps is tg256 averaged over 5 runs, one request at a time." +} diff --git a/results/shacortes/qwen3-6-27b-vllm-int4.json b/results/shacortes/qwen3-6-27b-vllm-int4.json new file mode 100644 index 0000000..c291f6e --- /dev/null +++ b/results/shacortes/qwen3-6-27b-vllm-int4.json @@ -0,0 +1,17 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-6-27b", + "quant": "int4", + "runtime": "vllm", + "runtimeVersion": "0.29.0 (v0.29.0 98dff2a81)", + "runtimeFlags": "FLASH_ATTN v2, chunked prefill on, prefix caching on, fp16, kv cache auto, --max-num-seqs 1 --gpu-memory-utilization 0.92 --max-model-len 4096, single request", + "decodeTps": 27.96, + "ttftMs": 98.07, + "contextLength": 4096, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream vllm-project/vllm v0.29.0 (98dff2a81), clean checkout in its own venv, vllm_xpu_kernels from PyPI, plugins disabled. Weights cyankiwi/Qwen3.6-27B-AWQ-INT4. 8 prompts of 64 tokens, 256 tokens out each, one request at a time. decodeTps = 1000/mean_tpot_ms (35.77 ms), matching llama.cpp tg256; vLLM output_throughput over total wall time was 27.77 tok/s." +} diff --git a/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-sycl.json b/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-sycl.json new file mode 100644 index 0000000..240be9b --- /dev/null +++ b/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-sycl.json @@ -0,0 +1,16 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-8-27b", + "quant": "q4_k_m", + "runtime": "llamacpp", + "runtimeVersion": "b11026 (b49650adb)", + "runtimeFlags": "sycl backend, -ngl 99 -fa 1 -p 512 -n 256 -r 5, single request", + "decodeTps": 20.354646, + "promptTps": 288.562413, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream ggml-org/llama.cpp at b49650adb, clean tree, sycl backend. Weights unsloth/Qwen3.8-27B-GGUF. decodeTps is tg256 averaged over 5 runs, one request at a time." +} diff --git a/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-vulkan.json b/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-vulkan.json new file mode 100644 index 0000000..b986664 --- /dev/null +++ b/results/shacortes/qwen3-8-27b-llamacpp-q4_k_m-vulkan.json @@ -0,0 +1,16 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-8-27b", + "quant": "q4_k_m", + "runtime": "llamacpp", + "runtimeVersion": "b11026 (b49650adb)", + "runtimeFlags": "vulkan backend, -ngl 99 -fa 1 -p 512 -n 256 -r 5, single request", + "decodeTps": 14.810784, + "promptTps": 679.554036, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream ggml-org/llama.cpp at b49650adb, clean tree, vulkan backend. Weights unsloth/Qwen3.8-27B-GGUF. decodeTps is tg256 averaged over 5 runs, one request at a time." +} diff --git a/results/shacortes/qwen3-8-27b-vllm-int4.json b/results/shacortes/qwen3-8-27b-vllm-int4.json new file mode 100644 index 0000000..6aad0cb --- /dev/null +++ b/results/shacortes/qwen3-8-27b-vllm-int4.json @@ -0,0 +1,17 @@ +{ + "$schema": "https://raw.githubusercontent.com/labscommunity/intelinside/main/results/schema.json", + "rig": "3", + "component": "intel-arc-pro-b70", + "componentQuantity": 1, + "model": "qwen3-8-27b", + "quant": "int4", + "runtime": "vllm", + "runtimeVersion": "0.29.0 (v0.29.0 98dff2a81)", + "runtimeFlags": "FLASH_ATTN v2, chunked prefill on, prefix caching on, bf16, kv cache auto, --max-num-seqs 1 --gpu-memory-utilization 0.92 --max-model-len 4096, single request", + "decodeTps": 27.01, + "ttftMs": 107.88, + "contextLength": 4096, + "batchSize": 1, + "runDate": "2026-09-17", + "notes": "Stock upstream vllm-project/vllm v0.29.0 (98dff2a81), clean checkout in its own venv, vllm_xpu_kernels from PyPI, plugins disabled. Weights cyankiwi/Qwen3.8-27B-AWQ-INT4. 8 prompts of 64 tokens, 256 tokens out each, one request at a time. decodeTps = 1000/mean_tpot_ms (37.02 ms), matching llama.cpp tg256; vLLM output_throughput over total wall time was 26.81 tok/s." +}