Локальные модели и железо сервера, на котором гонялся один и тот же PE-образец через RE-harness V5 / OpenCode.
| Модель | Размер | Формат |
|---|---|---|
| Anthropic: Claude Sonnet 5 | — | API (OpenRouter) |
| GLM-4.7-Flash-NVFP4 | 19.8 GiB | NVFP4 (vLLM) |
| Ornith-1.5-35B-A3B-NVFP4 | 21.8 GiB | NVFP4 (vLLM) |
| Qwen3.6-35B-A3B-NVFP4 | 21.9 GiB | NVFP4 (vLLM) |
| Qwen3.6-35B-A3B-Claude-Opus-Distilled-NVFP4 | 21.9 GiB | NVFP4 (vLLM) |
| Qwen3.8-27B-NVFP4 | 21.8 GiB | NVFP4 (vLLM) |
| Qwen3.8-27B-Uncensored-Cyber | 19.2 GiB | GGUF Q4_K_M (llama.cpp) |
| Muse-Glimmer-30B-NVFP4 | 21.8 GiB | NVFP4 (vLLM) |
| NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 | 20.1 GiB | NVFP4 (vLLM) |
| Qwen3.6-27B-MTP-GGUF | 16.7 GiB | GGUF Q4_K_XL (llama.cpp) |
| Ternary-Bonsai-27B-Q2_0 | 6.7 GiB | GGUF Q2_0 (llama.cpp) |
| Компонент | Спецификация |
|---|---|
| CPU | AMD Ryzen 7 5700X3D, 8 ядер / 16 потоков, boost до ~4.15 GHz |
| RAM | 32 GB (2×16 GB) DDR4-3200, TEAMGROUP UD4-3200, dual channel |
| Motherboard | MSI MAG B550 TOMAHAWK (MS-7C91) Rev 2.0 |
| NVMe | WDC PC SN530 1 TB (PCIe) |
| SSD | Samsung 870 QVO 1 TB (SATA) |
| GPU | 2× NVIDIA GeForce RTX 5060 Ti 16 GB (GB206, SM120) |
| OS | Proxmox VE 9.2.0 (kernel 7.0.6-2-pve) |
Инференс идёт в гостевой VM с PCI passthrough обеих RTX 5060 Ti (tensor parallel = 2).
Env
CUDA_VISIBLE_DEVICES=0,1
NCCL_P2P_DISABLE=1
NCCL_IB_DISABLE=1
VLLM_WORKER_MULTIPROC_METHOD=spawn
MAX_JOBS=1
# + CUDA 13 из venv (CUDA_HOME / PATH / LD_LIBRARY_PATH)
Аргументы
vllm serve <MODEL> \ --host 0.0.0.0 \ --port 8080 \ --served-model-name local-coder <MODEL_NAME> \ --tensor-parallel-size 2 \ --max-num-seqs 1 \ --kv-cache-dtype fp8_e4m3 \ --enable-prefix-caching \ --disable-custom-all-reduce
Часто ещё: --language-model-only, --enable-auto-tool-choice, плюс model-specific parsers / MTP / max-model-len / KV bytes.
Env
CUDA_VISIBLE_DEVICES=0,1 GGML_CUDA_ENABLE_UNIFIED_MEMORY=0
Аргументы
llama-server \ --model <GGUF> \ --host 0.0.0.0 \ --port 8080 \ --alias local-coder,<NAME> \ --parallel 1 \ --n-gpu-layers 999 \ --device CUDA0,CUDA1 \ --split-mode layer \ --tensor-split 1,1 \ --fit off \ --flash-attn on \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --threads 8 \ --threads-batch 8 \ --jinja