Order Of Six Angles logo security research Order Of Six Angles
← Все модели

Характеристики

Локальные модели и железо сервера, на котором гонялся один и тот же PE-образец через RE-harness V5 / OpenCode.

Тестируемые модели

Модель Размер Формат
Anthropic: Claude Sonnet 5 API (OpenRouter)
GLM-4.7-Flash-NVFP4 19.8 GiB NVFP4 (vLLM)
Ornith-1.5-35B-A3B-NVFP4 21.8 GiB NVFP4 (vLLM)
Qwen3.6-35B-A3B-NVFP4 21.9 GiB NVFP4 (vLLM)
Qwen3.6-35B-A3B-Claude-Opus-Distilled-NVFP4 21.9 GiB NVFP4 (vLLM)
Qwen3.8-27B-NVFP4 21.8 GiB NVFP4 (vLLM)
Qwen3.8-27B-Uncensored-Cyber 19.2 GiB GGUF Q4_K_M (llama.cpp)
Muse-Glimmer-30B-NVFP4 21.8 GiB NVFP4 (vLLM)
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 20.1 GiB NVFP4 (vLLM)
Qwen3.6-27B-MTP-GGUF 16.7 GiB GGUF Q4_K_XL (llama.cpp)
Ternary-Bonsai-27B-Q2_0 6.7 GiB GGUF Q2_0 (llama.cpp)

Железо сервера

Компонент Спецификация
CPU AMD Ryzen 7 5700X3D, 8 ядер / 16 потоков, boost до ~4.15 GHz
RAM 32 GB (2×16 GB) DDR4-3200, TEAMGROUP UD4-3200, dual channel
Motherboard MSI MAG B550 TOMAHAWK (MS-7C91) Rev 2.0
NVMe WDC PC SN530 1 TB (PCIe)
SSD Samsung 870 QVO 1 TB (SATA)
GPU 2× NVIDIA GeForce RTX 5060 Ti 16 GB (GB206, SM120)
OS Proxmox VE 9.2.0 (kernel 7.0.6-2-pve)

Инференс идёт в гостевой VM с PCI passthrough обеих RTX 5060 Ti (tensor parallel = 2).

Запуск движков

Общие для vLLM

Env

CUDA_VISIBLE_DEVICES=0,1
NCCL_P2P_DISABLE=1
NCCL_IB_DISABLE=1
VLLM_WORKER_MULTIPROC_METHOD=spawn
MAX_JOBS=1
# + CUDA 13 из venv (CUDA_HOME / PATH / LD_LIBRARY_PATH)

Аргументы

vllm serve <MODEL> \
  --host 0.0.0.0 \
  --port 8080 \
  --served-model-name local-coder <MODEL_NAME> \
  --tensor-parallel-size 2 \
  --max-num-seqs 1 \
  --kv-cache-dtype fp8_e4m3 \
  --enable-prefix-caching \
  --disable-custom-all-reduce

Часто ещё: --language-model-only, --enable-auto-tool-choice, плюс model-specific parsers / MTP / max-model-len / KV bytes.

Общие для llama.cpp

Env

CUDA_VISIBLE_DEVICES=0,1
GGML_CUDA_ENABLE_UNIFIED_MEMORY=0

Аргументы

llama-server \
  --model <GGUF> \
  --host 0.0.0.0 \
  --port 8080 \
  --alias local-coder,<NAME> \
  --parallel 1 \
  --n-gpu-layers 999 \
  --device CUDA0,CUDA1 \
  --split-mode layer \
  --tensor-split 1,1 \
  --fit off \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --threads 8 \
  --threads-batch 8 \
  --jinja