Real-Time LLM Request Scheduling Engine & GPU Telemetry Observability Platform. Simulates PagedAttention, Chunked Prefill, and Priority Preemption (vLLM / TGI) on virtualized NVIDIA H100 GPUs.
python distributed-systems typescript websockets telemetry inference nvidia-gpu fastapi llm gp-schedule vllm paged-attention react19 nvidia-h100
-
Updated
Sep 3, 2026 - TypeScript