Skip to content

FreeToken ROCm Watch — notification channel - #1

Draft
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log
Draft

FreeToken ROCm Watch — notification channel#1
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log

Conversation

@Castoff995

Copy link
Copy Markdown
Owner

Этот PR служит постоянным каналом уведомлений для автоматической проверки GitHub каждые 2 часа. Его не нужно ревьюить, мержить или закрывать, пока слежка нужна.

Высший приоритет

Рабочие форки

  • PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf.
  • Maxritz/FreeToken-rocm-test:main.

Зависимости

  • ROCm/TheRock — Windows/RDNA4/gfx1201 wheels, PyTorch/HIP regressions and releases.
  • triton-lang/triton-windows — Windows AMD/HIP support and releases.
  • apache/tvm-ffi — Windows/HIP JIT and cache/toolchain changes.

Устойчивость модели

Также отслеживаются изменения, способные повлиять на первый токен и практический перевод: Qwen3.6/NVFP4, MoE offload, hybrid_radix, pinned/pageable residency, mapped device pointers, long-prefill/KV-cache hangs and engine crashes.

Уведомление публикуется только при существенном изменении: новый релевантный issue/PR, новый commit в ключевом PR/форке, изменение draft/merge/CI/state, новый релиз либо подтверждённый gfx1201/Windows результат. При отсутствии новостей комментариев не будет.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch запущен. Проверка выполняется каждые 2 часа; при отсутствии существенных изменений комментариев не будет.

Текущий P0 baseline:

Ключевые issues: FreeToken Roadmap (2026), ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please, Native Windows is classified as pin-uncapped, so #112's per-layer residency never auto-engages, Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp.

Дополнительно отслеживаются fork commits, ROCm/TheRock, Triton Windows, TVM-FFI, PyTorch gfx1201, Qwen3.6/NVFP4, mapped host pointers, pin-budget, long-prefill и offload stability.

@github-actions

github-actions Bot commented Aug 24, 2026

Copy link
Copy Markdown

{"branches":{"FlashML-org/FreeToken:main":{"branch":"main","date":"2026-09-04T06:52:33Z","message":"ci: publish engine-.json manifests alongside the nightly wheels (FlashML-org#377)","repo":"FlashML-org/FreeToken","sha":"af71ba43206e124f5ff6419b47ee36c6e9981078","url":"FlashML-org@af71ba43206e124f5ff6419b47ee36c6e9981078"},"Maxritz/FreeToken-rocm-test:main":{"branch":"main","date":"2026-08-26T08:26:56Z","message":"Merge pull request Maxritz#2 from PialGhosh2233/main","repo":"Maxritz/FreeToken-rocm-test","sha":"89f14790de7bbc69dd61a999ee76b86ba8316f26","url":"Maxritz@89f14790de7bbc69dd61a999ee76b86ba8316f26"},"PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf":{"branch":"gfx1200-moe-gguf","date":"2026-08-26T07:51:22Z","message":"docs: Gemma-4-26B-A4B QAT q4_0 GGUF results on gfx1200","repo":"PialGhosh2233/FreeToken-rocm-gfx1200","sha":"a338f49b93e2f098eeb3aa83423c9c5386c53ac4","url":"PialGhosh2233@a338f49b93e2f098eeb3aa83423c9c5386c53ac4"}},"discovered":{"FlashML-org/FreeToken#104%22:%7B%22body_hash%22:%220ba9970c69c92be9%22,%22comments%22:16,%22kind%22:%22pr%22,%22number%22:104,%22repo%22:%22FlashML-org/FreeToken%22,%22state%22:%22open%22,%22title%22:%22feat(models): support TP for qwen3_5_moe","updated_at":"2026-09-04T15:09:13Z","url":"https://github.com/FlashML-org/FreeToken/pull/104"},"FlashML-org/FreeToken#108":{"body_hash":"d12d8bede30d7b6c","comments":2,"kind":"pr","number":108,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): Add OpenAI /v1/models/{model_id} endpoint","updated_at":"2026-09-05T04:24:16Z","url":"https://github.com/FlashML-org/FreeToken/pull/108"},"FlashML-org/FreeToken#16":{"body_hash":"fb266d8bbe40557f","comments":1,"kind":"issue","number":16,"repo":"FlashML-org/FreeToken","state":"closed","title":"NotImplementedError: GPUs on both sides of the sm_89 fp8 boundary in one process: the host-side e4m3 convention is process-global","updated_at":"2026-09-04T09:08:50Z","url":"https://github.com/FlashML-org/FreeToken/issues/16"},"FlashML-org/FreeToken#169":{"body_hash":"742a514547b6b67c","comments":1,"kind":"pr","number":169,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): load prefill triton kernels at startup, not mid-request","updated_at":"2026-09-05T04:25:08Z","url":"https://github.com/FlashML-org/FreeToken/pull/169"},"FlashML-org/FreeToken#207":{"body_hash":"9d6c44260cb6edc1","comments":3,"kind":"issue","number":207,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Linux] AppImage blank window / WebKitWebProcess abort: "Could not create default EGL display: EGL_BAD_PARAMETER" (bundled libwayland-client on Mesa 25+ hosts)","updated_at":"2026-09-08T03:31:24Z","url":"https://github.com/FlashML-org/FreeToken/issues/207"},"FlashML-org/FreeToken#217":{"body_hash":"0e0dbaaf50222ee4","comments":3,"kind":"pr","number":217,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(rocm): AMD ROCm runtime for RDNA3/4 with native Qwen3.5-MoE GGUF decode parity","updated_at":"2026-09-05T19:32:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/217"},"FlashML-org/FreeToken#227":{"body_hash":"ec213ea17037ea8c","comments":12,"kind":"issue","number":227,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Bug]: RuntimeError: Rowwise scaling is not currently supported on your device","updated_at":"2026-09-08T04:20:41Z","url":"https://github.com/FlashML-org/FreeToken/issues/227"},"FlashML-org/FreeToken#248":{"body_hash":"89bb063d23656e84","comments":2,"kind":"issue","number":248,"repo":"FlashML-org/FreeToken","state":"closed","title":"Two blocking bugs in Windows Desktop on consumer Blackwell (RTX 50): FP8 row-wise gate crash + Mistral tokenizer empty Chinese output","updated_at":"2026-09-08T04:21:55Z","url":"https://github.com/FlashML-org/FreeToken/issues/248"},"FlashML-org/FreeToken#252":{"body_hash":"01ce46ac32f028fd","comments":4,"kind":"issue","number":252,"repo":"FlashML-org/FreeToken","state":"open","title":"[Feature Request] Support compressed-tensors per-channel FP8 checkpoints for Qwen3.5 MoE","updated_at":"2026-09-08T02:26:17Z","url":"https://github.com/FlashML-org/FreeToken/issues/252"},"FlashML-org/FreeToken#260":{"body_hash":"e0794d434a8a819d","comments":5,"kind":"pr","number":260,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm: validate native gfx1151 serving on Strix Halo","updated_at":"2026-09-05T22:42:23Z","url":"https://github.com/FlashML-org/FreeToken/pull/260"},"FlashML-org/FreeToken#268":{"body_hash":"90e395f1fec25670","comments":10,"kind":"pr","number":268,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): sub-byte Q4_0 and Q6_0 KV cache quantization","updated_at":"2026-09-04T16:19:48Z","url":"https://github.com/FlashML-org/FreeToken/pull/268"},"FlashML-org/FreeToken#275":{"body_hash":"2325c00fd601603b","comments":4,"kind":"pr","number":275,"repo":"FlashML-org/FreeToken","state":"open","title":"fix: [BUG] qwen3_5 dense: mixed-precision NVFP4 crashes in ct_bf16_fuse (Float8 × BFloat16 promotion)","updated_at":"2026-09-08T01:19:55Z","url":"https://github.com/FlashML-org/FreeToken/pull/275"},"FlashML-org/FreeToken#280":{"body_hash":"6abdea5758e2a7f7","comments":1,"kind":"issue","number":280,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature Request: opt-in FP8 KV-cache support for long-context MoE inference","updated_at":"2026-09-05T23:32:30Z","url":"https://github.com/FlashML-org/FreeToken/issues/280"},"FlashML-org/FreeToken#287":{"body_hash":"53577e1bbcf544bd","comments":2,"kind":"pr","number":287,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(scheduler): hybrid radix hit corruption — GDN snapshot copy-on-donate + admission barriers","updated_at":"2026-09-05T10:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/287"},"FlashML-org/FreeToken#298":{"body_hash":"82f5c00b90b8d5d3","comments":0,"kind":"pr","number":298,"repo":"FlashML-org/FreeToken","state":"open","title":"Support poolside/Laguna-S-2.1-NVFP4, and fix serving from source on Windows","updated_at":"2026-09-05T18:31:59Z","url":"https://github.com/FlashML-org/FreeToken/pull/298"},"FlashML-org/FreeToken#299":{"body_hash":"fe817aa800d84eb9","comments":7,"kind":"issue","number":299,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken-Intel: 35B MoE, live tokens off an Arc Pro B70 (SYCL / XPU port)","updated_at":"2026-09-04T23:41:52Z","url":"https://github.com/FlashML-org/FreeToken/issues/299"},"FlashML-org/FreeToken#301":{"body_hash":"40475c88b787fc6e","comments":2,"kind":"issue","number":301,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): allow overriding the distributed port","updated_at":"2026-09-06T12:13:08Z","url":"https://github.com/FlashML-org/FreeToken/issues/301"},"FlashML-org/FreeToken#302":{"body_hash":"53ce92fba4ae82bc","comments":3,"kind":"issue","number":302,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): add a server-side thinking override","updated_at":"2026-09-06T11:55:42Z","url":"https://github.com/FlashML-org/FreeToken/issues/302"},"FlashML-org/FreeToken#306":{"body_hash":"5f4417a782901609","comments":2,"kind":"issue","number":306,"repo":"FlashML-org/FreeToken","state":"open","title":"Long-context decode: client wall-clock is ~half the scheduler gen throughput","updated_at":"2026-09-05T23:29:09Z","url":"https://github.com/FlashML-org/FreeToken/issues/306"},"FlashML-org/FreeToken#307":{"body_hash":"0c7eb3672129dec5","comments":1,"kind":"issue","number":307,"repo":"FlashML-org/FreeToken","state":"open","title":"temperature 0 is not reproducible with thinking on (identical requests diverge on near-ties)","updated_at":"2026-09-05T17:21:03Z","url":"https://github.com/FlashML-org/FreeToken/issues/307"},"FlashML-org/FreeToken#320":{"body_hash":"dc06711149928e6d","comments":2,"kind":"pr","number":320,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen4_exp: load modelopt MIXED_PRECISION (NVFP4 experts + block-FP8 dense) checkpoints","updated_at":"2026-09-04T22:14:01Z","url":"https://github.com/FlashML-org/FreeToken/pull/320"},"FlashML-org/FreeToken#338":{"body_hash":"2ba2e586b8540644","comments":4,"kind":"pr","number":338,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(ple): fuse the n-gram row-id hash into one Triton kernel","updated_at":"2026-09-04T16:38:26Z","url":"https://github.com/FlashML-org/FreeToken/pull/338"},"FlashML-org/FreeToken#339":{"body_hash":"7d0f17426b165cb7","comments":4,"kind":"pr","number":339,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(kernels): drop the D2H sync from the varlen GDN/KDA prefill conv","updated_at":"2026-09-04T15:00:40Z","url":"https://github.com/FlashML-org/FreeToken/pull/339"},"FlashML-org/FreeToken#340":{"body_hash":"4c2febbad30c626f","comments":1,"kind":"pr","number":340,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): reserve the pool's dummy page in the --moe-cache-auto KV floor","updated_at":"2026-09-04T15:00:41Z","url":"https://github.com/FlashML-org/FreeToken/pull/340"},"FlashML-org/FreeToken#342":{"body_hash":"52be93d51888c01f","comments":1,"kind":"pr","number":342,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen3_5_moe: run lm_head on sampled rows only (fixes 32 GB first-prefill OOM)","updated_at":"2026-09-04T15:50:15Z","url":"https://github.com/FlashML-org/FreeToken/pull/342"},"FlashML-org/FreeToken#35":{"body_hash":"496be1e928015afc","comments":3,"kind":"issue","number":35,"repo":"FlashML-org/FreeToken","state":"closed","title":"FreeToken Engine Install Fails in Windows with RTX4060","updated_at":"2026-09-08T03:33:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/35"},"FlashML-org/FreeToken#354":{"body_hash":"8345cf73d9d7fb75","comments":14,"kind":"pr","number":354,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): store the KV cache as fp8 e4m3 codes (--kv-cache-dtype…","updated_at":"2026-09-07T23:49:19Z","url":"https://github.com/FlashML-org/FreeToken/pull/354"},"FlashML-org/FreeToken#362":{"body_hash":"23cc7b624683db16","comments":2,"kind":"issue","number":362,"repo":"FlashML-org/FreeToken","state":"open","title":"[Feature Request]: Support EXL3 Format","updated_at":"2026-09-07T18:25:15Z","url":"https://github.com/FlashML-org/FreeToken/issues/362"},"FlashML-org/FreeToken#365":{"body_hash":"3831930353df160b","comments":2,"kind":"issue","number":365,"repo":"FlashML-org/FreeToken","state":"closed","title":"Qwen3.5-122B-A10B-NVFP4","updated_at":"2026-09-07T13:58:39Z","url":"https://github.com/FlashML-org/FreeToken/issues/365"},"FlashML-org/FreeToken#371":{"body_hash":"7538342caf26a9eb","comments":1,"kind":"issue","number":371,"repo":"FlashML-org/FreeToken","state":"open","title":"TP > 1: every rank keeps torch's default intra-op thread count, so a multi-rank weight load busy-waits itself to a standstill on a small-core host (19 min -> 61 s)","updated_at":"2026-09-05T23:29:52Z","url":"https://github.com/FlashML-org/FreeToken/issues/371"},"FlashML-org/FreeToken#381":{"body_hash":"7b7953cbc7889e51","comments":0,"kind":"issue","number":381,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug]: qwen3_5_moe fails to convert/load compressed-tensors NVFP4 checkpoints with model.language_model prefix","updated_at":"2026-09-04T10:34:22Z","url":"https://github.com/FlashML-org/FreeToken/issues/381"},"FlashML-org/FreeToken#383":{"body_hash":"7b7e372a1d279391","comments":1,"kind":"issue","number":383,"repo":"FlashML-org/FreeToken","state":"open","title":"--moe-cache-auto ignores --num-tokens / --num-pages: expert fill overruns the budget and the KV pool OOMs at boot","updated_at":"2026-09-04T19:28:00Z","url":"https://github.com/FlashML-org/FreeToken/issues/383"},"FlashML-org/FreeToken#384":{"body_hash":"a5cfef075e1a00c8","comments":0,"kind":"issue","number":384,"repo":"FlashML-org/FreeToken","state":"open","title":"Build on Windows?","updated_at":"2026-09-04T15:32:45Z","url":"https://github.com/FlashML-org/FreeToken/issues/384"},"FlashML-org/FreeToken#385":{"body_hash":"387898d8b1fab043","comments":1,"kind":"pr","number":385,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(qwen4_exp): tensor parallelism for Qwen3.8-Flash-Next (offload backend)","updated_at":"2026-09-04T19:20:01Z","url":"https://github.com/FlashML-org/FreeToken/pull/385"},"FlashML-org/FreeToken#387":{"body_hash":"351ce6d8d13b27f5","comments":0,"kind":"issue","number":387,"repo":"FlashML-org/FreeToken","state":"open","title":"Desktop engine installer ignores existing FreeToken engine path and always installs a new venv in AppData","updated_at":"2026-09-04T18:45:08Z","url":"https://github.com/FlashML-org/FreeToken/issues/387"},"FlashML-org/FreeToken#389":{"body_hash":"dcccc6e69f4d67e3","comments":2,"kind":"pr","number":389,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(qwen4_exp): load-time per-tensor FP8 dense projections (W8A8 via _scaled_mm)","updated_at":"2026-09-05T21:48:07Z","url":"https://github.com/FlashML-org/FreeToken/pull/389"},"FlashML-org/FreeToken#390":{"body_hash":"a2503c9f178eed1b","comments":3,"kind":"pr","number":390,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(models): better support for mixed-precision compressed-tensors NVFP4","updated_at":"2026-09-08T07:33:59Z","url":"https://github.com/FlashML-org/FreeToken/pull/390"},"FlashML-org/FreeToken#392":{"body_hash":"2965b722053667b3","comments":3,"kind":"pr","number":392,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen4_exp: serve the block-FP8 dense projections natively (+25% decode)","updated_at":"2026-09-05T23:20:02Z","url":"https://github.com/FlashML-org/FreeToken/pull/392"},"FlashML-org/FreeToken#393":{"body_hash":"cdaa24a2eb622868","comments":0,"kind":"pr","number":393,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): OpenAI protocol coverage -- sampling extras, n, echo/suffix, usage details, tokenize/detokenize/metrics","updated_at":"2026-09-05T13:00:52Z","url":"https://github.com/FlashML-org/FreeToken/pull/393"},"FlashML-org/FreeToken#394":{"body_hash":"a78be87d98a48a00","comments":1,"kind":"issue","number":394,"repo":"FlashML-org/FreeToken","state":"open","title":"Support official nvidia/Qwen3.8-Flash-Next-NVFP4 model","updated_at":"2026-09-05T23:26:11Z","url":"https://github.com/FlashML-org/FreeToken/issues/394"},"FlashML-org/FreeToken#395":{"body_hash":"06db136ff57c621d","comments":1,"kind":"issue","number":395,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug] --max-output-tokens is ignored by /v1/chat/completions and /v1/messages (only /v1/responses honours it)","updated_at":"2026-09-05T23:31:37Z","url":"https://github.com/FlashML-org/FreeToken/issues/395"},"FlashML-org/FreeToken#396":{"body_hash":"5c11b3569ee092da","comments":0,"kind":"issue","number":396,"repo":"FlashML-org/FreeToken","state":"open","title":"[Feature] int4 routed experts: AWQ -> Q4_1 and compressed-tensors pack-quantized -> Q4_0, with no new CUDA kernel (offering a PR)","updated_at":"2026-09-06T05:40:49Z","url":"https://github.com/FlashML-org/FreeToken/issues/396"},"FlashML-org/FreeToken#397":{"body_hash":"33f938edd354e81a","comments":0,"kind":"issue","number":397,"repo":"FlashML-org/FreeToken","state":"open","title":"5090+256G内存无法运行红帽的GLM5.3FlashNVFP4","updated_at":"2026-09-05T19:21:52Z","url":"https://github.com/FlashML-org/FreeToken/issues/397"},"FlashML-org/FreeToken#398":{"body_hash":"f27e8711e749cf12","comments":0,"kind":"pr","number":398,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): add ISO3/ISO4 KV-cache quantization (--kv-cache-iso)","updated_at":"2026-09-05T20:36:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/398"},"FlashML-org/FreeToken#399":{"body_hash":"227a0901fd907e75","comments":0,"kind":"pr","number":399,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(cpu-moe): honor padded fp8 scale strides, add avx512f tier and float64 parity (builds on FlashML-org#36)","updated_at":"2026-09-06T00:21:38Z","url":"https://github.com/FlashML-org/FreeToken/pull/399"},"FlashML-org/FreeToken#401":{"body_hash":"b1163ed10ceb8548","comments":0,"kind":"issue","number":401,"repo":"FlashML-org/FreeToken","state":"open","title":"--moe-cache-auto leaves no room for prefill: boots and serves decode, then the first 8k prefill OOMs and kills the worker (NVFP4 dense)","updated_at":"2026-09-06T04:11:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/401"},"FlashML-org/FreeToken#403":{"body_hash":"76bd4f986529962a","comments":2,"kind":"issue","number":403,"repo":"FlashML-org/FreeToken","state":"closed","title":"prompt is too long: 16535 tokens > 8221 maximum","updated_at":"2026-09-07T07:42:14Z","url":"https://github.com/FlashML-org/FreeToken/issues/403"},"FlashML-org/FreeToken#404":{"body_hash":"413b22ce94b35bb6","comments":0,"kind":"pr","number":404,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(models): support nvidia/Qwen3.8-Flash-Next-NVFP4 in qwen4_exp","updated_at":"2026-09-07T02:31:21Z","url":"https://github.com/FlashML-org/FreeToken/pull/404"},"FlashML-org/FreeToken#405":{"body_hash":"457abec0397d19e5","comments":0,"kind":"pr","number":405,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(models): serve qwen4_exp FTW checkpoints with PLE streamed from source","updated_at":"2026-09-07T03:35:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/405"},"FlashML-org/FreeToken#406":{"body_hash":"caec58fadfcf0f28","comments":0,"kind":"pr","number":406,"repo":"FlashML-org/FreeToken","state":"open","title":"docs(models): qualify full GLM-5.3 on H200 Serverless","updated_at":"2026-09-07T21:15:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/406"},"FlashML-org/FreeToken#407":{"body_hash":"75c7c60da2dac36a","comments":1,"kind":"issue","number":407,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.6‑35B‑A3B‑Uncensored‑HauhauCS‑Aggressive GGUF 加载报错 qwen35moe architecture not supported","updated_at":"2026-09-07T11:03:43Z","url":"https://github.com/FlashML-org/FreeToken/issues/407"},"FlashML-org/FreeToken#408":{"body_hash":"c59b1167f4e8a6b6","comments":0,"kind":"pr","number":408,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): add nvfp4 kv quantization","updated_at":"2026-09-08T00:00:00Z","url":"https://github.com/FlashML-org/FreeToken/pull/408"},"FlashML-org/FreeToken#409":{"body_hash":"ae748f8c8ddac88b","comments":1,"kind":"issue","number":409,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.8-Flash-Next-NVFP4 cannot start on a 12 GB RTX 3060: ~9.9 GiB of unquantized (BF16) attention/embedding weights leave no room for MoE cache + KV","updated_at":"2026-09-07T11:40:42Z","url":"https://github.com/FlashML-org/FreeToken/issues/409"},"FlashML-org/FreeToken#410":{"body_hash":"6844e6a7d78e03a2","comments":2,"kind":"issue","number":410,"repo":"FlashML-org/FreeToken","state":"open","title":"[Model request] KAT-Coder-V2.5-Dev NVFP4 community exports (compressed-tensors MoE): dense-branch misroute + GDN granularity","updated_at":"2026-09-08T09:15:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/410"},"FlashML-org/FreeToken#413":{"body_hash":"f5fc80d163252223","comments":0,"kind":"pr","number":413,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(models): support llm-compressor NVFP4 MoE export variants","updated_at":"2026-09-08T03:23:36Z","url":"https://github.com/FlashML-org/FreeToken/pull/413"},"FlashML-org/FreeToken#50":{"body_hash":"600c9fb99d6b206f","comments":1,"kind":"issue","number":50,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows: server fails during CUDA graph warmup because dll is not found","updated_at":"2026-09-04T09:19:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/50"},"FlashML-org/FreeToken#60":{"body_hash":"9ff8ed296bc092d9","comments":20,"kind":"issue","number":60,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature request: AMD GPU support","updated_at":"2026-09-07T15:16:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/60"},"FlashML-org/FreeToken#62":{"body_hash":"6cc245487090a7a1","comments":4,"kind":"issue","number":62,"repo":"FlashML-org/FreeToken","state":"open","title":"Offloaded MoE ignores tensor parallelism: TP=2 is a regression, and the fix is not expert parallelism","updated_at":"2026-09-05T23:27:45Z","url":"https://github.com/FlashML-org/FreeToken/issues/62"},"FlashML-org/FreeToken#68":{"body_hash":"f0cf473f9e35a194","comments":3,"kind":"issue","number":68,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Bug] 原始权重转换 FTW 格式卡在"准备权重"——DeepSeek-V4-Flash FP4 超 10 小时无进展","updated_at":"2026-09-04T09:09:39Z","url":"https://github.com/FlashML-org/FreeToken/issues/68"},"FlashML-org/FreeToken#97":{"body_hash":"1d5f83de197791fd","comments":9,"kind":"issue","number":97,"repo":"FlashML-org/FreeToken","state":"open","title":"Difficult to load model despite more than enough vram/ram available","updated_at":"2026-09-08T09:11:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/97"}},"errors":["dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID E006:7D145:25683C4:7A03EB6:6A9FF005 and timestamp 2026-09-08 11:22:45 UTC. For more on scraping GitHub and how it may affect your rights, please review our Terms of Service (https://docs.github.com/en/site-policy/github-terms/github-terms-of-service)"],"external_tracked_issues":{"ROCm/legacy-rocm-build#6461":{"body_hash":"0ac6e80ee9b489cd","comments":4,"kind":"issue","number":6461,"relevance":"high","relevance_reason":"Windows + gfx1201 + hipBLASLt/rocBLAS sequence/state-dependent GEMM failure","repo":"ROCm/legacy-rocm-build","state":"open","title":"[Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14","updated_at":"2026-08-25T10:25:55Z","url":"https://github.com/ROCm/legacy-rocm-build/issues/6461"}},"last_checked":"2026-09-08T11:22:19+00:00","releases":{"FlashML-org/FreeToken":{"draft":false,"name":"v0.1.2","prerelease":false,"published_at":"2026-08-19T06:20:18Z","tag":"v0.1.2","url":"https://github.com/FlashML-org/FreeToken/releases/tag/v0.1.2"},"ROCm/ROCm":{"draft":false,"name":"ROCm 7.14.0 Release","prerelease":false,"published_at":"2026-07-16T03:28:58Z","tag":"rocm-7.14.0","url":"https://github.com/ROCm/legacy-rocm-build/releases/tag/rocm-7.14.0"},"ROCm/TheRock":{"draft":false,"name":"ROCm 10.0.0 Release","prerelease":false,"published_at":"2026-08-26T10:03:34Z","tag":"therock-10.0","url":"https://github.com/ROCm/TheRock/releases/tag/therock-10.0"},"apache/tvm-ffi":{"draft":false,"name":"v0.1.13-post3","prerelease":false,"published_at":"2026-08-10T13:31:09Z","tag":"v0.1.13-post3","url":"https://github.com/apache/tvm-ffi/releases/tag/v0.1.13-post3"},"ggml-org/llama.cpp":{"draft":false,"name":"v0.4.0","prerelease":false,"published_at":"2026-09-04T19:56:47Z","tag":"v0.4.0","url":"https://github.com/ggml-org/llama.cpp/releases/tag/v0.4.0"},"triton-lang/triton-windows":{"draft":false,"name":"v3.8.0-windows.post28","prerelease":false,"published_at":"2026-08-29T12:24:14Z","tag":"v3.8.0-windows.post28","url":"https://github.com/triton-lang/triton-windows/releases/tag/v3.8.0-windows.post28"}},"tracked_issues":{"110":{"body_hash":"d6672f16a90f2854","comments":2,"kind":"issue","number":110,"repo":"FlashML-org/FreeToken","state":"open","title":"Unhandled CUDA OOM in prefill expert workspace kills the engine; server keeps accepting requests that never return (root cause behind FlashML-org#20-style headless state; likely also FlashML-org#72)","updated_at":"2026-09-05T23:28:27Z","url":"https://github.com/FlashML-org/FreeToken/issues/110"},"111":{"body_hash":"b01b977d143435c7","comments":3,"kind":"issue","number":111,"repo":"FlashML-org/FreeToken","state":"open","title":"Requests longer than the KV pool are queued forever with no error — and --moe-cache-auto leaves only ~8k tokens of KV on a 96GB GPU","updated_at":"2026-08-31T02:09:35Z","url":"https://github.com/FlashML-org/FreeToken/issues/111"},"120":{"body_hash":"a7caa8c0bca18470","comments":1,"kind":"issue","number":120,"repo":"FlashML-org/FreeToken","state":"open","title":"Native Windows is classified as pin-uncapped, so FlashML-org#112's per-layer residency never auto-engages","updated_at":"2026-08-24T03:04:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/120"},"122":{"body_hash":"4d42515b782747ed","comments":6,"kind":"issue","number":122,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp","updated_at":"2026-08-27T07:18:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/122"},"123":{"body_hash":"09dd1b9b8cf6560f","comments":1,"kind":"issue","number":123,"repo":"FlashML-org/FreeToken","state":"closed","title":"Request hang (silent, zero-log) with hybrid_radix cache + moe-backend offload + nvfp4 triton backend — reproduced on 2 independent models, not explained by FlashML-org#110","updated_at":"2026-08-29T05:13:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/123"},"124":{"body_hash":"64a1de8500f135a3","comments":0,"kind":"issue","number":124,"repo":"FlashML-org/FreeToken","state":"closed","title":"NVFP4 checkpoints fail to load: model.safetensors.index.json is not downloaded, but the NVFP4 bank loader requires it","updated_at":"2026-09-02T02:43:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/124"},"79":{"body_hash":"2fe32010327776c6","comments":16,"kind":"issue","number":79,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken Roadmap (2026)","updated_at":"2026-09-04T17:33:03Z","url":"https://github.com/FlashML-org/FreeToken/issues/79"},"82":{"body_hash":"ff59a7ff00722b01","comments":17,"kind":"issue","number":82,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please","updated_at":"2026-09-08T10:34:41Z","url":"https://github.com/FlashML-org/FreeToken/issues/82"}},"tracked_prs":{"112":{"base_sha":"f0abe587a11cca53bb3c37a9596fad24973ace62","body_hash":"aa539235301fea3d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":3,"draft":false,"head_sha":"831d38a66bc45543411078c6805de8c42e7603fa","merged":true,"number":112,"review_comments":0,"state":"closed","title":"feat(moe): per-layer host-bank residency","updated_at":"2026-08-24T00:39:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/112"},"118":{"base_sha":"e0a3bbc04652ec0622d932adcbf2772848e3c2e2","body_hash":"d73a76c00cdb2f94","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"6241178a7550e5a0ffadd85f0eb04af0160f9988","merged":false,"number":118,"review_comments":0,"state":"open","title":"fix(scheduler): clamp admission to the actual KV pool so oversized prompts fail loudly","updated_at":"2026-08-24T00:52:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/118"},"125":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"793491958f083651","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"cb44bdeedb7ea6ed2b37c5c49864ad40065e1985","merged":false,"number":125,"review_comments":0,"state":"open","title":"test(pinned): use mapped memory for UVA pointer check","updated_at":"2026-08-24T05:48:44Z","url":"https://github.com/FlashML-org/FreeToken/pull/125"},"129":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"d5c4ac29d87557fc","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":1,"draft":false,"head_sha":"d30726e006b2708d4fbfead120985bc23c935541","merged":false,"number":129,"review_comments":0,"state":"closed","title":"fix(download): include json files when fetching weights, so NVFP4's index.json is no longer silently skipped","updated_at":"2026-09-02T02:45:39Z","url":"https://github.com/FlashML-org/FreeToken/pull/129"},"131":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"33bc52d171e8ca00","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":36,"draft":false,"head_sha":"bb432e8c473c557cdef6517abccf0c129bd8c544","merged":false,"number":131,"review_comments":0,"state":"open","title":"GGUF: support all quant types, add qwen35moe","updated_at":"2026-08-29T22:27:37Z","url":"https://github.com/FlashML-org/FreeToken/pull/131"},"132":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"f5b92547538a8571","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":6,"commits":9,"draft":false,"head_sha":"c0713e44eace3cacd02f27f13d0f6032f4bc86ae","merged":false,"number":132,"review_comments":0,"state":"open","title":"feat(rocm): add RDNA3 and RDNA4 runtime foundation","updated_at":"2026-09-02T10:48:26Z","url":"https://github.com/FlashML-org/FreeToken/pull/132"},"133":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"eb17018abe601f2c","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":11,"draft":true,"head_sha":"07a352a0ef5c37398f13ef893648dbbfd126f601","merged":false,"number":133,"review_comments":0,"state":"open","title":"fix(rocm): make TVM-FFI index and store JIT kernels portable to HIP","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/133"},"134":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"467c9a375cece285","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":11,"draft":true,"head_sha":"32dfb7bd123d935e256508fbc8c76bbaa9012226","merged":false,"number":134,"review_comments":0,"state":"open","title":"fix(rocm): gate CUDA-only optional backends on ROCm","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/134"},"135":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"3a0be6c359e61828","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":12,"draft":true,"head_sha":"f75a553002d1f78dda2b0a754b55b7676f8a33a2","merged":false,"number":135,"review_comments":0,"state":"open","title":"fix(rocm): route tensor parallel communication through RCCL","updated_at":"2026-09-03T17:04:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/135"},"136":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"c875bbbd1cb60d21","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":2,"commits":13,"draft":true,"head_sha":"7b3acf2f3d3d321ba7127d65168f9882d2a5d76f","merged":false,"number":136,"review_comments":0,"state":"open","title":"feat(rocm): enable native GGUF kernels on ROCm (validated on RDNA4)","updated_at":"2026-09-02T18:14:05Z","url":"https://github.com/FlashML-org/FreeToken/pull/136"},"137":{"base_sha":"f7c31e92dbf296de3a5bb1b9c5fcb58f988e3a07","body_hash":"a0597a23e4607628","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"5eec2582ce89376e3f5016d47ff73ca1b4e8d445","merged":false,"number":137,"review_comments":0,"state":"open","title":"feat(rocm): serve on AMD GPUs through the HIP toolchain","updated_at":"2026-08-26T09:03:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/137"},"27":{"base_sha":"0ab982f10905fa775962a4eddcb44caa50065251","body_hash":"e85637efb5176c06","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":1,"draft":false,"head_sha":"d76d5e0105235e9f13edd534fec3dfa86f25cb15","merged":false,"number":27,"review_comments":0,"state":"closed","title":"feat(moe): partial-pin serving to beat the Windows/WSL2 pinned-memory quota (--pin-exempt-layers)","updated_at":"2026-08-24T01:28:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/27"}},"version":1}

Technical baseline updated automatically: 2026-09-08T11:22:19+00:00. This comment is edited in place and does not represent a notification.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T15:02:31+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T16:56:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T18:31:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T19:01:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T20:49:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T22:45:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T01:53:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T03:13:46+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T04:55:02+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T07:09:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T09:01:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T10:51:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T11:11:49+00:00).

  • Новый явно отслеживаемый external issue: [Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14. High relevance.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8024:3880E4:B12B:25494:6A8D788F and timestamp 2026-08-25 11:12:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T13:13:08+00:00).

  • feat(rocm): add RDNA3 and RDNA4 runtime foundation: обновлены описание/review/discussion (comments 1→2, review 0→0).
  • Новый релевантный issue: Feature: Predictive Expert Offloading.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID F440:3A3DE2:D8F1C6:2D7E43E:6A8D950E and timestamp 2026-08-25 13:13:50 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T15:07:11+00:00).

  • FreeToken Roadmap (2026): comments 5→6.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0407:272BC6:1AC4A9F:5964A5E:6A8DAFBB and timestamp 2026-08-25 15:07:39 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T16:57:34+00:00).

  • Model catalog shows models the local machine cannot run (no capability pre-check before display): обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 283F:2B3BAA:2009A4A:6A360EB:6A8DC9A1 and timestamp 2026-08-25 16:58:09 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T18:58:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T20:47:37+00:00).

  • fix(deps): use PyTorch 2.13 to fix SM89 hangs: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7830:16ACDE:3C41178:CA29304:6A8DFF87 and timestamp 2026-08-25 20:48:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T22:46:42+00:00).

  • GGUF: support all quant types, add qwen35moe: новый commit dd48aacb9952a39d.
  • Maxritz/FreeToken-rocm-test:main: 45675e473a5616ec — Merge pull request FreeToken ROCm Watch — notification channel #1 from Castoff995/codex/gfx1201-offload-decode.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID CC18:2EB04F:4D5504F:100358CF:6A8E1B72 and timestamp 2026-08-25 22:47:14 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T01:59:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T03:19:34+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T04:57:21+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T07:10:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T09:04:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T10:52:44+00:00).

  • Новый релевантный pr: feat(models): add Qwen3-Next-80B-A3B support.
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 3→5).
  • Новый релиз: ROCm/TheRock therock-10.0.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B008:2BB36A:73A408:77B54F:6A8EC59E and timestamp 2026-08-26 10:53:18 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T13:18:13+00:00).

  • FreeToken Roadmap (2026): comments 6→7.
  • Feature request: AMD GPU support: обновлён (state open→open, comments 11→12).
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 5→7).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0400:15153F:A5D123:230714B:6A8EE7C0 and timestamp 2026-08-26 13:18:56 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T15:55:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-02T21:05:16+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-03T00:18:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-03T07:12:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-03T12:50:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-03T17:52:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-03T21:04:03+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-04T00:07:43+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-04T04:36:59+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-04T11:21:04+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-04T16:23:27+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-04T20:46:54+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T00:08:11+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T04:33:16+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T10:38:07+00:00).

  • fix(scheduler): hybrid radix hit corruption — GDN snapshot copy-on-donate + admission barriers: обновлён (state open→closed, comments 2→2).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID FC04:3435C7:32F6CAB:A62AF18:6A9BF137 and timestamp 2026-09-05 10:38:47 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T15:16:33+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T18:20:15+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T22:04:18+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-05T23:55:10+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T04:42:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T11:00:34+00:00).

  • [Feature Request] Support compressed-tensors per-channel FP8 checkpoints for Qwen3.5 MoE: обновлён (state open→open, comments 1→2).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 1440:B0E8F:3F8E4:CF3EB:6A9D47FB and timestamp 2026-09-06 11:01:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T15:29:35+00:00).

  • Новый релевантный issue: fix(server): allow overriding the distributed port.
  • feat(server): add a server-side thinking override: обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 980C:1453EF:5ED41CB:13373AF3:6A9D86FC and timestamp 2026-09-06 15:30:04 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T18:19:07+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0445:C9E59:3511EB0:ABF8AC9:6A9DAEBB and timestamp 2026-09-06 18:19:40 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T22:08:17+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID BBC9:82807:306F530:9C79979:6A9DE469 and timestamp 2026-09-06 22:08:41 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-06T23:56:41+00:00).

  • feat(kvcache): store the KV cache as fp8 e4m3 codes (--kv-cache-dtype…: обновлён (state open→open, comments 13→14).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8AAC:3C9966:DF5698:2CA3D46:6A9DFDD9 and timestamp 2026-09-06 23:57:13 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-07T04:45:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-07T12:37:24+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-07T18:44:43+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-07T22:51:23+00:00).

  • docs(models): qualify full GLM-5.3 on H200 Serverless: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B417:14B945:95ACBB:1DD3743:6A9F4013 and timestamp 2026-09-07 22:52:04 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 8, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-08T04:40:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 8, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-08T11:22:19+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant