Skip to content

FreeToken ROCm Watch — notification channel - #1

Draft
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log
Draft

Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log

Conversation

@Castoff995

Copy link
Copy Markdown
Owner

Этот PR служит постоянным каналом уведомлений для автоматической проверки GitHub каждые 2 часа. Его не нужно ревьюить, мержить или закрывать, пока слежка нужна.

Высший приоритет

Рабочие форки

  • PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf.
  • Maxritz/FreeToken-rocm-test:main.

Зависимости

  • ROCm/TheRock — Windows/RDNA4/gfx1201 wheels, PyTorch/HIP regressions and releases.
  • triton-lang/triton-windows — Windows AMD/HIP support and releases.
  • apache/tvm-ffi — Windows/HIP JIT and cache/toolchain changes.

Устойчивость модели

Также отслеживаются изменения, способные повлиять на первый токен и практический перевод: Qwen3.6/NVFP4, MoE offload, hybrid_radix, pinned/pageable residency, mapped device pointers, long-prefill/KV-cache hangs and engine crashes.

Уведомление публикуется только при существенном изменении: новый релевантный issue/PR, новый commit в ключевом PR/форке, изменение draft/merge/CI/state, новый релиз либо подтверждённый gfx1201/Windows результат. При отсутствии новостей комментариев не будет.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch запущен. Проверка выполняется каждые 2 часа; при отсутствии существенных изменений комментариев не будет.

Текущий P0 baseline:

Ключевые issues: FreeToken Roadmap (2026), ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please, Native Windows is classified as pin-uncapped, so ROCm/TheRock#112's per-layer residency never auto-engages, Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp.

Дополнительно отслеживаются fork commits, ROCm/TheRock, Triton Windows, TVM-FFI, PyTorch gfx1201, Qwen3.6/NVFP4, mapped host pointers, pin-budget, long-prefill и offload stability.

@github-actions

github-actions Bot commented Aug 24, 2026 •

Copy link
Copy Markdown

{"branches":{"FlashML-org/FreeToken:main":{"branch":"main","date":"2026-10-01T23:59:45Z","message":"fix(ple): fence disk staging against in-flight lookups (FlashML-org#588)","repo":"FlashML-org/FreeToken","sha":"d3512b43affe981465e03ee28cbd88f49c39b9aa","url":"FlashML-org@d3512b43affe981465e03ee28cbd88f49c39b9aa"},"Maxritz/FreeToken-rocm-test:main":{"branch":"main","date":"2026-09-20T16:29:33Z","message":"Merge pull request Maxritz#5 from uploadyours/fix/windows-rocm-install-and-qwen35moe-gguf","repo":"Maxritz/FreeToken-rocm-test","sha":"e8545daca33f54069eedd71c8afd8a2ff35380bc","url":"Maxritz@e8545daca33f54069eedd71c8afd8a2ff35380bc"},"PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf":{"branch":"gfx1200-moe-gguf","date":"2026-08-26T07:51:22Z","message":"docs: Gemma-4-26B-A4B QAT q4_0 GGUF results on gfx1200","repo":"PialGhosh2233/FreeToken-rocm-gfx1200","sha":"a338f49b93e2f098eeb3aa83423c9c5386c53ac4","url":"PialGhosh2233@a338f49b93e2f098eeb3aa83423c9c5386c53ac4"}},"discovered":{"FlashML-org/FreeToken#176%22:%7B%22body_hash%22:%2204e37c143183da8a%22,%22comments%22:4,%22kind%22:%22issue%22,%22number%22:176,%22repo%22:%22FlashML-org/FreeToken%22,%22state%22:%22open%22,%22title%22:%22Feature: Predictive Expert Offloading","updated_at":"2026-10-01T10:46:25Z","url":"https://github.com/FlashML-org/FreeToken/issues/176"},"FlashML-org/FreeToken#239":{"body_hash":"e0d9878137f1a275","comments":3,"kind":"issue","number":239,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 2050 4GB: Qwen3.6-35B-A3B-NVFP4 runs at ~21 tok/s with single-layer CPU MoE prefill buffer","updated_at":"2026-09-30T11:33:06Z","url":"https://github.com/FlashML-org/FreeToken/issues/239"},"FlashML-org/FreeToken#24":{"body_hash":"04716372ce11a2b6","comments":3,"kind":"pr","number":24,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(cuda): support Turing GPUs","updated_at":"2026-10-01T16:28:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/24"},"FlashML-org/FreeToken#260":{"body_hash":"e0794d434a8a819d","comments":9,"kind":"pr","number":260,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm: validate native gfx1151 serving on Strix Halo","updated_at":"2026-09-30T15:09:34Z","url":"https://github.com/FlashML-org/FreeToken/pull/260"},"FlashML-org/FreeToken#278":{"body_hash":"2454a1c035d22148","comments":3,"kind":"pr","number":278,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(moe): match the benchbw verdict to the served model's expert size","updated_at":"2026-09-24T02:21:21Z","url":"https://github.com/FlashML-org/FreeToken/pull/278"},"FlashML-org/FreeToken#302":{"body_hash":"53ce92fba4ae82bc","comments":4,"kind":"issue","number":302,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): add a server-side thinking override","updated_at":"2026-09-29T17:06:47Z","url":"https://github.com/FlashML-org/FreeToken/issues/302"},"FlashML-org/FreeToken#337":{"body_hash":"4ecdce5e41a523c6","comments":17,"kind":"pr","number":337,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(moe): NVMe disk tier for MoE expert banks","updated_at":"2026-09-25T12:22:16Z","url":"https://github.com/FlashML-org/FreeToken/pull/337"},"FlashML-org/FreeToken#384":{"body_hash":"a5cfef075e1a00c8","comments":3,"kind":"issue","number":384,"repo":"FlashML-org/FreeToken","state":"open","title":"Build on Windows?","updated_at":"2026-09-30T14:31:07Z","url":"https://github.com/FlashML-org/FreeToken/issues/384"},"FlashML-org/FreeToken#398":{"body_hash":"f27e8711e749cf12","comments":1,"kind":"pr","number":398,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): add ISO3/ISO4 KV-cache quantization (--kv-cache-iso)","updated_at":"2026-09-24T17:39:11Z","url":"https://github.com/FlashML-org/FreeToken/pull/398"},"FlashML-org/FreeToken#401":{"body_hash":"b1163ed10ceb8548","comments":1,"kind":"issue","number":401,"repo":"FlashML-org/FreeToken","state":"open","title":"--moe-cache-auto leaves no room for prefill: boots and serves decode, then the first 8k prefill OOMs and kills the worker (NVFP4 dense)","updated_at":"2026-09-21T22:09:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/401"},"FlashML-org/FreeToken#409":{"body_hash":"ae748f8c8ddac88b","comments":5,"kind":"issue","number":409,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.8-Flash-Next-NVFP4 cannot start on a 12 GB RTX 3060: ~9.9 GiB of unquantized (BF16) attention/embedding weights leave no room for MoE cache + KV","updated_at":"2026-09-30T14:30:40Z","url":"https://github.com/FlashML-org/FreeToken/issues/409"},"FlashML-org/FreeToken#434":{"body_hash":"c0c1c124faa09eb4","comments":0,"kind":"pr","number":434,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(rocm): add Windows RDNA GGUF serving support","updated_at":"2026-09-25T21:01:24Z","url":"https://github.com/FlashML-org/FreeToken/pull/434"},"FlashML-org/FreeToken#478":{"body_hash":"b1b6383f18f376af","comments":2,"kind":"issue","number":478,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen3_5_moe is TP=1-only because the model never matched the engine's per-rank GDN state contract — patch makes TP=2 work on 2x RX 9070 XT (ROCm)","updated_at":"2026-09-24T10:59:46Z","url":"https://github.com/FlashML-org/FreeToken/issues/478"},"FlashML-org/FreeToken#510":{"body_hash":"7b75ee086a6a09ce","comments":6,"kind":"issue","number":510,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature request / guidance: tensor-parallel across heterogeneous and idle consumer GPUs (quantized MoE experts) - a hobbyist request, with reference to FlashML-org#478","updated_at":"2026-09-23T03:46:07Z","url":"https://github.com/FlashML-org/FreeToken/issues/510"},"FlashML-org/FreeToken#523":{"body_hash":"d1c99273cd225e81","comments":9,"kind":"issue","number":523,"repo":"FlashML-org/FreeToken","state":"closed","title":"Failed to load kernel error on install","updated_at":"2026-09-22T08:09:46Z","url":"https://github.com/FlashML-org/FreeToken/issues/523"},"FlashML-org/FreeToken#534":{"body_hash":"265c914cd1ae1994","comments":3,"kind":"issue","number":534,"repo":"FlashML-org/FreeToken","state":"open","title":"FP8 block-quantized MoE models have no usable kernel under moe_strategy=offload (0.1.3)","updated_at":"2026-09-27T09:44:33Z","url":"https://github.com/FlashML-org/FreeToken/issues/534"},"FlashML-org/FreeToken#535":{"body_hash":"d58b10217ef3c43c","comments":0,"kind":"pr","number":535,"repo":"FlashML-org/FreeToken","state":"open","title":"ci(rocm): add ROCm 10.0.0 Dockerfile and validation workflow","updated_at":"2026-09-22T10:16:50Z","url":"https://github.com/FlashML-org/FreeToken/pull/535"},"FlashML-org/FreeToken#538":{"body_hash":"aa31212e0c6a4476","comments":3,"kind":"issue","number":538,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 3090 device loss (Xid 79) at --max-prefill-length 8192 in offload mode — known limitation, or host-specific?","updated_at":"2026-09-30T14:30:39Z","url":"https://github.com/FlashML-org/FreeToken/issues/538"},"FlashML-org/FreeToken#541":{"body_hash":"4de9324ef8bd9366","comments":0,"kind":"issue","number":541,"repo":"FlashML-org/FreeToken","state":"open","title":"AMD Roadmap 2026 Q4-2027 Q1","updated_at":"2026-09-24T06:04:57Z","url":"https://github.com/FlashML-org/FreeToken/issues/541"},"FlashML-org/FreeToken#542":{"body_hash":"e9e73387e03723cd","comments":1,"kind":"issue","number":542,"repo":"FlashML-org/FreeToken","state":"open","title":"Backend supervisor: TypeError: unsupported operand type(s) for /: 'WindowsPath' and 'NoneType'","updated_at":"2026-09-24T06:40:02Z","url":"https://github.com/FlashML-org/FreeToken/issues/542"},"FlashML-org/FreeToken#543":{"body_hash":"f09291c3bad87035","comments":3,"kind":"issue","number":543,"repo":"FlashML-org/FreeToken","state":"closed","title":"RuntimeError: flashinfer-cubin version (0.7.0) does not match flashinfer version (0.6.18.post1)","updated_at":"2026-09-24T05:54:26Z","url":"https://github.com/FlashML-org/FreeToken/issues/543"},"FlashML-org/FreeToken#544":{"body_hash":"a01bd957aa12585d","comments":1,"kind":"issue","number":544,"repo":"FlashML-org/FreeToken","state":"closed","title":"[engine bug] Decode throughput degrades from 60-120 to 11-25 tok/s over runtime; engine-global, cumulative, only reset by restart","updated_at":"2026-09-27T09:58:19Z","url":"https://github.com/FlashML-org/FreeToken/issues/544"},"FlashML-org/FreeToken#553":{"body_hash":"d8290e64b8426b8a","comments":0,"kind":"pr","number":553,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): publish cumulative prefill and decode timing on /v1/stats","updated_at":"2026-09-25T22:49:40Z","url":"https://github.com/FlashML-org/FreeToken/pull/553"},"FlashML-org/FreeToken#554":{"body_hash":"bc31b71b6c01fa34","comments":1,"kind":"issue","number":554,"repo":"FlashML-org/FreeToken","state":"closed","title":"Linux engine install fails on beta update (sglang-kernel hash mismatch, flashinfer version mismatch) and leaves no engine installed","updated_at":"2026-09-27T02:12:45Z","url":"https://github.com/FlashML-org/FreeToken/issues/554"},"FlashML-org/FreeToken#556":{"body_hash":"78df67c573b9e18a","comments":0,"kind":"issue","number":556,"repo":"FlashML-org/FreeToken","state":"open","title":"[Desktop] weights failed to load: Qwen3.6-27B NVFP4","updated_at":"2026-09-27T13:55:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/556"},"FlashML-org/FreeToken#561":{"body_hash":"effac85bee1affd0","comments":2,"kind":"issue","number":561,"repo":"FlashML-org/FreeToken","state":"open","title":"Bug: AssertionError: Not enough memory for KV cache when serving Qwen3.8-27B-NVFP4 on Windows","updated_at":"2026-10-02T12:42:09Z","url":"https://github.com/FlashML-org/FreeToken/issues/561"},"FlashML-org/FreeToken#562":{"body_hash":"5349c6eb6b996b0f","comments":0,"kind":"pr","number":562,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): charge the attention workspace in moe-cache-auto sizing","updated_at":"2026-09-28T07:52:55Z","url":"https://github.com/FlashML-org/FreeToken/pull/562"},"FlashML-org/FreeToken#564":{"body_hash":"af7532f987243afd","comments":0,"kind":"pr","number":564,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): do not auto-select qwen3 parser for instruct-2507","updated_at":"2026-09-28T21:28:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/564"},"FlashML-org/FreeToken#566":{"body_hash":"2c540d2c236623f4","comments":0,"kind":"issue","number":566,"repo":"FlashML-org/FreeToken","state":"closed","title":"QSA block top-k runs a 1M-token window on one program per row","updated_at":"2026-09-29T23:29:18Z","url":"https://github.com/FlashML-org/FreeToken/issues/566"},"FlashML-org/FreeToken#567":{"body_hash":"6af3e9c4ead76444","comments":0,"kind":"issue","number":567,"repo":"FlashML-org/FreeToken","state":"open","title":"A stream that is silent through a long prefill is dropped by Node clients and prefilled for nobody","updated_at":"2026-09-29T17:06:19Z","url":"https://github.com/FlashML-org/FreeToken/issues/567"},"FlashML-org/FreeToken#568":{"body_hash":"f836f522139aa72f","comments":0,"kind":"issue","number":568,"repo":"FlashML-org/FreeToken","state":"open","title":"Serving Qwen3.8-Flash-Next's 1M-token window on one 24 GB card","updated_at":"2026-09-29T17:06:55Z","url":"https://github.com/FlashML-org/FreeToken/issues/568"},"FlashML-org/FreeToken#569":{"body_hash":"194b687889102bba","comments":0,"kind":"issue","number":569,"repo":"FlashML-org/FreeToken","state":"open","title":"A hybrid model's cached prefix cannot be resumed far back: no GDN snapshot survives below a prompt's last chunk","updated_at":"2026-09-29T17:06:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/569"},"FlashML-org/FreeToken#570":{"body_hash":"ccadf4bf679191a5","comments":0,"kind":"issue","number":570,"repo":"FlashML-org/FreeToken","state":"open","title":"On Windows the engine sizes its pools as if no other process held any of the card","updated_at":"2026-09-29T17:06:25Z","url":"https://github.com/FlashML-org/FreeToken/issues/570"},"FlashML-org/FreeToken#571":{"body_hash":"a819c75f8b1f5624","comments":1,"kind":"pr","number":571,"repo":"FlashML-org/FreeToken","state":"closed","title":"perf(qsa): reduce block top-k candidates in levels past 16 splits","updated_at":"2026-09-30T14:30:56Z","url":"https://github.com/FlashML-org/FreeToken/pull/571"},"FlashML-org/FreeToken#572":{"body_hash":"57db1db2add83ffd","comments":0,"kind":"pr","number":572,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): keep a silent stream alive and notice a client that left","updated_at":"2026-10-01T06:59:25Z","url":"https://github.com/FlashML-org/FreeToken/pull/572"},"FlashML-org/FreeToken#573":{"body_hash":"d90bc09fa5c00943","comments":3,"kind":"pr","number":573,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(rotary): size the rope table for YaRN and add --hf-overrides","updated_at":"2026-10-01T07:40:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/573"},"FlashML-org/FreeToken#574":{"body_hash":"db40b6318032a903","comments":0,"kind":"pr","number":574,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(engine): --vram-reserve-mb keeps VRAM free at the largest prefill","updated_at":"2026-10-01T09:39:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/574"},"FlashML-org/FreeToken#575":{"body_hash":"e403c612f5344021","comments":0,"kind":"pr","number":575,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): build the extensions and JIT kernels with MSVC","updated_at":"2026-10-01T09:39:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/575"},"FlashML-org/FreeToken#577":{"body_hash":"fb43cf2047e6f67b","comments":3,"kind":"pr","number":577,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): keep prefill-chunk GDN checkpoints in a pinned host bank","updated_at":"2026-10-03T04:38:11Z","url":"https://github.com/FlashML-org/FreeToken/pull/577"},"FlashML-org/FreeToken#578":{"body_hash":"05936d233f46d902","comments":0,"kind":"pr","number":578,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(moe): dequant nvfp4 prefill experts by bit placement and load activations contiguously","updated_at":"2026-09-30T14:30:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/578"},"FlashML-org/FreeToken#579":{"body_hash":"8b996dedc8b58ce6","comments":0,"kind":"issue","number":579,"repo":"FlashML-org/FreeToken","state":"open","title":"An offloaded prefill streams every expert of each layer, however short the chunk","updated_at":"2026-09-30T14:30:36Z","url":"https://github.com/FlashML-org/FreeToken/issues/579"},"FlashML-org/FreeToken#580":{"body_hash":"d51a9c143d68f694","comments":0,"kind":"pr","number":580,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): serve over loopback ZMQ and a selector event loop","updated_at":"2026-10-02T18:25:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/580"},"FlashML-org/FreeToken#581":{"body_hash":"31d2cefc49b9a275","comments":0,"kind":"pr","number":581,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): read checkpoints without O_DIRECT, posix_fadvise or PROT_READ","updated_at":"2026-10-01T09:39:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/581"},"FlashML-org/FreeToken#583":{"body_hash":"d68ecdc8bd0baf55","comments":0,"kind":"pr","number":583,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): size memory pools against the VRAM other processes leave free on Windows","updated_at":"2026-10-01T09:39:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/583"},"FlashML-org/FreeToken#584":{"body_hash":"00499fe994d84ba6","comments":0,"kind":"issue","number":584,"repo":"FlashML-org/FreeToken","state":"open","title":"The computer on the local area network cannot be accessed","updated_at":"2026-09-30T15:54:22Z","url":"https://github.com/FlashML-org/FreeToken/issues/584"},"FlashML-org/FreeToken#585":{"body_hash":"bc29701a8b518529","comments":0,"kind":"pr","number":585,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(linear): run a single-row bf16 projection as one GEMV","updated_at":"2026-10-01T09:39:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/585"},"FlashML-org/FreeToken#587":{"body_hash":"7e6929aa54eb0c69","comments":1,"kind":"pr","number":587,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(rocm): run on RDNA3/RDNA4 with torch 2.14/2.15 and ROCm 7.14/10","updated_at":"2026-10-01T15:13:57Z","url":"https://github.com/FlashML-org/FreeToken/pull/587"},"FlashML-org/FreeToken#588":{"body_hash":"611f86536843cd1d","comments":0,"kind":"pr","number":588,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(ple): fence disk staging against in-flight lookups","updated_at":"2026-10-01T23:59:45Z","url":"https://github.com/FlashML-org/FreeToken/pull/588"},"FlashML-org/FreeToken#589":{"body_hash":"3545d2d7d7856bb6","comments":0,"kind":"pr","number":589,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(checkpoint): resolve HF repo Ids before conversion","updated_at":"2026-10-02T08:52:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/589"},"FlashML-org/FreeToken#590":{"body_hash":"05469569baac50e7","comments":0,"kind":"pr","number":590,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(model): fuse hc combine with the next block's RMSNorm","updated_at":"2026-10-02T22:44:15Z","url":"https://github.com/FlashML-org/FreeToken/pull/590"}},"errors":["dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 9C31:2A54B5:1DCC3:63ABB:6AC090E8 and timestamp 2026-10-03 05:21:44 UTC. For more on scraping GitHub and how it may affect your rights, please review our Terms of Service (https://docs.github.com/en/site-policy/github-terms/github-terms-of-service)"],"external_tracked_issues":{"ROCm/legacy-rocm-build#6461":{"body_hash":"0ac6e80ee9b489cd","comments":6,"kind":"issue","number":6461,"relevance":"high","relevance_reason":"Windows + gfx1201 + hipBLASLt/rocBLAS sequence/state-dependent GEMM failure","repo":"ROCm/legacy-rocm-build","state":"closed","title":"[Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14","updated_at":"2026-09-23T17:39:44Z","url":"https://github.com/ROCm/legacy-rocm-build/issues/6461"}},"last_checked":"2026-10-03T05:21:21+00:00","releases":{"FlashML-org/FreeToken":{"draft":false,"name":"v0.1.3","prerelease":false,"published_at":"2026-09-16T01:02:33Z","tag":"v0.1.3","url":"https://github.com/FlashML-org/FreeToken/releases/tag/v0.1.3"},"ROCm/ROCm":{"draft":false,"name":"ROCm 7.14.0 Release","prerelease":false,"published_at":"2026-07-16T03:28:58Z","tag":"rocm-7.14.0","url":"https://github.com/ROCm/legacy-rocm-build/releases/tag/rocm-7.14.0"},"ROCm/TheRock":{"draft":false,"name":"ROCm Core SDK 10.0.0 Release","prerelease":false,"published_at":"2026-08-26T10:03:34Z","tag":"therock-10.0","url":"https://github.com/ROCm/TheRock/releases/tag/therock-10.0"},"apache/tvm-ffi":{"draft":false,"name":"v0.1.14-post1","prerelease":false,"published_at":"2026-09-22T12:36:48Z","tag":"v0.1.14-post1","url":"https://github.com/apache/tvm-ffi/releases/tag/v0.1.14-post1"},"ggml-org/llama.cpp":{"draft":false,"name":"v0.5.0","prerelease":false,"published_at":"2026-09-23T20:50:06Z","tag":"v0.5.0","url":"https://github.com/ggml-org/llama.cpp/releases/tag/v0.5.0"},"triton-lang/triton-windows":{"draft":false,"name":"v3.8.0-windows.post29","prerelease":false,"published_at":"2026-09-28T22:00:36Z","tag":"v3.8.0-windows.post29","url":"https://github.com/triton-lang/triton-windows/releases/tag/v3.8.0-windows.post29"}},"tracked_issues":{"110":{"body_hash":"d6672f16a90f2854","comments":2,"kind":"issue","number":110,"repo":"FlashML-org/FreeToken","state":"open","title":"Unhandled CUDA OOM in prefill expert workspace kills the engine; server keeps accepting requests that never return (root cause behind FlashML-org#20-style headless state; likely also FlashML-org#72)","updated_at":"2026-09-05T23:28:27Z","url":"https://github.com/FlashML-org/FreeToken/issues/110"},"111":{"body_hash":"b01b977d143435c7","comments":3,"kind":"issue","number":111,"repo":"FlashML-org/FreeToken","state":"open","title":"Requests longer than the KV pool are queued forever with no error — and --moe-cache-auto leaves only ~8k tokens of KV on a 96GB GPU","updated_at":"2026-08-31T02:09:35Z","url":"https://github.com/FlashML-org/FreeToken/issues/111"},"120":{"body_hash":"a7caa8c0bca18470","comments":1,"kind":"issue","number":120,"repo":"FlashML-org/FreeToken","state":"open","title":"Native Windows is classified as pin-uncapped, so FlashML-org#112's per-layer residency never auto-engages","updated_at":"2026-08-24T03:04:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/120"},"122":{"body_hash":"4d42515b782747ed","comments":6,"kind":"issue","number":122,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp","updated_at":"2026-08-27T07:18:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/122"},"123":{"body_hash":"09dd1b9b8cf6560f","comments":1,"kind":"issue","number":123,"repo":"FlashML-org/FreeToken","state":"closed","title":"Request hang (silent, zero-log) with hybrid_radix cache + moe-backend offload + nvfp4 triton backend — reproduced on 2 independent models, not explained by FlashML-org#110","updated_at":"2026-08-29T05:13:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/123"},"124":{"body_hash":"64a1de8500f135a3","comments":0,"kind":"issue","number":124,"repo":"FlashML-org/FreeToken","state":"closed","title":"NVFP4 checkpoints fail to load: model.safetensors.index.json is not downloaded, but the NVFP4 bank loader requires it","updated_at":"2026-09-02T02:43:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/124"},"79":{"body_hash":"0af406c7de3a9f04","comments":17,"kind":"issue","number":79,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken Roadmap (2026)","updated_at":"2026-09-23T19:39:17Z","url":"https://github.com/FlashML-org/FreeToken/issues/79"},"82":{"body_hash":"ff59a7ff00722b01","comments":19,"kind":"issue","number":82,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please","updated_at":"2026-09-15T15:50:45Z","url":"https://github.com/FlashML-org/FreeToken/issues/82"}},"tracked_prs":{"112":{"base_sha":"f0abe587a11cca53bb3c37a9596fad24973ace62","body_hash":"aa539235301fea3d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":3,"draft":false,"head_sha":"831d38a66bc45543411078c6805de8c42e7603fa","merged":true,"number":112,"review_comments":0,"state":"closed","title":"feat(moe): per-layer host-bank residency","updated_at":"2026-08-24T00:39:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/112"},"118":{"base_sha":"e0a3bbc04652ec0622d932adcbf2772848e3c2e2","body_hash":"d73a76c00cdb2f94","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"6241178a7550e5a0ffadd85f0eb04af0160f9988","merged":false,"number":118,"review_comments":0,"state":"open","title":"fix(scheduler): clamp admission to the actual KV pool so oversized prompts fail loudly","updated_at":"2026-08-24T00:52:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/118"},"125":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"793491958f083651","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"cb44bdeedb7ea6ed2b37c5c49864ad40065e1985","merged":false,"number":125,"review_comments":0,"state":"open","title":"test(pinned): use mapped memory for UVA pointer check","updated_at":"2026-08-24T05:48:44Z","url":"https://github.com/FlashML-org/FreeToken/pull/125"},"129":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"d5c4ac29d87557fc","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":1,"draft":false,"head_sha":"d30726e006b2708d4fbfead120985bc23c935541","merged":false,"number":129,"review_comments":0,"state":"closed","title":"fix(download): include json files when fetching weights, so NVFP4's index.json is no longer silently skipped","updated_at":"2026-09-02T02:45:39Z","url":"https://github.com/FlashML-org/FreeToken/pull/129"},"131":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"33bc52d171e8ca00","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":36,"draft":false,"head_sha":"bb432e8c473c557cdef6517abccf0c129bd8c544","merged":false,"number":131,"review_comments":0,"state":"open","title":"GGUF: support all quant types, add qwen35moe","updated_at":"2026-08-29T22:27:37Z","url":"https://github.com/FlashML-org/FreeToken/pull/131"},"132":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"f5b92547538a8571","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":11,"draft":false,"head_sha":"c6be4afb541b34f36fb811cd2f6efc01784e9e5d","merged":true,"number":132,"review_comments":7,"state":"closed","title":"feat(rocm): add RDNA3 and RDNA4 runtime foundation","updated_at":"2026-09-26T00:49:46Z","url":"https://github.com/FlashML-org/FreeToken/pull/132"},"133":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"eb17018abe601f2c","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":11,"draft":true,"head_sha":"9ec8271ab0b824246944f7f23c9e819185ac44b3","merged":false,"number":133,"review_comments":0,"state":"open","title":"fix(rocm): make TVM-FFI index and store JIT kernels portable to HIP","updated_at":"2026-09-21T03:01:45Z","url":"https://github.com/FlashML-org/FreeToken/pull/133"},"134":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"467c9a375cece285","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":11,"draft":true,"head_sha":"c4f4a36e945a7c13f4f5b500eb2e6a8e07183d4c","merged":false,"number":134,"review_comments":0,"state":"open","title":"fix(rocm): gate CUDA-only optional backends on ROCm","updated_at":"2026-09-21T03:01:49Z","url":"https://github.com/FlashML-org/FreeToken/pull/134"},"135":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"3a0be6c359e61828","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":12,"draft":true,"head_sha":"3675d03e17110adfcaa532cc965e5c79895cc8f3","merged":false,"number":135,"review_comments":0,"state":"open","title":"fix(rocm): route tensor parallel communication through RCCL","updated_at":"2026-09-21T03:01:52Z","url":"https://github.com/FlashML-org/FreeToken/pull/135"},"136":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"c875bbbd1cb60d21","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":5,"commits":13,"draft":true,"head_sha":"76bf2ac398464f8762148356b4a4019e3327b2a9","merged":false,"number":136,"review_comments":0,"state":"closed","title":"feat(rocm): enable native GGUF kernels on ROCm (validated on RDNA4)","updated_at":"2026-09-24T06:02:29Z","url":"https://github.com/FlashML-org/FreeToken/pull/136"},"137":{"base_sha":"f7c31e92dbf296de3a5bb1b9c5fcb58f988e3a07","body_hash":"a0597a23e4607628","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"5eec2582ce89376e3f5016d47ff73ca1b4e8d445","merged":false,"number":137,"review_comments":0,"state":"open","title":"feat(rocm): serve on AMD GPUs through the HIP toolchain","updated_at":"2026-08-26T09:03:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/137"},"27":{"base_sha":"0ab982f10905fa775962a4eddcb44caa50065251","body_hash":"e85637efb5176c06","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":1,"draft":false,"head_sha":"d76d5e0105235e9f13edd534fec3dfa86f25cb15","merged":false,"number":27,"review_comments":0,"state":"closed","title":"feat(moe): partial-pin serving to beat the Windows/WSL2 pinned-memory quota (--pin-exempt-layers)","updated_at":"2026-08-24T01:28:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/27"}},"version":1}

Technical baseline updated automatically: 2026-10-03T05:21:21+00:00. This comment is edited in place and does not represent a notification.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T15:02:31+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T16:56:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T18:31:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T19:01:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T20:49:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T22:45:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T01:53:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T03:13:46+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T04:55:02+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T07:09:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T09:01:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T10:51:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T11:11:49+00:00).

  • Новый явно отслеживаемый external issue: [Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14. High relevance.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8024:3880E4:B12B:25494:6A8D788F and timestamp 2026-08-25 11:12:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T13:13:08+00:00).

  • feat(rocm): add RDNA3 and RDNA4 runtime foundation: обновлены описание/review/discussion (comments 1→2, review 0→0).
  • Новый релевантный issue: Feature: Predictive Expert Offloading.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID F440:3A3DE2:D8F1C6:2D7E43E:6A8D950E and timestamp 2026-08-25 13:13:50 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T15:07:11+00:00).

  • FreeToken Roadmap (2026): comments 5→6.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0407:272BC6:1AC4A9F:5964A5E:6A8DAFBB and timestamp 2026-08-25 15:07:39 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T16:57:34+00:00).

  • Model catalog shows models the local machine cannot run (no capability pre-check before display): обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 283F:2B3BAA:2009A4A:6A360EB:6A8DC9A1 and timestamp 2026-08-25 16:58:09 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T18:58:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T20:47:37+00:00).

  • fix(deps): use PyTorch 2.13 to fix SM89 hangs: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7830:16ACDE:3C41178:CA29304:6A8DFF87 and timestamp 2026-08-25 20:48:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T22:46:42+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T01:59:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T03:19:34+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T04:57:21+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T07:10:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T09:04:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T10:52:44+00:00).

  • Новый релевантный pr: feat(models): add Qwen3-Next-80B-A3B support.
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 3→5).
  • Новый релиз: ROCm/TheRock therock-10.0.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B008:2BB36A:73A408:77B54F:6A8EC59E and timestamp 2026-08-26 10:53:18 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T13:18:13+00:00).

  • FreeToken Roadmap (2026): comments 6→7.
  • Feature request: AMD GPU support: обновлён (state open→open, comments 11→12).
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 5→7).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0400:15153F:A5D123:230714B:6A8EE7C0 and timestamp 2026-08-26 13:18:56 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T15:55:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-25T23:19:03+00:00).

  • Новый релевантный pr: feat(server): publish cumulative prefill and decode timing on /v1/stats.
  • Новый релевантный pr: feat(rocm): add Windows RDNA GGUF serving support.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID FC07:25842E:48B3A9:52BDEB:6AB70185 and timestamp 2026-09-25 23:19:33 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-26T05:01:41+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-26T11:28:13+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 9789:128AF0:22A4D9E:72C2154:6AB7AC64 and timestamp 2026-09-26 11:28:36 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-26T16:25:48+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 3C16:26608B:1FFAE05:69306BE:6AB7F234 and timestamp 2026-09-26 16:26:28 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-26T21:13:10+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-27T00:39:11+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 2C46:28F51F:4F287B3:1053FF4C:6AB865D5 and timestamp 2026-09-27 00:39:50 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-27T08:13:33+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-27T14:01:52+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-27T18:26:27+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 9008:334251:575C340:11FFFEF2:6AB95FE9 and timestamp 2026-09-27 18:26:49 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-27T23:04:37+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 080E:19A269:8AB6649:1C900D51:6AB9A11D and timestamp 2026-09-27 23:05:01 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-28T05:27:08+00:00).

  • Новый релевантный issue: Bug: AssertionError: Not enough memory for KV cache when serving Qwen3.8-27B-NVFP4 on Windows.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 04CC:3FEAD7:474951C:EA824ED:6AB9FAD3 and timestamp 2026-09-28 05:27:47 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-28T13:59:44+00:00).

  • Новый релевантный pr: fix(engine): charge the attention workspace in moe-cache-auto sizing.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 5006:2514C6:775834:18A028D:6ABA72FA and timestamp 2026-09-28 14:00:27 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-28T20:34:35+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7843:155FEE:1AE9A2:582328:6ABACF75 and timestamp 2026-09-28 20:35:01 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-29T01:59:31+00:00).

  • Новый релевантный pr: fix(server): do not auto-select qwen3 parser for instruct-2507.
  • Новый релиз: triton-lang/triton-windows v3.8.0-windows.post29.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID D819:38A079:824985:1B0AC4E:6ABB1BB3 and timestamp 2026-09-29 02:00:19 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-29T08:33:54+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7C3C:108FAB:186ED11:509BF18:6ABB780B and timestamp 2026-09-29 08:34:19 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-29T16:31:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-29T22:17:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T05:35:41+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T12:38:14+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T19:22:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T23:52:30+00:00).

  • feat(rotary): size the rope table for YaRN and add --hf-overrides: обновлён (state open→open, comments 0→1).
  • Feature: Predictive Expert Offloading: обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID DC21:1F03:783509:18CA8FE:6ABDA0E2 and timestamp 2026-09-30 23:53:06 UTC. F…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T05:59:01+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 280E:0C59:10BD24:181AE3:6ABDF6C6 and timestamp 2026-10-01 05:59:34 UTC. Fo…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T13:20:11+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T19:33:14+00:00).

  • Новый релевантный pr: fix(cuda): support Turing GPUs.
  • Новый релевантный pr: feat(rocm): run on RDNA3/RDNA4 with torch 2.14/2.15 and ROCm 7.14/10.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 841B:2FD95D:8690D0:1B9F020:6ABEB5A0 and timestamp 2026-10-01 19:33:52 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T23:54:12+00:00).

  • Новый релевантный pr: fix(ple): fence disk staging against in-flight lookups.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B7C9:2407CC:1CB4D4:262F99:6ABEF2BD and timestamp 2026-10-01 23:54:37 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T05:41:20+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T12:39:16+00:00).

  • Новый релевантный pr: fix(checkpoint): resolve HF repo Ids before conversion.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 3805:2B00BF:D3AB8:103004:6ABFA614 and timestamp 2026-10-02 12:39:48 UTC. F…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T19:21:01+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T23:48:42+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-03T05:21:21+00:00).

  • feat(kvcache): keep prefill-chunk GDN checkpoints in a pinned host bank: обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 9C31:2A54B5:1DCC3:63ABB:6AC090E8 and timestamp 2026-10-03 05:21:44 UTC. Fo…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant