{"data":{"slug":"fla-org-flash-linear-attention","name":"flash-linear-attention","tagline":"🚀 Efficient implementations for emerging model architectures","github_url":"https://github.com/fla-org/flash-linear-attention","owner":"fla-org","repo":"flash-linear-attention","owner_avatar_url":"https://avatars.githubusercontent.com/u/40835596?v=4","primary_language":"Python","stars":5568,"forks":661,"topics":["large-language-models","machine-learning-systems","natural-language-processing","sequence-modeling"],"archived":false,"github_pushed_at":"2026-08-17T10:13:08+00:00","maintenance_label":"Very active","stars_delta_30d":208,"url":"https://www.graphcanon.com/tools/fla-org-flash-linear-attention","markdown_url":"https://www.graphcanon.com/tools/fla-org-flash-linear-attention.md","api_url":"https://www.graphcanon.com/api/graphcanon/tools/fla-org-flash-linear-attention","graph_url":"https://www.graphcanon.com/api/graphcanon/graph?tool=fla-org-flash-linear-attention","description":"🚀 Efficient implementations for emerging model architectures","homepage_url":"https://github.com/fla-org/flash-linear-attention","license":"MIT","open_issues":98,"watchers":35,"ai_summary":"The repository fla-org/flash-linear-attention provides efficient implementations of linear attention mechanisms, focusing on large language models and sequence modeling within machine learning systems.","readme_excerpt":"## Installation\n\n\n\n`torch` lives in a backend extra (`[cuda]` / `[rocm]` / `[xpu]` / `[npu]` / `[cpu]`). CUDA is one command; other backends are two so `torch` (and the right `triton` flavor that `torch` pulls transitively) come from the PyTorch wheel index instead of PyPI:\n\n```sh\n\n---\n\n# you might have to first install `fla` via `pip install -e .` to enable its import\n$ python -m benchmarks.ops.run --op chunk_retention chunk_gla chunk_gdn flash_attn\n=================================================================================\n  Machine: NVIDIA GB200 | CUDA 12.9 | PyTorch 2.9.0+cu129.msh\n=================================================================================\n  fwd        B      T    H    D  op                            main[0a484709](ms)\n          -----------------------------------------------------------------------\n             1   8192   96  128  chunk_retention                            0.787\n                                 chunk_gla                                  1.765\n                                 chunk_gdn                                  1.265\n                                 flash_attn                                 3.753\n          -----------------------------------------------------------------------\n             2  16384   16  128  chunk_retention                            0.792\n                                 chunk_gla                                  1.445\n                                 chunk_gdn                                  1.029\n                                 flash_attn                                 5.035\n          -----------------------------------------------------------------------\n             4   2048   16  128  chunk_retention                            0.559\n                                 chunk_gla                                  0.514\n                                 chunk_gdn                                  0.753\n                                 flash_attn                                 0.346\n          -----------------------------------------------------------------------\n             4   4096   64  128  chunk_retention                            0.997\n                                 chunk_gla                                  2.251\n                                 chunk_gdn                                  1.581\n                                 flash_attn                                 2.560\n          -----------------------------------------------------------------------\n             8   1024    8   64  chunk_retention                            0.425\n                                 chunk_gla                                  0.358\n                                 chunk_gdn                                  0.631\n                                 flash_attn                                 0.157\n          -----------------------------------------------------------------------\n             8   2048   32  256  chunk_retention                            1.174\n                                 chunk_gla                                  2.897\n                                 chunk_gdn                                  1.831\n                                 flash_attn                                 1.408\n=================================================================================\n  fwdbwd     B      T    H    D  op                            main[0a484709](ms)\n          -----------------------------------------------------------------------\n             1   8192   96  128  chunk_retention                            2.618\n                                 chunk_gla                                  7.670\n                                 chunk_gdn                                  4.738\n                                 flash_attn                                15.371\n          -----------------------------------------------------------------------\n             2  16384   16  128  chunk_retention                            2.122\n                                 chunk_","github_created_at":"2023-12-20T06:50:18+00:00","created_at":"2026-07-07T17:34:59.13587+00:00","updated_at":"2026-08-17T12:01:22.077054+00:00","categories":[{"slug":"model-training","name":"Model Training","url":"https://www.graphcanon.com/categories/model-training","markdown_url":"https://www.graphcanon.com/categories/model-training.md","api_url":"https://www.graphcanon.com/api/graphcanon/categories/model-training"}],"tags":[{"slug":"large-language-models","name":"large language models"},{"slug":"machine-learning-systems","name":"machine-learning-systems"},{"slug":"natural-language-processing","name":"natural-language-processing"},{"slug":"sequence-modeling","name":"sequence-modeling"}],"trust":{"provenance":{"is_fork":false,"github_id":733802106,"owner_type":"Organization","methodology":"github_public_v1","parent_repo":null,"near_duplicate_slugs":[]},"computed_at":"2026-08-17T12:01:21.246Z","maintenance":{"label":"Very active","score":96,"methodology":"github_public_v1","releases_90d":2,"days_since_push":0,"last_release_at":"2026-07-27T18:25:39Z","stars_delta_30d":208,"open_issues_delta_30d":21},"security_summary":{"status":"no_lockfile","scanner":null,"low_count":0,"high_count":0,"last_scan_at":"2026-07-11T11:04:31.795Z","medium_count":0,"scan_profile":"none","critical_count":0}},"capability_facts":{"scan":{"source":"repo_scan","observed_at":"2026-08-17T12:01:21.754Z"},"languages":{"value":["python"],"source":"github.language+pyproject.toml","observed_at":"2026-08-17T12:01:21.754Z"},"license_spdx":{"value":"MIT","source":"github.license","observed_at":"2026-08-17T12:01:21.754Z"}},"decision_facts":{"hosting":null,"pricing":null,"requirements":null,"constraints":null,"when_to_use":["High-performance requirements with Nvidia GPUs where CUDA can offer significant speed-ups","Need to benchmark against multiple operations like chunk_retention and flash_attn"],"when_not_to_use":["Limited GPU hardware or no support for backend flavors like CUDA, ROCM, XPU, NPU, or CPU","Do not require linear attention mechanism in modeling large language models or sequence data"],"source":"enrich:decision_facts","observed_at":"2026-07-12T17:19:19.963Z"},"constraint_facets":null,"decision_summary":[{"label":"Adopt for","value":"Flash-linear-attention accelerates linear attention mechanisms in large language models, using CUDA for optimal performance."}]}}