清華大学MADSys研究室とApproaching.AIらが開発する推論・微調整最適化フレームワークKTransformersが、GitHub Trendingで+328★/日のペースで急上昇し、総18,294★に達した。
v0.6.1を2026年4月30日に公開し、推論エンジン(kt-kernel)とファインチューニングのドキュメントを分離・刷新した。CPUとGPUを併用して巨大なMoEモデルを中規模ハードで動かす設計が核で、使用頻度の高いエキスパートをGPUに、低いものをCPUメモリに配置する。これによりDeepSeek-V3/R1の微調整をRTX 4090×4枚(約80GB)で実行でき、従来のZeRO-Offload比で6〜12倍高速な学習を掲げる。
GLM-5.2、MiniMax-M3、DeepSeek-V4-Flashといった公開直後のモデルへ当日対応する運用が注目を後押ししている。GPUメモリ量が微調整の可否を決める前提が動き、GPU予算が限られる実装現場やオンプレ完結を望む事業者にとって選択肢が増えた。
【保存版】 DeepSeek V4 Flash が RTX Pro 6000 × 2枚 + 256GB RAM で1Mコンテキスト動作👀 MoE レイヤーの Expert を GPU と CPU メモリに分散オフロードするKTransformersを使った構成 ・ネイティブ混合精度 FP4 + FP8 でそのまま実行 ・GPU 側は 20.81GB 以上確保