摘要

JustFit 在 MLX runtime 中组合压缩 KV 执行、组件换入换出和保留状态的 serving 切换。在 24 GiB M4 Pro MacBook 上,Qwen3.8-27B MXFP4 连续三次完成 196K 输入加 16K 输出。这把单请求可完成上下文提高到论文所列 mlx-vlm 基线的 6.93 倍。极限上下文一次约需 103 分钟,因此结果主要证明容量,不代表交互速度。

为什么重要
对本地 agent 团队来说,内存调度能在不改变模型权重量化的前提下支撑更长会话。实际用途更适合异步导入与前缀复用,而不是反复冷启动 200K prompt。应先在自己的硬件上复现公开分支,再把论文边界当作部署目标。
技术细节
硬件 24 GiB M4 Pro MacBook
模型 Qwen3.8-27B MXFP4
容量 196,608 输入 + 16,384 输出 token;共 212,992 个位置
相对基线 单请求完成上下文为 mlx-vlm 基线的 6.93 倍
速度 冷预填充约 48 分钟;极限下 4.99 tok/s;全程约 103 分钟
可复现性 公开分支持续变化;历史实验环境记录不完整
标签
local-inferenceMLXlong-contextKV-cacheApple-Silicon