智谱 GLM-4.7-Flash · Q4_K_M
代码 / Agent · GLM-4.7-Flash · Q4_K_M
模型文件由第三方社区提供,贤紫精选模型市场仅提供索引与下载便利;使用请遵守该模型开源协议。
GLM-4.7-Flash 社区 UD-Q4_K_XL GGUF(Unsloth):智谱 30B-A3B MoE 的本地推理权重,面向 代码、Agent 与通用对话,适配 自研底座、小紫 AI 工作台、贤紫 AI 代码编辑器。
本 SKU 规格
| 项目 | 说明 |
|---|---|
| 文件名 | GLM-4.7-Flash-UD-Q4_K_XL.gguf |
| 量化 | UD-Q4_K_XL(Unsloth 推荐档,体积与 Agent/代码表现较均衡) |
| 体积 | 约 16.3 GB |
| 基座 | zai-org/GLM-4.7-Flash 系 · 纯文本 MoE(勿与数百 GB 级完整 GLM-4.7 混淆) |
| 显存建议 | 16 GB 起(上下文、并行与底座设置会浮动) |
| 内存建议 | 32 GB+ 系统内存;拉长上下文时预留更多 |
| 后端 | 较新版本 llama.cpp / llama-server 或底座文档中的等价本地服务 |
适合做什么
- 代码理解、改仓 Agent、Ask 调试(本地 SRX + 本模型,数据不出域)
- 轻量工具调用、通用对话(取决于底座版本与采样/解析配置)
- 内网 / 本机闭环:权重落盘本地,适合研发环境
不太适合:无独显或显存明显不足仍强行拉满上下文;可改选同仓 更小 UD 档,或使用工作台 云端 API。
本地提示(Unsloth 参考)
- 采样:
--temp 1.0 --top-p 0.95 --min-p 0.01 - 若重复/循环:试
--dry-multiplier 1.1(仍异常可试1.5) - 上下文
--ctx-size建议从 16K 起按显存逐步上调 - 请保持 llama.cpp / 底座 为文档要求的较新版本(Flash 架构与 GGUF 对后端敏感)
与同系列其它量化
| 需求 | 说明 |
|---|---|
| 更小体积 | 同仓库 UD-Q3_K_XL 等(精选市场另开 SKU) |
| 更高质量 | UD-Q5_K_XL 等(显存要求更高) |
| 不推荐 | Unsloth 已不建议的 非 UD 老档(如单独 Q4_K_M)——请优先 UD 系列 |
本地 GGUF 与云端「glm-4.7-flash」
| 本条目(GGUF) | 会员 / API 云端 | |
|---|---|---|
| 权重 | 本机磁盘 | 厂商云端 |
| 数据 | 内网 / 本机闭环 | 经 API 出网 |
| 适用 | 自管显卡、离线研发 | 即开即用、免维护 |
二者可在同一工作台 本地与云端切换。
下载与合规
见右侧 「下载」(免登录,将跳转至魔搭等第三方源)。
- 上游:ModelScope ·
unsloth/GLM-4.7-Flash-GGUF(Unsloth 社区量化) - 开源协议:MIT
- 精选含义:在消费级硬件下 值得试用 的推荐档,非官方排名或性能担保
下载中断? 单文件约 16 GB,请用稳定网络或支持断点续传的方式;完成后核对体积。
链失效? 反馈运营,后台会 更新直链(model_id 不变)。