M 贤紫精选模型市场
返回模型市场

智谱 GLM-4.7-Flash · Q4_K_M

代码 / Agent · GLM-4.7-Flash · Q4_K_M

智谱 GLM-4.7 Flash GGUF 代码

GLM-4.7-Flash 社区 UD-Q4_K_XL GGUF(Unsloth):智谱 30B-A3B MoE 的本地推理权重,面向 代码、Agent 与通用对话,适配 自研底座、小紫 AI 工作台、贤紫 AI 代码编辑器。

本 SKU 规格

项目说明
文件名GLM-4.7-Flash-UD-Q4_K_XL.gguf
量化UD-Q4_K_XL(Unsloth 推荐档,体积与 Agent/代码表现较均衡)
体积约 16.3 GB
基座zai-org/GLM-4.7-Flash 系 · 纯文本 MoE(勿与数百 GB 级完整 GLM-4.7 混淆)
显存建议16 GB 起(上下文、并行与底座设置会浮动)
内存建议32 GB+ 系统内存;拉长上下文时预留更多
后端较新版本 llama.cpp / llama-server 或底座文档中的等价本地服务

适合做什么

  • 代码理解、改仓 Agent、Ask 调试(本地 SRX + 本模型,数据不出域)
  • 轻量工具调用、通用对话(取决于底座版本与采样/解析配置)
  • 内网 / 本机闭环:权重落盘本地,适合研发环境

不太适合:无独显或显存明显不足仍强行拉满上下文;可改选同仓 更小 UD 档,或使用工作台 云端 API。

本地提示(Unsloth 参考)

  • 采样:--temp 1.0 --top-p 0.95 --min-p 0.01
  • 若重复/循环:试 --dry-multiplier 1.1(仍异常可试 1.5)
  • 上下文 --ctx-size 建议从 16K 起按显存逐步上调
  • 请保持 llama.cpp / 底座 为文档要求的较新版本(Flash 架构与 GGUF 对后端敏感)

与同系列其它量化

需求说明
更小体积同仓库 UD-Q3_K_XL 等(精选市场另开 SKU)
更高质量UD-Q5_K_XL 等(显存要求更高)
不推荐Unsloth 已不建议的 非 UD 老档(如单独 Q4_K_M)——请优先 UD 系列

本地 GGUF 与云端「glm-4.7-flash」

本条目(GGUF)会员 / API 云端
权重本机磁盘厂商云端
数据内网 / 本机闭环经 API 出网
适用自管显卡、离线研发即开即用、免维护

二者可在同一工作台 本地与云端切换。

下载与合规

见右侧 「下载」(免登录,将跳转至魔搭等第三方源)。

  • 上游:ModelScope · unsloth/GLM-4.7-Flash-GGUF(Unsloth 社区量化)
  • 开源协议:MIT
  • 精选含义:在消费级硬件下 值得试用 的推荐档,非官方排名或性能担保

下载中断? 单文件约 16 GB,请用稳定网络或支持断点续传的方式;完成后核对体积。

链失效? 反馈运营,后台会 更新直链(model_id 不变)。