Search: #本地大模型

  1. JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式• 针对 MoE 与超大模型做按张量分配比特宽度,在接近 MLX 体积下优先保留 attention 与 router 精度,低比特场景下稳定性和效果更强• 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构,部分模型可在 16 GB 或 64 GB Mac 上运行,甚至实现 397B 级模型在 128 GB Mac 上推理• 原生兼容 MLX 生态,提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案,适合在 Apple Silicon 上部署高压缩本地模型

    JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式

    • 针对 MoE 与超大模型做按张量分配比特宽度,在接近 MLX 体积下优先保留 attention 与 router 精度,低比特场景下稳定性和效果更强

    • 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构,部分模型可在 16 GB 或 64 GB Mac 上运行,甚至实现 397B 级模型在 128 GB Mac 上推理

    • 原生兼容 MLX 生态,提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案,适合在 Apple Silicon 上部署高压缩本地模型

    https://github.com/jjang-ai/jangq

    #AppleSilicon #MLX #模型量化 #混合精度量化 #本地大模型 #MoE #推理优化 #Mac #AI #GitHub GitHub - jjang-ai/jangq: JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for…

    • ❤️3
  2. Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型🔞可用于本地涩涩等场景• 基于 Qwen 3.5 9B,并融入 Claude Opus 4.6 蒸馏思路,主打更强的创意表达、对话表现与角色扮演场景• 提供 GGUF 与低显存友好的 Q4_K_M 量化版本,作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s,适合本地聊天、游戏 NPC 与 Home Lab 部署• 模型采用 Apache 2.0 许可证,便于社区测试与二次集成

    Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型

    🔞可用于本地涩涩等场景

    • 基于 Qwen 3.5 9B,并融入 Claude Opus 4.6 蒸馏思路,主打更强的创意表达、对话表现与角色扮演场景

    • 提供 GGUF 与低显存友好的 Q4_K_M 量化版本,作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s,适合本地聊天、游戏 NPC 与 Home Lab 部署

    • 模型采用 Apache 2.0 许可证,便于社区测试与二次集成

    https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf

    #AI #Uncensored #本地大模型 #模型蒸馏 #GGUF #Qwen #Claude #LMStudio #量化模型 #低显存部署 #角色扮演 #LocalLLaMA [Mature Content] From the LocalLLaMA community on Reddit: Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF

    • ❤️5
  3. oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具• 基于 Apple Silicon 优化,支持连续批处理与分层 KV Cache,可将热缓存放在内存、冷缓存落到 SSD,显著提升本地大模型的响应效率与上下文复用能力• 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker,支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载,适合多模型并行工作流• 提供 macOS 菜单栏应用与 Web 管理面板,兼容 OpenAI / Anthropic API,并内置模型下载、性能测试、聊天界面与 MCP 工具集成,降低本地 AI 服务运维门槛

    oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具

    • 基于 Apple Silicon 优化,支持连续批处理与分层 KV Cache,可将热缓存放在内存、冷缓存落到 SSD,显著提升本地大模型的响应效率与上下文复用能力

    • 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker,支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载,适合多模型并行工作流

    • 提供 macOS 菜单栏应用与 Web 管理面板,兼容 OpenAI / Anthropic API,并内置模型下载、性能测试、聊天界面与 MCP 工具集成,降低本地 AI 服务运维门槛

    https://github.com/jundot/omlx

    #本地大模型 #Mac AI #Apple Silicon #LLM 推理 #KV Cache #多模型服务 #OpenAI API #Anthropic API #MCP #GitHub #AI

    • 👍1