Search: #模型量化

  1. JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式• 针对 MoE 与超大模型做按张量分配比特宽度,在接近 MLX 体积下优先保留 attention 与 router 精度,低比特场景下稳定性和效果更强• 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构,部分模型可在 16 GB 或 64 GB Mac 上运行,甚至实现 397B 级模型在 128 GB Mac 上推理• 原生兼容 MLX 生态,提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案,适合在 Apple Silicon 上部署高压缩本地模型

    JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式

    • 针对 MoE 与超大模型做按张量分配比特宽度,在接近 MLX 体积下优先保留 attention 与 router 精度,低比特场景下稳定性和效果更强

    • 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构,部分模型可在 16 GB 或 64 GB Mac 上运行,甚至实现 397B 级模型在 128 GB Mac 上推理

    • 原生兼容 MLX 生态,提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案,适合在 Apple Silicon 上部署高压缩本地模型

    https://github.com/jjang-ai/jangq

    #AppleSilicon #MLX #模型量化 #混合精度量化 #本地大模型 #MoE #推理优化 #Mac #AI #GitHub GitHub - jjang-ai/jangq: JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for…

    • ❤️3
  2. Metapi: 将分散的 AI 中转站聚合为统一入口的元网关上科技 自动签到• 聚合 New API、One API、OneHub、DoneHub、Veloera、AnyRouter、Sub2API 等多种上游平台,对下游提供一个 API Key 和统一的 /v1/* 入口• 自动发现模型并基于成本、余额、使用率进行智能路由,支持故障切换、失败重试与多通道分流,适合长期稳定供给• 自带可视化控制台,覆盖站点管理、余额看板、签到任务、Token 生命周期、代理日志与告警通知,部署上也支持单 Docker 轻量运行

    Metapi: 将分散的 AI 中转站聚合为统一入口的元网关

    上科技 自动签到

    • 聚合 New API、One API、OneHub、DoneHub、Veloera、AnyRouter、Sub2API 等多种上游平台,对下游提供一个 API Key 和统一的 /v1/* 入口

    • 自动发现模型并基于成本、余额、使用率进行智能路由,支持故障切换、失败重试与多通道分流,适合长期稳定供给

    • 自带可视化控制台,覆盖站点管理、余额看板、签到任务、Token 生命周期、代理日志与告警通知,部署上也支持单 Docker 轻量运行

    https://github.com/cita-777/metapi

    #AI #网关 #API #聚合 #智能路由 #模型中转 #自托管 #Docker #TypeScript #GitHub

    • 🤡2
    • ❤️1
  3. Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型🔞可用于本地涩涩等场景• 基于 Qwen 3.5 9B,并融入 Claude Opus 4.6 蒸馏思路,主打更强的创意表达、对话表现与角色扮演场景• 提供 GGUF 与低显存友好的 Q4_K_M 量化版本,作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s,适合本地聊天、游戏 NPC 与 Home Lab 部署• 模型采用 Apache 2.0 许可证,便于社区测试与二次集成

    Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型

    🔞可用于本地涩涩等场景

    • 基于 Qwen 3.5 9B,并融入 Claude Opus 4.6 蒸馏思路,主打更强的创意表达、对话表现与角色扮演场景

    • 提供 GGUF 与低显存友好的 Q4_K_M 量化版本,作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s,适合本地聊天、游戏 NPC 与 Home Lab 部署

    • 模型采用 Apache 2.0 许可证,便于社区测试与二次集成

    https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf

    #AI #Uncensored #本地大模型 #模型蒸馏 #GGUF #Qwen #Claude #LMStudio #量化模型 #低显存部署 #角色扮演 #LocalLLaMA [Mature Content] From the LocalLLaMA community on Reddit: Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF

    • ❤️5