<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet href="/rss.xsl" type="text/xsl"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>本地大模型 | 折腾啥</title><description>Power Users/Automators 折腾/讨论/分享各种开源工具/脚本/自动化工作流👥 @zhetengsha_group📌 合集 https://t.me/zhetengsha/2🎁 恰饭 https://t.me/zhetengsha/957📢 广告投放 @xream @xream_botBuy ads: https://telega.io/c/zhetengshafeedId:55438372655431680+userId:62307599601855488</description><link>http://telegram.zhetengsha.eu.org</link><item><title>JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式• 针对 MoE 与超大模型做按张量分配比特宽度，在接近 MLX 体积下优先保留 attention 与 router 精度，低比特场景下稳定性和效果更强• 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构，部分模型可在 16 GB 或 64 GB Mac 上运行，甚至实现 397B 级模型在 128 GB Mac 上推理• 原生兼容 MLX 生态，提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案，适合在 Apple Silicon 上部署高压缩本地模型</title><link>http://telegram.zhetengsha.eu.org/posts/5175</link><guid isPermaLink="true">http://telegram.zhetengsha.eu.org/posts/5175</guid><pubDate>Tue, 24 Mar 2026 07:00:00 GMT</pubDate><content:encoded>&lt;u&gt;JANG: 面向 Apple Silicon 的 MLX 混合精度量化格式&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;• 针对 MoE 与超大模型做按张量分配比特宽度，在接近 MLX 体积下优先保留 attention 与 router 精度，低比特场景下稳定性和效果更强&lt;br /&gt;&lt;br /&gt;• 支持 Qwen、Nemotron、MiniMax、DeepSeek 等架构，部分模型可在 16 GB 或 64 GB Mac 上运行，甚至实现 397B 级模型在 128 GB Mac 上推理&lt;br /&gt;&lt;br /&gt;• 原生兼容 MLX 生态，提供推理模式、VLM 支持、bfloat16 自动检测和开发者集成方案，适合在 Apple Silicon 上部署高压缩本地模型&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;https://github.com/jjang-ai/jangq&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://github.com/jjang-ai/jangq&quot;&gt;https://github.com/jjang-ai/jangq&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23AppleSilicon&quot; title=&quot;#AppleSilicon&quot;&gt;#AppleSilicon&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23MLX&quot; title=&quot;#MLX&quot;&gt;#MLX&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%A8%A1%E5%9E%8B%E9%87%8F%E5%8C%96&quot; title=&quot;#模型量化&quot;&gt;#模型量化&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%B7%B7%E5%90%88%E7%B2%BE%E5%BA%A6%E9%87%8F%E5%8C%96&quot; title=&quot;#混合精度量化&quot;&gt;#混合精度量化&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%9C%AC%E5%9C%B0%E5%A4%A7%E6%A8%A1%E5%9E%8B&quot; title=&quot;#本地大模型&quot;&gt;#本地大模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23MoE&quot; title=&quot;#MoE&quot;&gt;#MoE&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%8E%A8%E7%90%86%E4%BC%98%E5%8C%96&quot; title=&quot;#推理优化&quot;&gt;#推理优化&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Mac&quot; title=&quot;#Mac&quot;&gt;#Mac&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23AI&quot; title=&quot;#AI&quot;&gt;#AI&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23GitHub&quot; title=&quot;#GitHub&quot;&gt;#GitHub&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://github.com/jjang-ai/jangq&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for Apple Silicon - jjang-ai/jangq&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;GitHub&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;GitHub - jjang-ai/jangq: JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for…&quot; src=&quot;/static/https://cdn4.telesco.pe/file/a-4YuxjLJ1eo_HWZGr2PJ7XP6HDagnzWTHLT5H5tStVN1ruInK-zNbrjEAkD-SPLRo5pj3nTx4NIlmm-yvqUlVNs-BZGtB-OUjl5qrxQsy9XW-rhWgXiNlzMwLGUgIvu4mDHUgVEBzUXV_PNwTnxGJYotQ2eVLZX3CvtFsmadpoHK2_hCRQPrtmZncOwdgjCtPrxwe4zWhYR0d-Z1DEgXNBbmvGNLOzl1cvHrIHgG1POHJOH4soSn2MDAA1qKR8w7AJMPc-zlz9BbmhET9w9taHlJ-uizzGRfPywYdJTqD62ftJvTWbmJQEDHf6j4_wqzDz6ckzaM5snCjn_6vlsaw.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;GitHub - jjang-ai/jangq: JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for…&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for Apple Silicon - jjang-ai/jangq&lt;/div&gt;
&lt;/a&gt;</content:encoded></item><item><title>Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型🔞可用于本地涩涩等场景• 基于 Qwen 3.5 9B，并融入 Claude Opus 4.6 蒸馏思路，主打更强的创意表达、对话表现与角色扮演场景• 提供 GGUF 与低显存友好的 Q4_K_M 量化版本，作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s，适合本地聊天、游戏 NPC 与 Home Lab 部署• 模型采用 Apache 2.0 许可证，便于社区测试与二次集成</title><link>http://telegram.zhetengsha.eu.org/posts/5093</link><guid isPermaLink="true">http://telegram.zhetengsha.eu.org/posts/5093</guid><pubDate>Mon, 16 Mar 2026 13:21:45 GMT</pubDate><content:encoded>&lt;u&gt;Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;&lt;i class=&quot;emoji&quot;&gt;&lt;b&gt;🔞&lt;/b&gt;&lt;/i&gt;可用于本地涩涩等场景&lt;br /&gt;&lt;br /&gt;• 基于 Qwen 3.5 9B，并融入 Claude Opus 4.6 蒸馏思路，主打更强的创意表达、对话表现与角色扮演场景&lt;br /&gt;&lt;br /&gt;• 提供 GGUF 与低显存友好的 Q4_K_M 量化版本，作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s，适合本地聊天、游戏 NPC 与 Home Lab 部署&lt;br /&gt;&lt;br /&gt;• 模型采用 Apache 2.0 许可证，便于社区测试与二次集成&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf&quot;&gt;https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23AI&quot; title=&quot;#AI&quot;&gt;#AI&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Uncensored&quot; title=&quot;#Uncensored&quot;&gt;#Uncensored&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%9C%AC%E5%9C%B0%E5%A4%A7%E6%A8%A1%E5%9E%8B&quot; title=&quot;#本地大模型&quot;&gt;#本地大模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%A8%A1%E5%9E%8B%E8%92%B8%E9%A6%8F&quot; title=&quot;#模型蒸馏&quot;&gt;#模型蒸馏&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23GGUF&quot; title=&quot;#GGUF&quot;&gt;#GGUF&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Qwen&quot; title=&quot;#Qwen&quot;&gt;#Qwen&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Claude&quot; title=&quot;#Claude&quot;&gt;#Claude&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23LMStudio&quot; title=&quot;#LMStudio&quot;&gt;#LMStudio&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E9%87%8F%E5%8C%96%E6%A8%A1%E5%9E%8B&quot; title=&quot;#量化模型&quot;&gt;#量化模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E4%BD%8E%E6%98%BE%E5%AD%98%E9%83%A8%E7%BD%B2&quot; title=&quot;#低显存部署&quot;&gt;#低显存部署&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E8%A7%92%E8%89%B2%E6%89%AE%E6%BC%94&quot; title=&quot;#角色扮演&quot;&gt;#角色扮演&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23LocalLLaMA&quot; title=&quot;#LocalLLaMA&quot;&gt;#LocalLLaMA&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;Posted by EvilEnginer - 1,409 votes and 210 comments&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;Reddit&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;[Mature Content] From the LocalLLaMA community on Reddit: Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF&quot; src=&quot;/static/https://cdn4.telesco.pe/file/WMPwcy796bDBbgu8DKV-RoG1-Tewa3uJpHDcb3uqbjBkD4JLD2h3nCJBxzK_6lzquVBwuSeDnN4azCm3eIPL0PUDlgh5Ve7yH3oPeBpSk-LCTPb50B_r9u5VVpD_7edJdx5HkKhHovkKKNgjRMMsl6m1HxMQZ0EKPuFyFbh5kWcESDNJXksLoficEGqzMHNkRVIEo7IRtRGSuzc3qQenErSAvTzr8IJgI5vU3MjepS1uyuUrpdlhIgw38H1t6JWHDrYrtYjJNVybq33423SodicYXE0-nvRzoe8QspZ5A01RTlKWbHVrsse4uNWrPNM4MGTLBJT6-4AOt7nZQUIq5Q.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;[Mature Content] From the LocalLLaMA community on Reddit: Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;Posted by EvilEnginer - 1,409 votes and 210 comments&lt;/div&gt;
&lt;/a&gt;</content:encoded></item><item><title>oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具• 基于 Apple Silicon 优化，支持连续批处理与分层 KV Cache，可将热缓存放在内存、冷缓存落到 SSD，显著提升本地大模型的响应效率与上下文复用能力• 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker，支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载，适合多模型并行工作流• 提供 macOS 菜单栏应用与 Web 管理面板，兼容 OpenAI / Anthropic API，并内置模型下载、性能测试、聊天界面与 MCP 工具集成，降低本地 AI 服务运维门槛</title><link>http://telegram.zhetengsha.eu.org/posts/5072</link><guid isPermaLink="true">http://telegram.zhetengsha.eu.org/posts/5072</guid><pubDate>Sat, 14 Mar 2026 02:03:54 GMT</pubDate><content:encoded>&lt;div class=&quot;image-list-container image-list-odd&quot;&gt;
      &lt;button type=&quot;button&quot; class=&quot;image-preview-button image-preview-wrap&quot; popovertarget=&quot;modal-5072-0&quot; popovertargetaction=&quot;show&quot; aria-label=&quot;Open image preview: oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具• 基于 Apple Silicon 优化，支持连续批处理与分层 KV Cache，可将热缓存放在内存、冷缓存落到 SSD，显著提升本地大模型的响应效率与上下文复用能力• 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker，支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载，适合多模型并行工作流• 提供 macOS 菜单栏应用与 Web 管理面板，兼容 OpenAI / Anthropic API，并内置模型下载、性能测试、聊天界面与 MCP 工具集成，降低本地 AI 服务运维门槛&quot;&gt;
        &lt;img src=&quot;/static/https://cdn5.telesco.pe/file/vDtGBoiEKrFY7d5EP8aLyJkbKyX35_9GMD-X-GwcFLHk0FV0xDPMjJDG1v3vEaCVr8TAfJKJqEw-EFJ8FyIjFw2Gbxxh8ioTbjGvKN1KzjH5nd9WOMAMWA227W0lPrYDnpbLfP7EM9mbMRosTTTpk7Ss_5l0SbS4EOIKWIHrXlFKlbfnbBh2QYdBBEKHs0VpeWFMbFs_pEDyMpgUH8xOXtNNdfcYLMeMCbEdbjkoQd7YZuDCuUkBERkpCcBHxQTWXEp6QTF9FJ21_WrTs5PYgtPBzg1DgcEP5Bi2vWO5nC48pmwmDVtOB0eEd1LD2EReEBBQJZgxEiHRYP1Yoyq6Zw.jpg&quot; alt=&quot;oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具• 基于 Apple Silicon 优化，支持连续批处理与分层 KV Cache，可将热缓存放在内存、冷缓存落到 SSD，显著提升本地大模型的响应效率与上下文复用能力• 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker，支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载，适合多模型并行工作流• 提供 macOS 菜单栏应用与 Web 管理面板，兼容 OpenAI / Anthropic API，并内置模型下载、性能测试、聊天界面与 MCP 工具集成，降低本地 AI 服务运维门槛&quot; width=&quot;800&quot; height=&quot;626&quot; loading=&quot;eager&quot; /&gt;
      &lt;/button&gt;
      &lt;div class=&quot;modal&quot; id=&quot;modal-5072-0&quot; popover=&quot;auto&quot; aria-label=&quot;Image preview&quot;&gt;
        &lt;button type=&quot;button&quot; class=&quot;modal__backdrop&quot; popovertarget=&quot;modal-5072-0&quot; popovertargetaction=&quot;hide&quot; aria-label=&quot;Close image preview&quot;&gt;&lt;/button&gt;
        &lt;button type=&quot;button&quot; class=&quot;modal__close&quot; popovertarget=&quot;modal-5072-0&quot; popovertargetaction=&quot;hide&quot; aria-label=&quot;Close image preview&quot;&gt;×&lt;/button&gt;
        &lt;div class=&quot;modal__surface&quot;&gt;
          
        &lt;/div&gt;
      &lt;/div&gt;
    &lt;/div&gt;&lt;u&gt;oMLX: 面向 Mac 本地部署的高性能 LLM 推理与管理工具&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;• 基于 Apple Silicon 优化，支持连续批处理与分层 KV Cache，可将热缓存放在内存、冷缓存落到 SSD，显著提升本地大模型的响应效率与上下文复用能力&lt;br /&gt;&lt;br /&gt;• 同一服务可统一承载 LLM、VLM、Embedding 与 Reranker，支持模型自动发现、按需加载、LRU 淘汰、Pin 常驻和 TTL 卸载，适合多模型并行工作流&lt;br /&gt;&lt;br /&gt;• 提供 macOS 菜单栏应用与 Web 管理面板，兼容 OpenAI / Anthropic API，并内置模型下载、性能测试、聊天界面与 MCP 工具集成，降低本地 AI 服务运维门槛&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;https://github.com/jundot/omlx&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://github.com/jundot/omlx&quot;&gt;https://github.com/jundot/omlx&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E6%9C%AC%E5%9C%B0%E5%A4%A7%E6%A8%A1%E5%9E%8B&quot; title=&quot;#本地大模型&quot;&gt;#本地大模型&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Mac&quot; title=&quot;#Mac&quot;&gt;#Mac&lt;/a&gt; AI &lt;a href=&quot;/search/result?q=%23Apple&quot; title=&quot;#Apple&quot;&gt;#Apple&lt;/a&gt; Silicon &lt;a href=&quot;/search/result?q=%23LLM&quot; title=&quot;#LLM&quot;&gt;#LLM&lt;/a&gt; 推理 &lt;a href=&quot;/search/result?q=%23KV&quot; title=&quot;#KV&quot;&gt;#KV&lt;/a&gt; Cache &lt;a href=&quot;/search/result?q=%23%E5%A4%9A%E6%A8%A1%E5%9E%8B%E6%9C%8D%E5%8A%A1&quot; title=&quot;#多模型服务&quot;&gt;#多模型服务&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23OpenAI&quot; title=&quot;#OpenAI&quot;&gt;#OpenAI&lt;/a&gt; API &lt;a href=&quot;/search/result?q=%23Anthropic&quot; title=&quot;#Anthropic&quot;&gt;#Anthropic&lt;/a&gt; API &lt;a href=&quot;/search/result?q=%23MCP&quot; title=&quot;#MCP&quot;&gt;#MCP&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23GitHub&quot; title=&quot;#GitHub&quot;&gt;#GitHub&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23AI&quot; title=&quot;#AI&quot;&gt;#AI&lt;/a&gt;</content:encoded></item></channel></rss>