<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet href="/rss.xsl" type="text/xsl"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>多语言开发 | 折腾啥</title><description>Power Users/Automators 折腾/讨论/分享各种开源工具/脚本/自动化工作流👥 @zhetengsha_group📌 合集 https://t.me/zhetengsha/2🎁 恰饭 https://t.me/zhetengsha/957📢 广告投放 @xream @xream_botBuy ads: https://telega.io/c/zhetengshafeedId:55438372655431680+userId:62307599601855488</description><link>http://telegram.zhetengsha.eu.org</link><item><title>Kreuzberg: 面向多语言生态的高性能文档解析与 OCR 引擎• 支持 88+ 文件格式解析，覆盖 PDF、Office、图片、HTML、XML、邮件、压缩包与学术文档，适合构建统一的数据提取管线• 基于 Rust 内核与原生绑定，提供 Python、Node.js、Go、Java、C#、PHP 等多语言支持，并可作为库、CLI、REST API 或 MCP Server 部署• 内置可扩展插件架构，支持 Tesseract、PaddleOCR、EasyOCR 等 OCR 后端，同时可选生成 Embeddings，无需 GPU 也能获得原生级处理速度</title><link>http://telegram.zhetengsha.eu.org/posts/5235</link><guid isPermaLink="true">http://telegram.zhetengsha.eu.org/posts/5235</guid><pubDate>Mon, 30 Mar 2026 02:03:26 GMT</pubDate><content:encoded>&lt;u&gt;Kreuzberg: 面向多语言生态的高性能文档解析与 OCR 引擎&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;• 支持 88+ 文件格式解析，覆盖 PDF、Office、图片、HTML、XML、邮件、压缩包与学术文档，适合构建统一的数据提取管线&lt;br /&gt;&lt;br /&gt;• 基于 Rust 内核与原生绑定，提供 Python、Node.js、Go、Java、C#、PHP 等多语言支持，并可作为库、CLI、REST API 或 MCP Server 部署&lt;br /&gt;&lt;br /&gt;• 内置可扩展插件架构，支持 Tesseract、PaddleOCR、EasyOCR 等 OCR 后端，同时可选生成 Embeddings，无需 GPU 也能获得原生级处理速度&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;https://github.com/kreuzberg-dev/kreuzberg&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;https://github.com/kreuzberg-dev/kreuzberg&quot;&gt;https://github.com/kreuzberg-dev/kreuzberg&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90&quot; title=&quot;#文档解析&quot;&gt;#文档解析&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23OCR&quot; title=&quot;#OCR&quot;&gt;#OCR&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Rust&quot; title=&quot;#Rust&quot;&gt;#Rust&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Embeddings&quot; title=&quot;#Embeddings&quot;&gt;#Embeddings&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%A4%9A%E8%AF%AD%E8%A8%80%E5%BC%80%E5%8F%91&quot; title=&quot;#多语言开发&quot;&gt;#多语言开发&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%96%87%E4%BB%B6%E5%A4%84%E7%90%86&quot; title=&quot;#文件处理&quot;&gt;#文件处理&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%BC%80%E5%8F%91%E5%B7%A5%E5%85%B7&quot; title=&quot;#开发工具&quot;&gt;#开发工具&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23GitHub&quot; title=&quot;#GitHub&quot;&gt;#GitHub&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23MCP&quot; title=&quot;#MCP&quot;&gt;#MCP&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23API&quot; title=&quot;#API&quot;&gt;#API&lt;/a&gt;&lt;a class=&quot;tgme_widget_message_link_preview&quot; href=&quot;https://github.com/kreuzberg-dev/kreuzberg&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; title=&quot;A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured information from PDFs, Office documents, images, and 97+ formats. Available for Rust, Pyt...&quot;&gt;
  
  &lt;div class=&quot;link_preview_site_name accent_color&quot;&gt;GitHub&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;GitHub - xberg-io/xberg: A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured…&quot; src=&quot;/static/https://cdn4.telesco.pe/file/MJSzB-GPh9ctAeYRTR9rxqL1zaqljsqAJyQrqM66S2tXa_r1JJ25N8n-_Kx_PEQ5FqSFEivldTHkW_kynLUsb2FG-o52SlGOofxrxhrJtnzaSjl7KHmVRCZEnCwbLBXH2yMxSeSANicf6ocKGjFnYj2-gdwwVjrM5OX9tsLYQKSPd_E0Mpg3F-qaxjEhCZvfXT8ZjDNzd44pqhuxXUFDfRO-E9jC8hJxnPxMOxL1NXjbq-7j3CndzIMBHeLMXtNMmnamCb8fxpZbwiQ9VBL7F3kalJ2llh3VxRkknx7qMOj-yy2v6r0ikqTmeKsScQWbY4dvV2OAwOkwsnKbju8M1g.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div class=&quot;link_preview_title&quot;&gt;GitHub - xberg-io/xberg: A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured…&lt;/div&gt;
  &lt;div class=&quot;link_preview_description&quot;&gt;A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured information from PDFs, Office documents, images, and 97+ formats. Available for Rust, Pyt...&lt;/div&gt;
&lt;/a&gt;</content:encoded></item></channel></rss>