10月21日消息,據媒體報道,DeepSeek在GitHub上開源了其最新研究成果——DeepSeek-OCR模型。
據介紹,DeepSeek-OCR的參數量約為3B,是研究團隊對“光學二維映射壓縮”技術在長文本上下文處理中可行性的首次探索。

該模型核心由DeepEncoder與DeepSeek3B-MoE-A570M解碼器構成:DeepEncoder能夠在高分辨率輸入條件下保持低激活狀態,實現高壓縮比并生成適量的視覺token;解碼器則負責將這些視覺token準確轉化為文本信息。
實驗數據顯示,當文本token數量控制在視覺token的10倍以內(壓縮率<10 x )時,OCR識別精度可達97%;即使壓縮率提升至20×,模型準確率仍能維持在60%左右。
研究團隊表示,這一成果為長上下文壓縮技術以及大語言模型的記憶與遺忘機制研究提供了新的思路與方向。

論文標題:DeepSeek-OCR: Contexts Optical Compression
項目地址:https://github.com/deepseek-ai/DeepSeek-OCR
論文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf
Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-OCR

本站內容除特別聲明的原創文章之外,轉載內容只為傳遞更多信息,并不代表本網站贊同其觀點。轉載的所有的文章、圖片、音/視頻文件等資料的版權歸版權所有權人所有。本站采用的非本站原創文章及圖片等內容無法一一聯系確認版權者。如涉及作品內容、版權和其它問題,請及時通過電子郵件或電話通知我們,以便迅速采取適當措施,避免給雙方造成不必要的經濟損失。聯系電話:010-82306118;郵箱:aet@chinaaet.com。
