這篇來自阿里巴巴集團ATH-MaaS團隊的技術報告發布於2026年7月15日,論文編號為arXiv:2607.13639,有興趣深入了解的讀者可以通過該編號檢索完整論文。
每天,無數人面臨同一個痛苦:手裡有一疊掃描件、PDF報告或者拍照的文件,需要把裡面的文字、表格、公式統統整理出來,再用於後續分析、檢索或者餵給AI工具。傳統的解決方案要麼靠人工手打,要麼靠一套複雜的軟體流水線——先識別版面,再裁出每個區域,再分別識別文字、表格、數學公式,最後拼在一起。這套流程就像在流水線工廠里生產產品:每個工位做一道工序,任何一道出了岔子,後面的工位都得跟著受罪。漏掉了一個表格邊界,整個表格的內容就廢了;公式裁歪了,識別結果就會面目全非。
阿里巴巴的研究團隊決定換一條路:既然流水線問題多,為什麼不讓一個"全能工人"直接從頭到尾搞定所有事情?這個"全能工人"就是OvisOCR2——一個僅有8億參數規模的端到端文檔解析模型。說"僅有8億",是因為它的競爭對手裡有不少超過百億甚至千億參數的模型,而OvisOCR2在主流評測榜單OmniDocBench v1.6上拿下了96.58的綜合得分,不僅在所有端到端模型里排名第一,還把此前長期霸榜的流水線方法全部甩在了身後。
---
一、文檔解析這件事,為什麼這麼難?
要真正理解OvisOCR2的價值,得先明白"把一張文檔圖片變成結構化文字"這件事有多複雜。
普通人看一頁文檔,眼睛和大腦會自動完成很多工作:哪裡是標題、哪裡是正文、哪裡是表格、哪裡是圖注、哪裡是頁眉頁腳、哪裡是數學公式,以及整頁內容應該按什麼順序閱讀——特別是遇到雙欄排版的學術論文時,閱讀順序並不是從左上角到右下角一擼到底,而是先讀完左欄,再讀右欄。這些對人類來說習以為常的判斷,對機器來說極其複雜。
現有方法大致分兩派。一派是流水線方法,代表選手包括PaddleOCR-VL-1.6、MinerU2.5-Pro和GLM-OCR。這些系統把一頁文檔拆成多個子任務,各配一個專門的模型:版面分析模型先把頁面切成一塊一塊,然後針對每個區域分別調用文字識別模型、公式識別模型、表格結構識別模型,最後再由一個模組負責把所有結果按閱讀順序拼在一起。這種分工協作的方式在主流評測上表現不錯,但每個環節都可能出錯,且部署時需要同時維護多個模型,運維成本很高。
另一派是端到端方法:用一個統一的模型,接收整張文檔圖片,直接輸出完整的Markdown格式文本——文字、表格(用HTML格式保留結構)、公式(用LaTeX格式保留數學結構)以及圖片位置資訊,一次生成。這類方法部署簡單,模型可以在生成過程中利用頁面的整體上下文,不會因為某個區域裁剪不准而丟失資訊。然而在此前,端到端方法的解析質量普遍落後於流水線方法,尤其是在複雜表格和長文檔上。
OvisOCR2要做的,就是用端到端方法打敗流水線方法。
---
二、數據是根基——兩條流水線並行建設
研究團隊把打造OvisOCR2的過程比作建房子,地基就是訓練數據。如果數據質量差,模型再大也是爛泥扶不上牆。為了獲得足夠高質量、足夠多樣的訓練數據,團隊設計了兩條並行的數據管道:真實文檔數據管道和合成文檔數據管道。
真實文檔數據管道的邏輯是:大量真實世界的文檔圖片,天然包含了各種字體、掃描質量、版面樣式、語言種類,是任何合成數據都難以完全模擬的"現實感"來源。但真實文檔的麻煩在於,你無法直接知道它的"正確答案"是什麼,必須先用現有的OCR工具解析出結果,再把這些結果當作訓練標籤。
團隊選用了PaddleOCR-VL-1.5和MinerU2.5-Pro這兩個專業解析工具來獲取結構化輸出。這兩個工具返回的是JSON格式的結構化數據,而不是直接可用的Markdown文本。研究團隊專門編寫了一套基於規則的轉換器,把這些JSON結果統一轉換為標準Markdown格式。轉換規則非常細緻:文字塊如何歸併(相鄰的同類文字塊要合併,中文直接拼接,非中文要加空格)、標題層級如何從編號格式(如"1.2節"、"第三章")自動推斷、數學公式如何規範化(把各種寫法統一成`$...$`或`$$...$$`格式)、表格是否有效(空表格、格式損壞的表格直接過濾掉)、圖片區域如何用標準化的HTML圖片標籤表示(坐標歸一化到0到1000的範圍內)。
光靠自動規則還不夠,團隊還設置了人工抽查環節。他們按照數據來源、解析工具類型、文檔領域和轉換配置把數據分成不同子集,從每個子集裡隨機抽取樣本,人工對照原圖檢查:文字有沒有漏掉、公式渲染對不對、表格行列對不對、圖片標註框框得準不準、閱讀順序有沒有錯亂。遇到偶爾有小錯的子集,保留但同時保留自動過濾;遇到頻繁出錯的子集,直接剔除。這種"寧缺毋濫"的保守策略,確保進入訓練集的數據整體質量可靠。
合成文檔數據管道則解決了另一個問題:真實文檔里有些結構非常罕見,比如跨多行多列合併單元格的複雜表格、公式和文字密集交織的學術頁面、極端多欄排版等。靠自然收集到這些樣本的概率很低,但這些恰恰是模型容易犯錯的"硬核場景"。
合成數據管道的核心思路是"從同一個源頭同時生成圖片和答案",徹底消除標註誤差。具體做法是:先收集那些讓模型犯錯的"難樣本"(包括在真實測試中出錯的案例和模型自測中暴露的弱點),然後用多模態大語言模型分析這些難樣本的視覺結構,生成對應的HTML模板。這個HTML模板保留了難樣本的關鍵布局特徵,同時暴露出可以隨機化的變量。接著,一個基於代理的自動生成流程會把這個模板擴展成大量變體:內容層面可以隨機替換文字、數值、公式、專業術語;結構層面可以隨機改變表格結構、章節層級、頁面組織方式和圖片位置。
最終,這個HTML頁面被用Playwright渲染成真實的文檔圖片,同時從HTML的DOM結構中直接提取Markdown格式的標準答案。因為圖片和答案來自同一個HTML源頭,標註精度理論上是完美的——不存在"OCR識別錯了導致標註錯了"的問題。每一批生成的樣本還要經過質量控制:檢查渲染是否正常、Markdown是否有效、坐標是否對齊,最後才能進入訓練集。
通過這兩條並行管道,訓練數據同時具備了真實文檔的自然多樣性和合成數據的精準覆蓋性。
---
三、訓練的四道工序——從"會做"到"做好"
數據準備好之後,真正的訓練過程分四個階段,就像把生鐵逐步鍛造成精鋼。
第一道工序是監督微調(SFT)。這個階段的目標是讓模型"學會做文檔解析這件事",用全量數據進行標準的語言模型訓練——給模型看文檔圖片,讓它預測正確的Markdown輸出。研究團隊同時訓練了兩個規格的模型:0.8B參數的小模型(最終部署目標)和4B參數的大模型(作為後續階段的"老師")。0.8B模型訓練了兩個完整輪次,4B模型為了節省計算成本只訓練了20%的輪次。
第二道工序是強化學習(RL)。SFT階段的訓練靠"逐個詞預測是否正確"來驅動,但文檔解析的很多錯誤並不體現在單個詞上——比如一個表格的文字內容全對,但行列結構亂了;一個公式逐字母看都沒錯,但整體含義完全不同。這些結構性錯誤更適合用"整體評分"來衡量。
研究團隊使用了GRPO(組相對策略優化)算法來做強化學習:讓模型對同一張文檔圖片生成多個不同的輸出,然後用獎勵函數給每個輸出評分,鼓勵模型更多地生成高分輸出、少生成低分輸出。獎勵函數由三個分量組成:文字部分用歸一化編輯距離的反值衡量(文字越準確分越高)、公式部分用CDM(字符檢測匹配)這個圖像級別的渲染對比指標(能渲染出一樣圖形的公式才算對)、表格部分用TEDS(樹編輯距離相似度)衡量(表格的行列結構和內容都要對才算分)。最終獎勵是頁面中實際出現的元素類型的分量平均值:純文字頁面只考察文字分,含公式的頁面額外考察公式分,含表格的頁面額外考察表格分。
強化學習只在4B模型上進行,而不是直接在0.8B模型上進行。這是有原因的:研究團隊實際測試發現,直接對0.8B模型做強化學習,訓練過程中策略偏離(KL散度)會越來越大,表格質量在訓練後期甚至出現下滑。而4B模型容量更大,能更穩定地吸收強化學習的梯度信號,訓練過程保持平穩,表格TEDS指標穩步提升。
為了讓強化學習的數據更有效,團隊還做了"在線難樣本篩選":先用當前策略跑一遍候選頁面,把太簡單(模型每次都答對)和太難(模型每次都答錯)的頁面過濾掉,重點保留那些模型有時候答得好、有時候答得差的中等難度頁面——這些頁面才能給模型提供最有價值的學習信號。
第三道工序是在線策略蒸餾(OPD)。現在有了一個"學習好、能力強"的4B教師模型,怎麼把它的能力傳遞給部署用的0.8B學生模型?標準的知識蒸餾方法是讓教師模型生成文本,然後學生模型去模仿。但研究團隊用了一個更精妙的方式:讓學生模型先自己生成一段輸出,然後教師模型來評價這段輸出的每個位置上各個詞的概率分布,學生再根據教師的評價調整自己的概率分布。
這種方式的好處是,學生始終在針對自己實際生成的內容進行改進——就像一個學生做了一套題,老師批改並指出每道題哪個選項應該選、為什麼,學生據此修正自己的思維模式。更重要的是,這裡使用的是"反向KL散度"方向的對齊——簡單說,這種方向的對齊會讓學生集中學習教師最有把握的那些選擇,而不是被強迫去覆蓋教師所有可能的輸出。
在工程實現上,全詞彙表的概率對齊計算量太大(每個位置都要算幾萬個詞的概率),研究團隊只保留學生當前概率最高的前k個詞,只在這個小集合里對齊教師和學生的分布,大幅降低計算量,同時對長文檔使用分塊投影來降低內存峰值。
第四道工序是模型融合。研究團隊訓練了多個使用不同數據配比和訓練配置的候選模型,最後對這些候選模型的權重做加權平均,得到最終的OvisOCR2。這種做法類似於多個廚師各自做出了稍有差異的菜,最後調出一個融合了各自優點的配方——通常能比單個模型更穩定、泛化性更好。
---
四、評測:三個戰場,全面出擊
OvisOCR2在三個評測場景下接受了檢驗,分別是兩個公開榜單和一個內部評測集。
第一個戰場是OmniDocBench v1.6,這是文檔解析領域目前最權威的公開評測基準,覆蓋1651個PDF頁面,包含10種文檔類型、5種版面類型、5種語言。評測從四個維度評分:文字轉錄的準確度(用歸一化編輯距離衡量,越低越好)、公式識別的準確度(用CDM衡量,越高越好)、表格重建的準確度(用TEDS和TEDS-S衡量,越高越好)以及閱讀順序的準確度(用編輯距離衡量,越低越好)。綜合得分由文字分、公式分和表格TEDS三項平均得出。
在這個榜單上,OvisOCR2拿到了96.58的綜合分,不僅是所有端到端方法裡的第一名,還超越了此前領跑的流水線方法PaddleOCR-VL-1.6(96.33分)。具體來看每項指標:OvisOCR2的文字編輯距離是0.025,是所有模型中最低的;公式CDM是97.53,是所有模型中最高的;表格TEDS是94.76,與PaddleOCR-VL-1.6並列第一;表格TEDS-S是97.16,是所有模型中最高的;閱讀順序編輯距離是0.111,是所有模型中最低的。
作為參照,那些參數規模大得多的通用視覺語言模型表現如何?Qwen3-VL-235B(2350億參數)綜合分是89.78,Gemini 3 Pro綜合分是92.91,Ovis2.6-30B-A3B(300億參數)綜合分是93.70。OvisOCR2用0.8B參數的規模,比這些巨型模型高出了3到7個百分點。
第二個戰場是PureDocBench,這個評測基準的特點是數據來源可追溯——文檔圖片從HTML渲染生成,標註答案直接從同一HTML源提取,避免了人工標註誤差。評測分三個軌道:清潔軌道(標準渲染圖片)、數字軌道(有退化處理的圖片)和真實軌道(手機拍照、複印件、截圖等真實場景圖片),涵蓋1475個頁面,共4425張圖片,跨10個領域66個子類別。
OvisOCR2在Avg3(三軌道平均分)上達到75.06,是所有參評模型中最高的,同時在清潔軌道和數字軌道上也分別排名第一。在真實軌道上,OvisOCR2以66.56分排在Gemini-3.1-Pro(71.98分)和Qwen3.5-122B-A10B(69.85分)之後,說明在嚴重退化的真實照片場景下,針對文檔解析專門優化的小模型在魯棒性上仍有提升空間。這也是研究團隊明確指出的未來工作方向之一。
第三個戰場是內部評測集。公開榜單的數據分布未必能完全覆蓋真實業務中的長尾場景,研究團隊自建了一個超過1000頁的內部基準,覆蓋領域特定的表格、帶公章的掃描報告、有手寫批註的列印模板等更複雜的真實文檔。在這個評測集上,OvisOCR2的綜合分是85.54,高於PaddleOCR-VL-1.6的82.88、GLM-OCR的82.80、PaddleOCR-VL-1.5的81.55,以及MinerU2.5-Pro的65.54。按難度分層來看,在簡單文檔上OvisOCR2得87.95,中等難度文檔上85.82,困難文檔上78.99,在每個難度層級上都領先於所有競爭方法。
研究團隊還專門針對兩類特別棘手的場景做了子集分析。在手寫文檔子集上,OvisOCR2以72.28的綜合分位居第一,特別在文字編輯距離(0.1561,最低)、公式CDM(81.51,最高)和閱讀順序編輯距離(0.1733,最低)上均領先,只有表格TEDS一項(50.95)略低於GLM-OCR的57.31。在複雜表格子集上,OvisOCR2綜合分83.97,遙遙領先於第二名GLM-OCR的74.08,表格TEDS最高(78.34),文字編輯距離最低(0.1040),最關鍵的是表格丟失率僅7.96%——而流水線方法因為版面分析可能漏檢表格,丟失率普遍在13%到17%之間。一旦版面分析把一個表格漏掉了,後續識別環節根本沒有機會彌補這個錯誤,而端到端方法從整頁理解出發,就不會有這種不可逆的"先天殘缺"。
---
五、定性對比:肉眼能看出差距
除了定量數字,研究團隊還在論文中展示了多組定性對比案例,直觀說明不同模型的實際輸出差異。
在一張包含Kubernetes集群架構設計文檔的中文頁面上,這張頁面同時包含說明文字、多個表格和頁眉頁腳資訊。OvisOCR2的輸出完整地保留了所有內容,表格的行列結構完全正確。PaddleOCR-VL-1.6和MinerU2.5-Pro的輸出在文字內容上基本過關,但表格中出現了個別識別錯誤(標紅部分)。而Unlimited-OCR在這個頁面上出現了嚴重的幻覺式重複輸出,生成了大量與原文完全無關的內容,顯然是模型在無法準確識別複雜頁面時"亂說話"了。
在一張包含手寫日記的中文頁面上,OvisOCR2準確識別出了日期格式"DATE / 118 / 484"和所有手寫正文內容。PaddleOCR-VL-1.6和MinerU2.5-Pro雖然總體方向正確,但存在若干字符識別錯誤(如"高漲"被識別為"高話","緣份"被識別為"微信")以及標點符號和句子邊界的處理差異。在另一張手寫歌詞頁面上,MinerU2.5-Pro出現了明顯的閱讀順序錯誤——歌詞原本是單欄從上到下排列,卻被解析為兩欄交叉閱讀的順序,導致輸出內容邏輯混亂。OvisOCR2則正確按照從上到下的順序輸出了完整歌詞。
---
六、規模與效率的平衡:為什麼選0.8B?
整個項目的一個核心設計決策是:為什麼目標是0.8B參數的小模型,而不是像很多競品那樣使用3B、4B甚至7B的模型?
研究團隊給出的理由很務實。在實際部署中,模型越大,推理速度越慢,硬體成本越高,特別是在需要處理大量文檔的企業場景中,0.8B的模型在同樣的硬體上可以並行處理更多文檔。但更關鍵的是,研究團隊通過精心設計的數據引擎和訓練方案,已經能讓0.8B的模型在主流評測上超越參數量大得多的競爭對手,這說明在文檔解析這個特定任務上,數據質量和訓練策略的提升空間遠沒有被窮盡,而盲目堆砌參數並不是最優解。
當然,0.8B模型也有其局限:在面對極端退化的真實照片文檔時,它的魯棒性確實不如那些超大模型。這是大模型在視覺理解方面的先天優勢,也是研究團隊明確列為未來工作方向的問題。
---
說到底,OvisOCR2這個研究最值得關注的地方,不僅僅是一個具體的數字分數。更重要的是,它證明了端到端方法在文檔解析這個任務上,已經有能力真正擊敗長期依賴多模型流水線組合的工程方案。用一個統一的小模型取代一套複雜的多模型系統,不僅讓部署變得簡單,還避免了流水線方案中各階段錯誤相互疊加的宿命。
對於那些需要大規模處理文檔的開發者和企業來說,這意味著基礎設施可以大幅簡化——不再需要維護版面分析、文字識別、公式識別、表格識別這幾套獨立的模型和工程管道,一個模型搞定全部。而對於普通用戶而言,這類技術的持續進步意味著將來無論是處理工作報告、整理學習資料還是數位化老舊紙質檔案,AI工具將變得更加可靠、更加普及。
當然,手寫文字的識別以及經過嚴重拍照退化的文檔處理,依然是這類小模型的薄弱環節。感興趣深入了解技術細節的讀者,可以通過arXiv編號2607.13639查閱完整論文,或者直接訪問Hugging Face上ATH-MaaS/OvisOCR2頁面體驗開源模型。
---
Q&A
Q1:OvisOCR2和普通OCR軟體有什麼區別?
A:普通OCR軟體通常只認識文字,無法處理表格結構、數學公式和閱讀順序等複雜元素。OvisOCR2是端到端文檔解析模型,能同時處理文字、表格(保留行列結構)、數學公式(用LaTeX格式輸出)以及圖片位置,並按正確閱讀順序輸出結構化Markdown文本,適合複雜文檔的完整數位化處理。
Q2:端到端文檔解析為什麼比流水線方法更有優勢?
A:流水線方法把文檔解析拆成多個步驟:先檢測版面,再逐區域識別,最後拼合。任何一步出錯都會影響後續——比如版面檢測漏掉一個表格,後面就沒有機會彌補。端到端方法用單個模型直接從整張頁面圖片生成最終結果,不存在步驟間的誤差疊加,部署也只需維護一個模型,複雜度大幅降低。
Q3:OvisOCR2在哪些文檔類型上效果比較弱?
A:OvisOCR2在手機拍照、複印件、截圖等嚴重退化的真實照片類文檔上,效果弱於Gemini-3.1-Pro等超大型通用視覺模型。此外,手寫文檔的表格識別精度也略低於某些流水線方法。研究團隊已明確將提升真實場景圖像魯棒性和手寫內容處理能力列為下一步研究重點。






