大模型

雲知聲Unisound U1-OCR大模型發布!首個工業級文件智慧基礎大模型,開啟OCR 3.0時代

北京2026年2月26日 /美通社/ — 就在剛剛,雲知聲正式推出「Unisound U1-OCR」 文件智慧基礎大模型。作為首個工業級文件智慧基座,該模型憑借 「效能 SOTA、可信可驗、開箱即用、高效部署、強適配」 五大核心優勢,打破傳統文件處理邊界,樹立起行業新標杆。

一、技術跨越:從 OCR 2.0 邁向 3.0

文件智慧(Document Intelligence是指利用人工智慧技術自動閱讀和理解文件影像,並進行內容的讀取、理解、分類及關鍵資訊提取。傳統視覺方案(OCR 1.0,以 CRNN 為代表)僅能識別文字,新一代多模態方案(OCR 2.0,以VLM為代表 )具備初步版面理解能力。而 「Unisound U1-OCR」 則正式開啟 OCR 3.0 時代——在理解版面的基礎上,進一步洞察文件深層語義,實現自動分類與業務級資訊抽取,完成了從「字元感知」到「文件認知」的質的飛躍。

二、實力領跑:多項權威評測穩居全球第一梯隊

「Unisound U1-OCR」是一款達到國際頂尖水平(SOTA)的文件智慧理解模型,其核心優勢在於突破了傳統模型「只讀文字、不懂排版」的瓶頸,能夠像人類專家一樣「看懂」複雜文件。為適應 OCR 3.0 時代對於文件業務級結構化抽取的新要求,Unisound U1-OCR 採用 ViT + LLM 架構,其中視覺編碼器部分採用 NaViT 架構,實現文件解析度動態處理,模型引數規模 3B 量級,兼顧模型計算效率與文件深層語義資訊理解的能力要求。除此之外,模型還提出了多項創新舉措:

首先,它擁有「先懂結構,再讀內容」的智慧。傳統模型往往按順序死板閱讀,而「Unisound U1-OCR」首創了「語義驅動+動態聚焦」策略。如同人類閱讀習慣,先梳理文件目錄、標題的層級關系,再按需提取內容。模型能自動構建文件的「語義地圖」,精準識別標題、圖表與正文的從屬關系,即使面對排版混亂的極端場景,也能條理清晰地提取資訊。

其次,它具備敏銳的「空間感知力」。透過強化空間對齊模組,模型能充分利用文字在頁面上的位置資訊,主動理解元素間的空間佈局。結合動態解析度技術,無論是密集表格還是圖文混排,它都能精準還原文件結構,徹底解決了以往模型「張冠李戴」的空間盲區。

此外,模型採用Multi-Token Prediction(MTP)技術——在預測當前 Token時,同步考慮未來多個Token的機率分佈,大幅提升長文件邏輯連貫性。配合全任務強化學習策略,增強模型對版式結構的全域性預見性並在推理階段將模型生成效率提升了80%以上。在訓練階段,採用多工協同強化訓練方案,實現文件結構還原、文件分類與資訊抽取的深度對齊。強化訓練策略圍繞「語義+坐標」雙目標最佳化,針對坐標回溯的 IoU 精度進行專項強化,有效遏制定位幻覺,確保輸出結果的物理可信度。透過多檔位解析度擾動與Mask取樣策略,顯著提升了模型多場景文件影象的理解能力。

憑借這些創新,Unisound U1-OCR在多項權威測試中均獲業界SOTA表現,真正實現了從「識別文字」到「理解文件」的跨越。

1. OmniDocBench V1.5評測SOTA

在OmniDocBench V1.5評測中,Unisound U1-OCR以95.1分取得SOTA表現(如圖1),領先GLM-OCR,Deepseek-OCR2,Gemini-3-Pro,GPT-5.2等主流模型,實現了精度與泛化能力的雙重突破。

圖1Unisound U1-OCR在OmniDocBench V1.5的評測得分對比
圖1Unisound U1-OCR在OmniDocBench V1.5的評測得分對比

2. D4LA評測SOTA

在D4LA評測中, F1 分數達 90.8,大幅領先 DocLayout-YOLO(87.3)、PP-StructureV3(86.0)。無需微調即可高精度解析學術論文、財務報表等 11 類高複雜度文件。

3. DocLayNet評測SOTA

DocLayNet評測中,F1 分數 95.9,超越 MinerU 2.5、PP-StructureV3 等模型。在表格識別、跨頁關聯、微小文字檢測等高難任務上優勢顯著,魯棒性極強。

4. 業務相關評測SOTA

在內部業務測試,其資訊抽取與文書分類能力超越 Gemini-2.5-Flash、Qwen-235B-VL 等主流通用商業和開源模型。特別是在醫療入院記錄、出院小結等強業務場景中,領先優勢尤為明顯,Unisound U1-OCR 以 3B 規模的引數獲得比更大規模通用 VLM 更好的評測效能。與較小尺寸的文件解析任務模型相比,得益於模型多項創新舉措,在業務級資訊抽取等深層語義資訊理解的能力表現更好。

三、面向真實場景:4大核心能力助推U1-OCR從「讀懂」邁向「執行」

作為開  啟OCR 3.0時代的文件智慧基礎大模型,除了在通用評測中斬獲多項SOTA,Unisound U1-OCR更立足工業級場景需求,打造了四大核心能力,實現從讀懂執行的業務落地。

1. 可信可查:精準溯源,結果可驗

模型獨創「坐標-文字-語義」融合架構,實現畫素級精準定位與完整證據鏈構建。在完成資訊抽取的同時,系統精準標示資訊在文件中的來源位置,使結果審核過程全透明、可追溯,從技術層面保障文件處理結果的可信度,徹底解決傳統文件處理「結果不可驗」的行業難題。

例如,在企業審核場景中,審核人員無需大海撈針般翻閱原文,點選抽取結果即可實時高亮定位原始位置。這種「人機協同」的閉環將審核耗時縮短至秒級,讓人工漏檢率降至最低,真正實現了「可信任的AI」。

2. 業務融合:開箱即用,Agent Ready

通用OCR工具在專業領域存在侷限——例如醫保結算單中「自付一」「自付二」與「個人自費」的邏輯關系,或合同中金額大小寫的校驗規則,都需要領域知識支撐。

Unisound U1-OCR在基礎模型之上,融入了雲知聲在醫療、金融等領域的行業知識積累,模型可基於業務邏輯進行多欄位關聯校驗。在內部業務測試中,面向50餘種常見業務文書的分類準確率超過99%。

3. 高效部署,安全可控

模型深度支援私有化與離線部署,可在無外網環境下穩定執行,完美匹配政務、醫療、金融等高安全等級行業的資料隱私保護需求。同時,透過版面級並行解碼與多Token預測架構等最佳化措施,一份十多頁的文件,整理處理可在數秒內完成,高效的文件處理能力,讓工業級文件智慧能力觸手可及。

4. 超強適配,攻克複雜場景

針對企業實際業務中遇到的非標準拍照、文件彎折模糊、複雜花式排版、多語言混排等各類極端複雜文件場景,Unisound U1-OCR仍能保持穩定、高精度的處理表現,徹底擺脫傳統技術對標準化文件的依賴,真正適配企業真實業務的全場景需求。

 

明略科技發布大模型產品線 DeepMiner,打造商業資料分析可信智慧體

北京2025年10月6日 /美通社/ — 近日,中國企業級大模型與資料智慧領軍企業——明略科技正式推出專有大模型產品線DeepMiner。該產品線定位於商業資料分析,旨在透過可信的智慧體,為企業提供更高效、可驗證的資料處理和決策支援能力。

 

The Introduction of DeepMiner

明略科技創始人、CEO兼CTO吳明輝表示,人工智慧的發展已逐步進入以智慧體為核心的新階段。與面向消費者的「一句話生成」類應用不同,企業在生產環境中更關注結果的準確性和可追溯性。DeepMiner的推出,正是為了滿足企業級場景對透明度和可靠性的需求。

據瞭解,DeepMiner採用多智慧體架構(MoA),可針對每個細分業務板塊,匹配最優模型進行處理,相較於MoE架構,大幅提升了系統最佳化效率;從任務分解、工具呼叫到結果生成,使用者均可清晰檢視每一步操作的邏輯,在必要時還可透過人機互動機制,隨時人工幹預,不僅大幅降低了「幻覺」發生率,更讓輸出結果具備了可驗證性;此外,模型深度整合廣告、零售、電商等商業領域資料庫,確保智慧體分析資料的真實性與全面性,從源頭規避AI幻覺 。經實際測試,DeepMiner在垂直行業場景中的「幻覺」率遠低於通用模型水平。

技術方面,DeepMiner由智慧中樞——Foundation Agent統一排程,承擔起各元件協同工作的統籌職責。Cito模型作為DeepMiner的分析決策中樞,專為深度推理而設計,它能為復雜商業問題動態構建專業推理鏈路,利用人機協作縮小動作空間,提高任務執行的效率和準確率;Mano模型作為DeepMiner的自動化執行引擎,讓智慧體真正學會了「看」與 「點」, 能夠在復雜的軟體與瀏覽器環境下實現精細化操作。透過Foundation Agent的統一排程,DeepMiner可以將Cito的深度推理規劃能力與Mano的精準執行能力深度融合,從而打通從「商業洞察」到「業務執行」的端到端智慧自動化閉環。

明略科技DeepMiner產品負責人黃楠介紹,人工智慧從生成式 AI(Generative AI)發展到 智慧體AI(Agentic AI)最大的突破在於,Agent給大模型安裝了眼睛和手腳,能夠主動執行任務。其精準的工具呼叫能力,依賴於Browser Use Agent(BUA)與 Computer Use Agent(CUA)效能。然而,通用大模型並非為操作軟體而訓練,因此在復雜商業場景的規劃、操作效果往往差強人意。明略科技自研的Mano模型透過持續強化學習,能夠自主探索並適應全新的平臺與業務流程,在實際業務場景上盡顯優勢。目前,Man已登頂全球兩大權威基準測試——Mind2Web、OSWorld,均達到SOTA(State of the Art)水平。

明略科技創始人、CEO兼CTO吳明輝表示:「可信是企業應用AI的核心標準,而DeepMiner 的目標,正是以可信的智慧體模型+資料,為企業提供可信生產力。」

從大資料到大模型領域,明略科技憑借近二十年在資料智慧賽道的深耕,充分展現了穿越技術週期的實力。此次DeepMiner專有大模型產品線的發布,標志著明略科技在大模型時代的重要戰略佈局。未來,明略科技還將基於DeepMiner,推出面向金融、法律、人力資源、製造等垂直行業的專屬智慧體。

⚠️ 重要提醒: 警惕潛在的資料合規風險、演算法公平性風險、智慧財產權風險和虛假宣傳風險。進行充分的審查和評估,並根據實際情況採取必要的措施。

全球雙榜SOTA!明略科技專有大模型 Mano開啟GUI智慧操作新時代

北京2025年10月6日 /美通社/ — 2025年,Agent無疑是AI圈的熱詞。行業普遍認為:真正有用的Agent,必須學會使用手機和電腦,像人一樣操作GUI。

近日,中國企業級大模型與資料智慧企業——明略科技推出的專有GUI大模型 Mano在行業公認的Mind2Web和OSWorld兩大基準測試中,均取得了創紀錄的SOTA成績。透過線上強化學習和訓練資料自動採集兩大核心創新,Mano為GUI智慧體領域提供了一套可擴充套件、可持續進化的新正規化。

Mano在OSWorld-Verified榜單的Foundation E2E GUI & Specialized Model評測中取得SOTA。
Mano在OSWorld-Verified榜單的Foundation E2E GUI & Specialized Model評測中取得SOTA。

榜單連結:https://os-world.github.io/
技術報告連結:https://www.mininglamp.com/news/6394/

關鍵突破:

1.Mind2Web:Mind2Web覆蓋137個網站、2350+真實任務,旨在考察智慧體能否在複雜多變的DOM結構裡精準找到目標元素,並完成整個操作鏈。Mano展示出「看得準、做得成」的核心優勢。

技術報告顯示,Mano的元素精度 (Ele.Acc)和步驟成功率(Step SR)指標遙遙領先,在準確識別、定位介面元素,以及成功執行多步任務能力上達到新高度。Mano的操作F1 (Op.F1) 指標與此前頂尖模型持平甚至略高,能夠真正將複雜任務轉化為成功的操作序列。

2. OSWorld-Verified:更難的挑戰來自桌面端。OSWorld-Verified涵蓋了369個跨應用任務,覆蓋10類應用,包含瀏覽器,辦公軟體等多個型別,每一個操作都和真實桌面場景無縫對接。

技術報告顯示,在OSWorld-Verified榜單的Foundation E2E GUI & Specialized Model 評測中,Mano直接把成功率提升到 41.6±0.7%,超過qwen、GUI-Owl、opencua等模型。

技術創新:

亮點一:首次提出「線上強化學習」

DeepSeek橫空出世以來,GRPO已經成為強化學習黃金正規化。現有的模型訓練大多侷限在離線強化學習的範疇,深度依賴事先收集好的資料集。但在GUI互動智慧體領域,任何操作都與真實的系統互動環境密切相關。

因此,Mano在GUI互動領域首次提出「線上強化學習」的訓練正規化,並推出訓練資料自動採集的「探索器」,讓智慧體時刻依賴最新資料進行學習,並在「嘗試新的行動以獲取資訊」和「基於已有知識採取最優行動」之間取得平衡。

為了在真實的互動環境中不斷強化以提高適應性和靈活性,明略科技建立了一個模擬環境池,包括瀏覽器環境(BUA)和桌面環境(CUA),讓模型在真實互動中採集更多樣化的環境資料,彌補了離線軌跡分佈稀疏的侷限性,最終在多樣化的Web GUI場景中展現出更強的魯棒性。

同時,採用線上取樣 + 離線過濾的創新方式:先收集軌跡,再過濾噪聲資料,動態調節任務難度分佈,有效避免了因失敗軌跡導致學習效率低下的問題。

消融實驗結果顯示,加入線上強化學習後,模型在OSWorld-Verified資料集的平均分數產生了質的飛躍,相比離線強化學習的模型結果提升了 7.9,達到 41.6。

亮點二:智慧探索,採集真實環境軌跡

儘管大模型能夠理解籠統的指令,但在多步驟操作的目標驅動型任務中,往往無法將大目標分解為具體的執行步驟。因此,研發人員需要為互動任務構建專用的模型和智慧體。在這一過程中,海量的高質量互動軌跡資料不可或缺。過去,這類資料往往需要人工構建或標注,成本高、耗時長。對此,明略科技設計了訓練資料自動採集的方法,從根本上提升了資料收集的效率和準確性,這正是Mano的第二大創新。

明略科技搭建了一個可擴充套件的虛擬環境叢集,用於模擬多種互動場景。針對每個目標應用,大模型自動生成目標清單,並對目標進行優先順序排序,過濾掉使用頻率極低的功能,為後續探索提供明確的上下文指導。

元素提取方面,明略科技為網頁環境定製了Chrome外掛「Mano-C」,全面提取網頁中的互動元素,捕捉其空間坐標與語義屬性。針對桌面環境,技術團隊則採用A11y Tree解析與 OmniParseV2協同過濾的方法,確保覆蓋更多互動元素。

資料標注方面,明略科技利用大模型為每個提取的元素生成語義標籤、功能描述,以及互動類別,形成結構化的語義對齊資料,為後續訓練提供有效監督。

為了提升資料採集的智慧程度,技術團隊設計了基於Prompt的探索模組,用於智慧選擇互動元素,並引入顯式約束,避免路徑迴圈和冗餘分支。在探索過程中,採用深度優先搜尋(DFS)策略,系統會擷取截圖並儲存帶註釋的互動資料。完成探索後,透過軌跡評估機制,篩選出高質量的互動序列。整個過程不斷迴圈,每一步都會檢查是否達到最大探索深度。

Mano的SOTA表現,得益於明略科技多年來在大模型領域的積累。2024年,明略科技的超圖多模態大語言模型(HMLLM)和Video-SME資料集在腦電圖、眼動等非標模態資料處理領域取得顯著突破,榮獲ACM MM 2024最佳論文提名。2025年,明略科技推出企業級商業資料分析可信智慧體DeepMiner,Mano作為DeepMiner的自動化執行引擎,讓智慧體真正學會了「看」與「點」,在複雜的軟體與瀏覽器環境下實現了精細化操作。展望未來,明略科技將進一步最佳化Mano在應用和端側部署能力,加速企業智慧化轉型程序。

⚠️ 重要提醒: 1. 謹防誇大宣傳,避免不實陳述。2. 重視資料安全和隱私保護,確保資料收集、處理和使用符合相關法律法規要求。3. 注意技術倫理,避免不當模仿人類能力。4. 關注廣告法規,避免違反廣告法的相關規定。