H
Howardism
Plate IIEntities機器翻譯 · machine-translatedENHOWARDISM

LlamaIndex

這家 RAG 框架公司(run-llama)已將重心收斂至供代理程式使用的文件解析——LlamaParse(託管式、視覺型、輸出 Markdown、按頁計價)、LiteParse(Apache 2.0、本機執行、空間文字 + 邊界框)、LlamaExtract(輸入 Pydantic schema、輸出附引用的型別化 JSON)、LlamaCloud、事件驅動的 Workflows,以及它發布並領先的解析排行榜 ParseBench

Article metadata
Publication details
Published:August 11, 2026
Filed:Entity
Domain:Entities
Tags:RetrievalDocument ParsingAgent EngineeringOpen Source
Reading:5 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

LlamaIndex 插圖

資料來源#

摘要#

一家 AI 基礎設施公司(GitHub 組織 run-llama),其 Python/TypeScript 框架曾是 2023–24 年打造 RAG 應用的兩種預設方式之一。到了 2026 年,公司將自己描述為「領先的代理式文件 OCR 平台」;共同創辦人 Jerry Liu (@jerryjliu0) 在發布本頁所據的簡報時,直言這項重新定位:「如今我們的核心重點,已聚焦於供代理程式使用的頂尖文件解析。」框架依然存在,但產品已是解析器。

截至 2026 年年中,技術堆疊如下#

元件型態定位
LiteParseApache 2.0、本機執行、CLI 或瀏覽器內執行、零雲端、零 LLMPDF → 空間文字:每個 token 都標記 x/y/width/height/font/style,並具備區域偵測功能(標題、表格、圖表、註腳)。依 y 座標分組成列,依 x 座標分組成欄
LlamaParse託管式、以視覺為基礎、非同步批次 API、按頁計價「LiteParse 的能力止步之處。」預設輸出 Markdown——包含真正的表格、附說明文字的圖表、連結至錨點的註腳,並保留閱讀順序。parse_mode="agentic" 會逐頁執行視覺解析
LlamaExtract輸入 Pydantic schema,輸出經驗證的型別化 JSON以 schema 為先的路徑,完全略過檢索流程;每個擷取值都附有頁碼 + 邊界框作為引用
LlamaCloud託管式流程(解析 · 建立索引 · 檢索 · 擷取 · 託管式 Workflows + 追蹤記錄)無須自行執行基礎設施,也能進行相同的介入操作
Workflowsllama_index.core.workflow — 事件驅動圖、型別化 Pydantic 事件、持久化 Context、send_event/collect_events、stream_events編排的基本構件;步驟是非同步函式,透過型別簽章隱式連接
ParseBench約 2,000 頁經人工驗證的企業文件、5 個維度、arXiv 2604.08538發布於 Hugging Face(開放權重模型、本機執行、無須 API 金鑰)及 Kaggle(前沿模型、託管式提交)。兩邊使用相同的評測架構

兩層解析器的拆分,是其中在結構上頗有意思的選擇:以 Apache 2.0 授權免費提供確定性且保留版面的核心功能,並對處理掃描頁面、密集表格及難以解析的多欄版面的視覺層收費。這也為「把預算花在上游」的論點鋪路,不必購買產品也能採取行動。

以定價與基準測試建立定位#

有兩項刻意採取的做法,與其餘技術堆疊的銷售方式形成對照;值得視為論點,而非品質事實:

  • 按頁計價,而非按 token 計價。「費用固定、清楚可知、可逐項列帳。不必賭 token 用量。還沒寫程式,就能先估算一條處理 10k 份文件的流程。」公司將成本可預測性定位為直接使用通用 VLM 的差異化優勢。
  • 由供應商領先的公開基準測試。 ParseBench 評分的是語意正確性,而非文字重疊程度;它公開資料集與評測架構,並以同一套尺度比較開放權重模型與前沿模型——確實很有用,同時也是 LlamaParse Agentic 登上帕累托前緣的依據。簡報本身的保留說法值得沿用:「部署前先查證——實際數字會低於供應商報價。」Document Parsing as the Retrieval Bottleneck 記錄了搭配圖表的說明文字,在哪些地方誇大了專用模型相較於高設定前沿 VLM 的優勢。

人物#

  • Jerry Liu (@jerryjliu0) — 共同創辦人;他在 X 上發布這份簡報的串文(2026-05-25),將內容描述為「從 2023 到 2026,完整導覽 RAG、文件脈絡與 AI 代理程式」,並藉此說明公司如何將重心收斂至解析。
  • Pierre-Loic Doulcet (@hexapode) — 116 張投影片的 AI Engineer Singapore 2026 工作坊作者與主講人;這是此知識庫唯一的 LlamaIndex 來源;Document Parsing as the Retrieval Bottleneck 全文皆據此整理。

兩人目前都還沒有自己的頁面——每人只有一個來源,因此相關主張會標註於概念頁,而非個人簡介頁。

相關連結#

  • Document Parsing as the Retrieval Bottleneck — 公司的核心技術論點,也是根據其工作坊整理的頁面:瓶頸已從模型、檢索器移至文件本身。LiteParse(空間文字)、LlamaParse(Markdown)、LlamaExtract(schema 優先)與 ParseBench(衡量)是它所建議的修正技術堆疊中的四個環節。
  • Crystallizing Agent Work into Workflows — LlamaIndex Workflows 是該頁抽象討論的工作流程層之具體事件驅動實作:以型別化事件作為步驟間的契約、在人類審查暫停期間保留持久脈絡,以及宣告式的扇出/扇入。
  • Deep Research Agents — 深度研究是四種工作流程範例之一(拆解 → 平行子檢索 → 組合附引用的答案),其他範例包括合約審查、盡職調查,以及一種持續運作的「活知識庫」,會監看來源並重新發布事實層級的差異。
  • LLM-as-Compiler Knowledge Base — 架構上的競爭方案:此知識庫採用一次編譯的 wiki,對照 LlamaIndex 每次查詢時解析並檢索的流程;雙方對於長脈絡成本降低後檢索是否仍有必要意見相左,但都認同輸入時遺失的結構無法在下游復原。

資料來源#

  • Beyond RAG: Building Agentic Document Workflows with LlamaIndex — Pierre-Loic Doulcet,Beyond RAG: Building Agentic Document Workflows with LlamaIndex,AI Engineer Singapore 2026(116 張投影片,practitioner-opinion),以及發布簡報的 Jerry Liu X 串文。全文皆有直接的供應商利益衝突:此處的產品主張來自公司自身的定位,而 ParseBench 的排名則來自供應商自己的基準測試。客戶標誌投影片經 OCR 後成為無法辨讀的文字(CCMCX、Opepsi、MIcheliN、tabst),因此未保留任何客戶名單;「Backed By」投影片上清楚顯示 Norwest 與 Greylock
§ end
Cited by 2
Related articles