烛夜的学习星空

RAG 基础设施专题 Day 3 —— 针对学术文献的 Nougat

今天研读《Nougat: Neural Optical Understanding for Academic Documents》 开源实现:Nougat 1. 为什么要引入 Nougat ? PDF 是互联网上仅次于 HTML 的第二大主流文档

烛夜 发布于 2026-08-17

算法漫谈 Day 2 —— LayoutLMv3 文档 AI 基石

在研读 MinerU 工作的时候,发现其版面分析模型基座是 LayoutLMv3 ,对其很感兴趣,遂来研读一二。 论文标题:《LayoutLMv3: Pre-training for Document AIwith Unified Text and Image Masking》 开源实现:Layou

烛夜 发布于 2026-08-16

RAG 基础设施专题 Day 2 —— 数据源预处理之 MinerU

MinerU 是非常著名且广泛使用的 PDF 文档提取开源项目。 今天研读《MinerU: An Open-Source Solution for Precise Document Content Extraction》 开源实现:MinerU 1. 为什么要引入 MinerU ? 随着 LLM 与

烛夜 发布于 2026-08-12

RAG 学习专题 Day 8 —— 当 RAG 学会 “俯察品类之盛”

今天研读:《ColPali: Efficient Document Retrieval with Vision Language Models》 开源实现:ColPali 1. 为什么要引入 ColPali ? 文档检索将用户的查询与给定语料库中的相关文档进行匹配,它在许多工业应用中扮演非常重要的角

烛夜 发布于 2026-08-06

RAG 基础设施专题 Day 1 —— 数据源预处理之 Docling

对数据源的预处理是 RAG 系统在工程落地时所必须考量的一项基础设施。 今天研读 《Docling Technical Report》 开源模型:Docling 文档与示例:Github

烛夜 发布于 2026-08-03

RAG 学习专题 Day 7 —— 检索到了垃圾,怎么办?

今天研读《Corrective Retrieval-Augmented Generation (CRAG)》 开源实现:CRAG 有关标准 RAG 的内容,可以参考我的分享贴:《RAG 学习专题 Day 1 —— RAG 是怎样诞生的 ?》 有关 Self-RAG 的内容,可以参考我的分享贴:《

烛夜 发布于 2026-08-02

算法漫谈 Day 1 —— Leiden 社群检测算法

在研读 GraphRAG 的时候发现了 Leiden 社群检测算法,对其原理很好奇,遂来学习研读一二。 论文标题:《From Louvain to Leiden: guaranteeing well-connected communities》 原文补充信息可以点击上述链接打开 Nature 官网查

烛夜 发布于 2026-07-31

RAG 学习专题 Day 6 —— RAG 也要“吾日三省吾身”吗?

今天研读 《Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection》 开源实现:Self-RAG 1. 为什么要引入 Self-RAG ?以前的研究有什么不足?

烛夜 发布于 2026-07-30

RAG 学习专题 Day 5 —— 当神经科学进入 RAG

今天来研读《HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models》 开源实现:HippoRAG 1. 为什么要引入 HippoRAG ? 过往的研究有什么

烛夜 发布于 2026-07-28

RAG 学习专题 Day 4 —— LightRAG 有多 「Light」?

今天我们来研读香港大学 HKUDS 实验室的研究:《LightRAG: Simple and Fast Retrieval-Augmented Generation》 开源实现:LightRAG LightRAG 可以视作 GraphRAG 的一种改进方案。有关 GraphRAG 的内容,参见我的

烛夜 发布于 2026-07-26