返回 AI 项目

大规模中文文本的主题建模与网络分析

从跨年度新闻档案到主题网络的可复现计算研究。

我使用 Python、中文自然语言处理、主题模型(LDA)和网络分析,构建了一套面向大规模中文政策文本的分析流程,覆盖语料筛选、模型比较、主题网络、长期趋势与结果验证。

我的角色
学术研究、分析流程设计与开发者
语料规模
约 2,600 篇中文文本
时间跨度
近 50 年
核心方法
Python / NLP / LDA / NetworkX
中文政策文本主题相似度网络图
主题网络:节点表示语义主题,连线表示主题之间的相似关系,颜色对应网络社区。

问题与方法

项目处理的是跨越近 50 年的中文新闻档案。原始文本按年份分散保存,需要经过筛选、去重、清理、分词、主题建模、网络分析和趋势计算,才能回答长期政策叙事如何变化的问题。

我将抽象的传播研究问题拆解为可执行的计算步骤,用统一规则构建语料、用多组模型比较支持参数选择,并为关键阶段保留可检查的中间文件和验证报告。

分析流程

从原始档案到研究输出,每个阶段都由脚本、配置和验证文件连接。

从语料到趋势
  1. 01

    语料筛选

    使用明确的关键词和频次规则批量筛选跨年度文本,并根据日期、标题和版次去重。

  2. 02

    结构化清理

    删除可识别的网页残留和出版元数据,同时保留文章正文与政策语义。

  3. 03

    中文文本处理

    统一完成中文分词、停用词过滤和词汇表构建,生成主题模型所需语料。

  4. 04

    主题模型比较

    比较多组主题数量,并结合一致性、主题区分度和代表性文本选择模型。

  5. 05

    主题网络分析

    计算主题间相似度,构建加权网络,并通过社区检测识别更高层的叙事结构。

  6. 06

    解释与验证

    结合主题词、代表性文本和时间趋势进行人工解释,并对关键输出进行独立校验。

技术实现

核心工作不是生成单张图表,而是把数据处理、模型选择、网络分析和质量检查组织为可重复运行的 Python 工程。

规则化语料构建

我将筛选、去重和审计规则写入 Python 脚本与配置文件,使跨年度语料能够按同一标准重复生成。

可复现的中文 NLP 流程

使用统一的中文分词、公开停用词表和文档频率规则生成词汇表与词袋语料,减少手工处理差异。

多模型比较与选择

对不同主题数量进行批量训练,同时输出一致性、主题区分度、主题词和代表性文本,避免凭直觉确定模型。

网络分析与自动验证

将主题相似度转换为加权网络,执行社区检测和多轮稳定性检验,并为主要阶段生成 CSV 与 JSON 验证报告。

分析产出与可靠性

项目形成了可重复执行的分析流程、结构化研究输出和长期趋势图,并通过多阶段验证减少流程误差。

可复用分析流程

将一次性的文本研究整理为由脚本、配置、结构化输出和验证报告组成的完整流程。

主题与叙事结构

从数十个语义主题中识别出三类高层叙事结构,并保留人工解释与复核环节。

长期变化呈现

将主题概率按年份聚合为趋势图,用于观察不同叙事重点在长期范围内的相对变化。

验证机制

使用固定随机种子比较多组模型,对社区检测执行多轮稳定性测试,并检查文章数量、记录 ID、主题概率和阶段输出是否完整。

研究边界

关键词语料可能遗漏隐含讨论,主题模型呈现的是统计关联而非因果关系;框架命名和最终解释仍需要人工阅读与判断。

项目呈现

汇总图表展示主题结构及其长期变化,不包含原始文章内容或个人信息。

查看全部 AI 项目
三类高层叙事结构的长期相对变化趋势图
长期趋势:将主题网络中的高层叙事结构按年份聚合,观察不同叙事重点的相对变化。