规则化语料构建
我将筛选、去重和审计规则写入 Python 脚本与配置文件,使跨年度语料能够按同一标准重复生成。
从跨年度新闻档案到主题网络的可复现计算研究。
我使用 Python、中文自然语言处理、主题模型(LDA)和网络分析,构建了一套面向大规模中文政策文本的分析流程,覆盖语料筛选、模型比较、主题网络、长期趋势与结果验证。
项目处理的是跨越近 50 年的中文新闻档案。原始文本按年份分散保存,需要经过筛选、去重、清理、分词、主题建模、网络分析和趋势计算,才能回答长期政策叙事如何变化的问题。
我将抽象的传播研究问题拆解为可执行的计算步骤,用统一规则构建语料、用多组模型比较支持参数选择,并为关键阶段保留可检查的中间文件和验证报告。
从原始档案到研究输出,每个阶段都由脚本、配置和验证文件连接。
使用明确的关键词和频次规则批量筛选跨年度文本,并根据日期、标题和版次去重。
删除可识别的网页残留和出版元数据,同时保留文章正文与政策语义。
统一完成中文分词、停用词过滤和词汇表构建,生成主题模型所需语料。
比较多组主题数量,并结合一致性、主题区分度和代表性文本选择模型。
计算主题间相似度,构建加权网络,并通过社区检测识别更高层的叙事结构。
结合主题词、代表性文本和时间趋势进行人工解释,并对关键输出进行独立校验。
核心工作不是生成单张图表,而是把数据处理、模型选择、网络分析和质量检查组织为可重复运行的 Python 工程。
我将筛选、去重和审计规则写入 Python 脚本与配置文件,使跨年度语料能够按同一标准重复生成。
使用统一的中文分词、公开停用词表和文档频率规则生成词汇表与词袋语料,减少手工处理差异。
对不同主题数量进行批量训练,同时输出一致性、主题区分度、主题词和代表性文本,避免凭直觉确定模型。
将主题相似度转换为加权网络,执行社区检测和多轮稳定性检验,并为主要阶段生成 CSV 与 JSON 验证报告。
项目形成了可重复执行的分析流程、结构化研究输出和长期趋势图,并通过多阶段验证减少流程误差。
将一次性的文本研究整理为由脚本、配置、结构化输出和验证报告组成的完整流程。
从数十个语义主题中识别出三类高层叙事结构,并保留人工解释与复核环节。
将主题概率按年份聚合为趋势图,用于观察不同叙事重点在长期范围内的相对变化。
使用固定随机种子比较多组模型,对社区检测执行多轮稳定性测试,并检查文章数量、记录 ID、主题概率和阶段输出是否完整。
关键词语料可能遗漏隐含讨论,主题模型呈现的是统计关联而非因果关系;框架命名和最终解释仍需要人工阅读与判断。
汇总图表展示主题结构及其长期变化,不包含原始文章内容或个人信息。