转写说明

本文基于已校验的公开原文进行结构化转写与事实梳理,非原文转载。 转写保留可核验的技术事实,并将工程建议与来源观点明确分开。

核心结论

大量单词数据导入数据库时,直接使用外部 JSON 而不经过处理会产生字段不匹配、数据重复、格式不一致等问题。数据清洗的核心在于把外部数据整理成符合当前系统业务约束的格式,而不是简单的格式转换。AI Coding 的关键思路是让 AI 生成处理工具而非直接处理数据,通过提供数据样例、目标格式和转换规则,AI 能够编写可重复执行的脚本。上下文管理的原则是给足关键上下文但不给无关上下文,避免模型在大量原始数据中消耗 token。验证和 Git 管理仍然是保障结果正确性的必要环节。

能力机制

AI 在数据清洗场景中能够根据少量样例生成完整的转换脚本。这种能力的实现依赖于三个要素的提供:原始数据格式示例、目标数据结构定义、转换规则说明。来源中演示了一个典型场景,从原始 JSON 的 trans 数组取第一个元素作为 meaning,过滤 word 为空的记录,去除重复单词,最终输出 CSV 格式。

项目长期信息可以通过 AGENTS.md 等文件集中管理,包含技术栈、代码规范、数据库结构等内容,使每次 Prompt 只需要描述当前具体任务,而非重复介绍项目背景。

快速开始

数据清洗脚本的基本工作流程在来源中有所体现。首先从外部获取 JSON 数据,然后分析原始数据结构,接着确定目标表需要的字段,定义清洗规则,由 AI 编写转换脚本。

来源中提到的目录结构示例:

scripts/convert-words.ts scripts/validate-words.ts scripts/import-words.ts

脚本需要完成读取 JSON、遍历记录、字段转换、去重、过滤异常、生成 CSV 等步骤。生成 CSV 后还应进行校验和抽样审核,最终导入数据库。

Git 配合 Conventional Commits 的使用流程:查看 git diff 进行 Review,运行测试,确认功能后提交。来源列举的类型包括 feat、fix、docs、refactor、style、test、chore。

适用边界

数据清洗脚本适用于 CSV、Excel、JSON、第三方 API、旧数据库、日志、爬虫数据等各类外部数据的导入场景。当数据量大且规则明确时,使用脚本批量处理优于逐条处理。

AI 生成脚本的方式适用于规则明确、数据量大、重复度高的任务。对于一次性的小数据处理,偶尔直接让 AI 处理也可以接受。

上下文范围的把控上,需要避免两个极端:一是给 AI 无脑读取所有文件,应该控制上下文范围而不是禁止上下文;二是完全不给关键上下文,导致模型只能猜测。真正应该避免的是与任务无关的文件、大量原始数据和无意义的历史材料。

验证环节是必须的,AI 生成脚本不等于结果自动正确。Git 在 AI Coding 时代反而更加重要,用于追踪改动、确认预期、发现错误和恢复。

核验清单

数据清洗结果需要进行的校验项包括:检查总行数是否符合预期、检查是否存在空字段、检查是否存在重复单词、进行随机抽样验证、核对典型单词的转换结果。

AI 生成代码后的验收流程:执行 git diff 查看改动内容、逐项 Review 修改是否符合预期、运行测试确认功能正常、确认无误后使用 Conventional Commits 格式提交。

上下文提供的检查点:项目技术栈是否明确、数据库 schema 是否已定义、字段类型和约束是否清晰、业务规则是否完整说明、需要操作的功能范围是否界定清楚。

来源与核验

  • 原始文章
  • 页面事实以原始来源及其引用的官方资料为准;版本、星标和模型能力会随时间变化。
  • AI Stack 不公开抓取到的全文快照,只发布独立转写与来源入口。

站内链接

相关文章