撞墙:筛「美国客户」失败
亲眼看到国家字段有多种写法,筛选根本筛不全。
AI 列出美国的多种写法(USA / 美国 / U.S. / 美利坚 / us / United States 等约 10 条),并指出 DE/GB/JP 等其他国家也有多种写法。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
从筛选失败识别脏数据,并按字段契约批量规范化。
亲眼看到国家字段有多种写法,筛选根本筛不全。
AI 列出美国的多种写法(USA / 美国 / U.S. / 美利坚 / us / United States 等约 10 条),并指出 DE/GB/JP 等其他国家也有多种写法。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
先只统一美国一国的写法,体会「手改一列」的局限。
约 10 条被改;刷新后筛 US 能全部命中,但 DE/GB/JP 等还乱着——引出「逐列手改不可持续」。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
感受电话/邮箱/负责人也乱,意识到逐行手改在 600 行规模不可持续。
能说出电话/邮箱/负责人各自的脏法,并意识到逐行手改在 600 行规模下不可行——为下一步「AI 批量按契约洗」铺垫。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
用 AI 把所有国家写法一次性收敛成 ISO 编码。
国家下拉不再出现「USA / 美国 / U.S. / 美利坚」等重复写法,全部收敛成 ISO 编码;AI 报告改了多少条。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
把电话统一成 E.164,缺国码的标注而不臆造。
电话列变成「+国家码数字」的规整格式;缺国码的被标注「需人工确认」而不是乱补。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
把邮箱统一小写、去掉首尾空格。
邮箱列全部小写、无首尾空格。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
把负责人统一成规范中文姓名。
负责人列统一为规范中文姓名(无空格、无拼音)。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。
回顾四列字段契约,确认清洗没有回写原始 Excel。
能用一句话说清「字段契约」是什么,并指出此刻 dashboard 的清洗还没落回任何持久层——为下一模块「保存到哪」埋点。
只使用交付包内的课堂模拟数据;不得替换为真实客户隐私。涉及账号、密码、部署、发布、外发或第三方提交时,停在最终动作前等待人工确认。