6个月成为AI评估与可靠性工程师,该按这个顺序学习
如果我要花6个月成为AI评估与可靠性工程师,我会按照这个12阶段路径学习。
第一阶段,打好Python与测试基础。需要学习Python、pytest、Git、CI/CD基础、JSONL数据处理与pandas。
第二阶段,学习大语言模型(LLM)行为基础。核心内容包括token、采样、温度参数、推理工作量,以及理解模型输出为什么是非确定性的。
第三阶段,学习评估基础。内容包括黄金数据集、精确匹配与模糊匹配、裁判式大语言模型评估、评分规则设计,以及裁判偏差控制。
第四阶段,学习检索增强生成(RAG)技术评估。内容包括命中率、平均倒数排名(MRR)、归一化折损累计增益(NDCG)、RAGAS的忠实度与相关性指标,以及引用基础校验。
第五阶段,学习智能体与轨迹评估。内容包括工具调用正确性评估、步骤级评分、反事实运行,以及轨迹数据集构建。
第六阶段,学习评估框架与流水线。需要掌握DeepEval、promptfoo、RAGAS、OpenAI Evals这些工具,以及如何将评估接入持续集成回归闸门。
第七阶段,学习可观测性与链路追踪。内容包括Langfuse、LangSmith、Arize Phoenix、OpenTelemetry跨度、生产采样,以及故障挖掘。
第八阶段,学习生产监控与漂移检测。内容包括幻觉突升告警、质量漂移检测、影子流量与金丝雀评估。
第九阶段,学习可靠性模式。内容包括断路器、降级回退链、退避重试、幂等性,以及优雅降级。
第十阶段,学习持久执行与混沌工程。内容包括Temporal检查点、大语言模型压力测试、混沌实验,以及死循环检测。
第十一阶段,学习成本与财务运营管控。内容包括单次请求与单租户成本核算、预算告警、终止开关,以及缓存投资回报率测量。
第十二阶段,学习事件响应与组合服务水平目标。内容包括人工智能系统服务水平目标、运行手册、事后复盘、公开可靠性报告,以及开源评估工具开发。
多数人困在一直看教程的阶段。动手建造的人会得到工作机会,可以收藏这份规划。