实验日志约 4 分钟
从原始数据走到下一步。
自动化不只是把计算跑完,还应该告诉我们结果能不能用、接下来该试什么。
- 发布
- 更新
主题
自动化Python数据来源工程工作流
01
算完不等于流程结束
自动化常被描述为替代一次手工计算。这当然能节省时间,但更重要的机会,是把原始输入连接到一个能够被检查、也能够被执行的决定。
因此,有用的工作流不能只留下最终数字。它还应保留输入来自哪里、进行了什么变换、哪些内容没有通过验证,以及哪一个结果可以进入下一步。
02
输入和处理方法要跟结果放在一起
文件、参数、软件版本和中间输出都应可追溯。结果发生变化时,工作流应该帮助我们区分:是输入变了、方法变了,还是执行出了问题。
当一个流程跨越科学软件、自定义 Python 代码与人工复核时,这一点尤其重要。可重复性的起点,是让路径本身可见。
03
先决定遇到什么情况必须停下来
当必要数据缺失、格式错误或彼此矛盾时,可靠的工作流应当停止。静默回退可能让流程看起来完成了,却削弱了输出背后的证据。
清楚的验证信息和被保留的中间证据,会把失败变成有用的信息:它告诉我们哪里需要注意,而不是把问题藏在一个完成的进度条后面。
04
根据下一步要做什么来设计输出
最合适的输出格式取决于接下来要做什么:比较、复核、继续实验,还是进入物理测试。表格、图形和摘要都应减少计算结果与下一次决策之间的距离。
这也是我判断自动化的标准:不只看它能否运行,还要看它是否帮助人理解哪些已经知道、哪些仍不确定、下一步最值得尝试什么。
每一页都会说明项目做了什么、公开了哪些证据,以及还有什么没有验证。
浏览全部工程笔记