最近我们要在flume的基础上做定制开发。我这块主要的开发是,对zip包中的文件做一定的处理后,以avro方式序列化。整个流程参考了flume的spoolDirectorySource的实现,因为主要是对spooldirectorySource中文件解析的部分进行了参考,所以下面的文章将会着重分析文件的解析部分。
特此声明:该文仅做记录和探讨之用,文中没有涉及任何公司业务相关的部分。
1、 spoolDirectorySource简要介绍
SpoolingDirectorySource可以监控指定目录,如果有有新文件出现在指定目录,source会将这个新文件按照配置中的的序列化类型,将文件序列化成一个个event。在文件中的所有的内容都读取到Channel之后(commit),Spooling Directory Source才会对文件进行重命名或者删除,这样就保证了数据不会丢失,虽然可能有一些冗余,但是是在我们接受范围内的。
2、spoolDirectorySource工作流程
下图是根据代码流程画的一个流程图,可能会有些谬误,仅供参考哈。
2.1、 Function--configure