面试题
如何解决消息队列的延时以及过期失效问题?消息队列满了以后该怎么处理?有几百万消息持续积压了几个小时,说说怎么解决?
面试官心里分析
你看这问法,其实本质针对的场景都是说,可能你的消费端出了问题,不消费了或者消费的极其慢,接着就坑爹了,可能你的消息队列集群的磁盘快写满了,都没人消费,这时候怎么办?或者是整个这就积压了几个小时,你这个时候怎么办?或者是你积压的时间太长了,导致比如rabbitmq设置了消息过期时间后就没了怎么办?
所以就这事,其实线上挺常见的,一般不出,一出就是大case,一般常见于,举个例子,消费端每次消费要写mysql,结果mysql挂了,消费端阻塞那了,不动了。或者是消费端出现上面问题,导致消费速度很慢。
面试题分析
关于这个事,我们一个一个来梳理,先假设一个场景,我们现在消费端出故障了,然后大量消息堆积在mq里,现在事故了,慌了
(1)大量消息在mq里积压了几个小时还没解决
这个是我们真实遇到的一个场景,确实是线上故障了,这个时候要不然就是修复consumer的问题,让他恢复消费速度,然后傻傻的等待几个小时消费完毕。这个肯定不能在面试的时候说吧。
一般这个时候,只能操作紧急扩容了,具体操作步骤和思路如下:
- 先修复consumer的问题,确保其恢复消费速度,然后将现有consumer都停掉
- 临时建立好原先10倍或者20倍的queue数量
- 然后写一个临时的分发数据的consumer程序,这个程序部署上去消费积压的消息,消费之后不做耗时的处理,直接均匀轮询写入临时建立好的10倍数量的queue
- 接着临时征用10倍的机器来部署consumer,每一批consumer消费一个临时queue的数据
- 这种做法相当于临时将queue资源和consumer资源扩大10倍,以正常的10倍速度来消费数据
- 等快速消费完积压数据之后,得恢复原先部署得架构,重新用原先得consumer机器来消费消息
(2)这里我们假设第二个坑
假设你用的是rabbitmq,rabbitmq是可以设置过期时间的(生产环境不建议使用),就是TTL,如果消息在queue中积压超过一定的时间就会被rabbitmq给清理掉,这个数据就没了,那这是第二个坑了,这就不是说数据会大量积压在mq里,而是大量的数据会直接搞丢,
这个情况下,就不是说增加consumer消费积压的消息,因为实际上没啥积压,而是丢了大量的消息。我们可以采取一种方案,就是批量重导,这个我们之前线上也有类似的场景干过,就是大量的积压时候,我们直接丢弃数据,然后等高峰期过了以后,大家在喝咖啡熬夜到晚上12点后,用户都睡觉了。
这个时候我们就开始写程序,将丢失的那批数据,写个临时程序,一点一点的查出来,然后重新灌入mq里去,把白天丢失的数据给他补回来,也只能是这样了。
(3)这里我们假设第三个坑
如果走的方式是消息积压在mq里,那么如果你长时间没有处理掉,此时导致mq都快写满了,咋办?这个还有别的办法吗?没有,谁让你第一个方案执行的太慢了,你临时写程序,接入数据来消费,消费一个丢弃一个,都不要了,快速消费掉所有消息,然后走第二个解决方案,到了晚上在补数据吧。