Prévia do material em texto
Podcast Disciplina: Site Reliability Engineering (SRE) Título do tema: Plano de recuperação de desastres e Framework SRE Autoria: Arlindo Batista Xavier Filho Leitura crítica: Marco Ikuro Hisatomi Abertura: Olá, alunos! No podcast de hoje vamos falar sobre Plano de recuperação de desastres e Framework SRE! Muito bem, todos nós sabemos como a tecnologia da informação e comunicações vem mudando nossas vidas não é mesmo? A maneira como fazemos negócios, como interagimos com outras pessoas e como as empresas mudaram e são dependentes dela. Agora imagine o seguinte cenário: Você é o administrador um DataCenter de uma empresa de Contact Center, contendo 10 servidores essenciais para que os mais de 700 funcionários possam atender chamadas receptivas de uma conta de uma operadora de telefonia fixa que opera 365x7x24, sendo a principal fonte de receita da empresa trazendo R$ 7.500.000,00 (sete milhões e quinhentos mil reais) por mês para a empresa em faturamento. Hoje, mais um dia normal, você analisando os indicadores de desempenho de um dos servidores, notou uma anomalia de processamento. Era algum processo tomando o recurso do processador, não prestou muita atenção, porém o servidor parou de responder. Na produção, os usuários do sistema começam a abrir chamados por não conseguirem acessar os arquivos na rede, seu funcionário Felipe recebe o chamado e começa a verificar o motivo da parada de resposta do servidor, logo toma a atitude de reiniciar o servidor. Nada anormal, por enquanto, ele sempre reinicia o servidor de tempos em tempos. O servidor reinicia normalmente, mas ele continua inacessível, logo outros servidores, começam a travar também e reiniciam, agora já são vários servidores afetados: e-mail, CRM, ERP, Aplicativos, Impressão, Antivírus, DNS, WEB e telefonia. Todos os seus servidores foram afetados e a sua operação infelizmente entra em colapso parando completamente. Os telefones estão mudos, os celulares estão tocando sem parar, são os clientes, diretores comerciais, diretores administrativos, gente da alta W B A 1 1 3 9 _ v1 .0 administração que já foram informados e estão querendo uma resposta para essa parada da operação. Você junta a sua equipe, aciona os funcionários que já chegaram para a troca de turno, porém ainda não assumiram o seu posto e decide iniciar seu plano de recuperação de desastre. Em 40 minutos consegue subir os 10 servidores, todos seus funcionários do departamento de tecnologia da informação e comunicações estão desempenhando as tarefas previstas nos procedimentos, afinal há poucas semanas foi feito um treinamento com a equipe, justamente prevendo o caos como acabara de acontecer. Todos foram treinados e assumiram suas atribuições. A operação voltou ao normal. O tempo total de parada foi em torno de 48 minutos, que para você parecia uma eternidade. Seu plano de recuperação de desastres, que fora testado semanas antes funcionou como um relógio. Na análise do problema, ficou evidenciado que sofreram sequestro de dados, os servidores foram criptografados e os atacantes haviam solicitado 100 bitcoins para liberarem os servidores. Não preciso, não é mesmo? Agora temos que rever nossos procedimentos para que essa ameaça seja totalmente extinta. Na prática vimos a importância de se ter e manter um plano de recuperação de desastres. Nessa experiência, tudo podia ter dado errado, não é mesmo? Agora fica a lição da importância de se ter um plano de recuperação de desastres. Se você não tem um na empresa, vamos criar e implementar um? Já passou da hora não é mesmo? Fechamento: Este foi nosso podcast de hoje! Até a próxima!