Logo Passei Direto
Buscar
Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Prévia do material em texto

Podcast 
Disciplina: Site Reliability Engineering (SRE) 
Título do tema: Plano de recuperação de desastres e 
Framework SRE 
Autoria: Arlindo Batista Xavier Filho 
Leitura crítica: Marco Ikuro Hisatomi 
 
 
 
Abertura: 
Olá, alunos! No podcast de hoje vamos falar sobre Plano de recuperação de 
desastres e Framework SRE! 
Muito bem, todos nós sabemos como a tecnologia da informação e 
comunicações vem mudando nossas vidas não é mesmo? A maneira como 
fazemos negócios, como interagimos com outras pessoas e como as empresas 
mudaram e são dependentes dela. 
Agora imagine o seguinte cenário: Você é o administrador um DataCenter de 
uma empresa de Contact Center, contendo 10 servidores essenciais para que 
os mais de 700 funcionários possam atender chamadas receptivas de uma 
conta de uma operadora de telefonia fixa que opera 365x7x24, sendo a 
principal fonte de receita da empresa trazendo R$ 7.500.000,00 (sete milhões e 
quinhentos mil reais) por mês para a empresa em faturamento. 
Hoje, mais um dia normal, você analisando os indicadores de desempenho de 
um dos servidores, notou uma anomalia de processamento. Era algum 
processo tomando o recurso do processador, não prestou muita atenção, 
porém o servidor parou de responder. 
Na produção, os usuários do sistema começam a abrir chamados por não 
conseguirem acessar os arquivos na rede, seu funcionário Felipe recebe o 
chamado e começa a verificar o motivo da parada de resposta do servidor, logo 
toma a atitude de reiniciar o servidor. Nada anormal, por enquanto, ele sempre 
reinicia o servidor de tempos em tempos. 
O servidor reinicia normalmente, mas ele continua inacessível, logo outros 
servidores, começam a travar também e reiniciam, agora já são vários 
servidores afetados: e-mail, CRM, ERP, Aplicativos, Impressão, Antivírus, DNS, 
WEB e telefonia. 
Todos os seus servidores foram afetados e a sua operação infelizmente entra 
em colapso parando completamente. 
Os telefones estão mudos, os celulares estão tocando sem parar, são os 
clientes, diretores comerciais, diretores administrativos, gente da alta 
W
B
A
1
1
3
9
_
v1
.0
 
 
 
administração que já foram informados e estão querendo uma resposta para 
essa parada da operação. 
Você junta a sua equipe, aciona os funcionários que já chegaram para a troca 
de turno, porém ainda não assumiram o seu posto e decide iniciar seu plano de 
recuperação de desastre. 
Em 40 minutos consegue subir os 10 servidores, todos seus funcionários do 
departamento de tecnologia da informação e comunicações estão 
desempenhando as tarefas previstas nos procedimentos, afinal há poucas 
semanas foi feito um treinamento com a equipe, justamente prevendo o caos 
como acabara de acontecer. Todos foram treinados e assumiram suas 
atribuições. A operação voltou ao normal. O tempo total de parada foi em torno 
de 48 minutos, que para você parecia uma eternidade. 
Seu plano de recuperação de desastres, que fora testado semanas antes 
funcionou como um relógio. 
Na análise do problema, ficou evidenciado que sofreram sequestro de dados, 
os servidores foram criptografados e os atacantes haviam solicitado 100 
bitcoins para liberarem os servidores. Não preciso, não é mesmo? 
Agora temos que rever nossos procedimentos para que essa ameaça seja 
totalmente extinta. 
Na prática vimos a importância de se ter e manter um plano de recuperação de 
desastres. Nessa experiência, tudo podia ter dado errado, não é mesmo? 
Agora fica a lição da importância de se ter um plano de recuperação de 
desastres. Se você não tem um na empresa, vamos criar e implementar um? 
Já passou da hora não é mesmo? 
 
 
Fechamento: 
Este foi nosso podcast de hoje! Até a próxima!

Mais conteúdos dessa disciplina