Analista de Suporte de Sistemas Pleno | Digital Equities
Sobre a área:
Somos responsáveis por manter a estabilidade e a continuidade do serviço em produção, garantindo resposta eficiente a incidentes e evolução contínua da operação. Nessa estrutura, a IA é utilizada para aumentar produtividade e assertividade na análise e resposta, mantendo governança, rastreabilidade e revisão humana para decisões críticas.
Atuamos com gestão de incidentes, observabilidade, análise de causa raiz (RCA/Problem Management), runbooks e automações, sempre transformando incidentes em aprendizado e backlog para as squads com decisões de release e mudança considerando prontidão operacional e risco.
A tecnologia no BTG é um dos pilares das grandes transformações do banco. Por isso, investimos continuamente nas ferramentas e práticas mais modernas do mercado.
Valorizamos a meritocracia e contamos com uma equipe versátil, colaborativa e engajada. Buscamos pessoas com mentalidade de dono, que sonham grande e são apaixonadas por aprender e compartilhar conhecimento.
No seu dia a dia:
Atuará na gestão de incidentes: detecção, triagem, contenção, mitigação e recuperação, coordenando war room quando necessário e comunicando-se de forma estruturada com stakeholders;
Evoluirá dashboards, alertas e instrumentação, melhorando a relação sinal/ruído e dando suporte a SLO/SLI e à visão de disponibilidade das plataformas;
Conduzirá análises de causa raiz, identificando causas estruturais e recorrências e definindo ações corretivas/preventivas que retroalimentam o backlog das squads;
Criará e manterá runbooks/playbooks, automatizará rotinas de mitigação e preparará readiness para janelas críticas, estratégias de rollback e procedimentos de contingência;
Usará IA para acelerar diagnóstico, triagem, sumarização de incidentes e documentação, com senso crítico e validação das recomendações;
Manterá gestão do conhecimento e evidências (documentação viva, postmortems, lições aprendidas), garantindo rastreabilidade para auditoria;
Terá relacionamento próximo com áreas de negócio, PMs, squads de tecnologia e Risco/Compliance.
Esperamos de você:
Formação superior completa em engenharia, ciências da computação ou áreas relacionadas;
Forte capacidade de troubleshooting, conforto com ambientes produtivos e tratativa de incidentes, com experiência em logs, métricas e ferramentas de observabilidade;
Tecnologias obrigatórias: Datadog (ou ferramenta equivalente de observabilidade), Azure, GitHub (issues, PRs, evidências técnicas), Confluence (runbooks, postmortems) e ferramentas de IA para operação (análise de logs, sumarização de incidentes, busca em conhecimento, recomendação de runbooks/ações);
Tecnologias desejáveis: Kibana/Elastic, ServiceNow / Jira Service Management, Power BI, scripting/automação (Python, Shell) e ferramentas de AIOps (correlação de eventos, detecção de anomalia, redução de ruído);
Disponibilidade para trabalhar no modelo híbrido no escritório de São Paulo.
Diferenciais:
ITIL (Incident/Problem/Change Management), COBIT, fundamentos de SRE (SLO/SLI, error budget, incident command)
Conhecimentos de IA aplicada (uso seguro, validação de resultados, privacidade/compliance, governança de prompts e rastreabilidade);
Benefícios:
Participação nos Lucros e Resultados (PLR);
Auxílio Alimentação e Refeição;
Plano Médico;
Plano Odontológico;
Auxílio Creche/Babá;
Vale Transporte;
WellHub;
TotalPass;
Programa de Apoio Pessoal (EAP);
Planos por adesão como Previdência Privada e Seguro de Vida;
Desconto em Farmácia;
Programa de Gestantes;
Licença Maternidade e Paternidade Estendida – empresa Cidadã.