"IA que deteta riscos nas suas câmeras existentes" é a proposta. Mas como funciona realmente? Este artigo explica o mecanismo de visão computacional em linguagem simples — sem jargão de aprendizagem de máquina, sem requerer nenhuma formação técnica.
O que a câmera vê: pixels
A câmera de CFTV produz uma sequência de imagens — frames. Cada frame é uma grelha de pixels, cada pixel um valor numérico representando a cor e o brilho daquele ponto. Uma câmera de 1080p produz cerca de dois milhões de pixels por frame, e a um frame por segundo, isso é dois milhões de números a chegarem a cada segundo.
Para um humano, esses números fazem uma imagem. Para a câmera, são apenas números.
O que o modelo de IA faz: padrões em pixels
O modelo de IA é um programa de computador que recebeu dezenas de milhares de exemplos de imagens e foi ensinado a reconhecer padrões específicos nelas. "Quando este conjunto de valores de pixel aparece nesta disposição, é uma pessoa. Quando este outro conjunto aparece, é uma empilhadeira. Quando estes dois padrões estão dentro desta distância um do outro, é um conflito de proximidade."
O treino acontece antes da implantação, usando dados de imagem de locais industriais reais. O resultado é um modelo que pode examinar um novo frame e produzir um julgamento: "Há uma pessoa aqui, uma empilhadeira ali, e estão demasiado próximos."
A cadeia de inferência num frame
Quando um frame chega ao sistema, a cadeia de processamento corre em milissegundos:
Passo 1 — Deteção de objeto: O modelo examina o frame e produz uma lista de objetos detetados com as suas localizações e pontuações de confiança. "Pessoa: localização XY, confiança 94%. Empilhadeira: localização XY, confiança 89%."
Passo 2 — Classificação: O modelo aplica regras de segurança. A pessoa está numa zona de exclusão? O veículo está acima do limite de velocidade? A pessoa está a usar o EPI correto para esta zona?
Passo 3 — Decisão de alerta: Se uma regra de segurança for violada, o sistema gera um alerta com câmera, tipo de evento, carimbo de data/hora e um clipe de vídeo do momento.
O frame seguinte chega 40 milissegundos depois. A cadeia corre novamente.
Por que não são necessárias novas câmeras
O modelo de IA processa qualquer feed de vídeo que possa ser ingeri pela plataforma — independentemente de qual câmera o produziu. Uma câmera IP compatível com ONVIF de 2016, uma câmera Hikvision de 2020, uma câmera de marca branca instalada originalmente para segurança — todas produzem feeds de vídeo que o sistema pode processar.
O que importa é o que está no feed (resolução, taxa de frames, ângulo) não de onde veio. A fase de Discovery avalia a adequação de cada câmera para os casos de uso de deteção pretendidos e identifica quaisquer câmeras que precisem de ser substituídas ou reposicionadas.
Como o sistema se melhora ao longo do tempo
Os modelos melhora através de um ciclo de reforço: deteção em produção no seu local gera novos dados de imagem, esses dados são usados para retreinar e ajustar os modelos, e os modelos melhorados são implantados de volta no local. Isso é o que "reforço contínuo específico do local" significa na prática — o modelo melhora continuamente com dados do seu ambiente específico, em vez de se manter estático.
É também porque a taxa de erro abaixo de 0,05% mantida em operações offshore não é uma figura de lançamento. É o resultado de oito anos de melhoria de modelo em dados do mundo real de um ambiente muito específico e exigente.

