Como montar um sistema de transcrição de alto desempenho internamente.

No ecossistema atual — definido pelos avanços na inteligência artificial —, as empresas com foco em tecnologia estão buscando de forma cada vez mais intensa e agressiva a integração da IA em suas operações. Algumas optam por terceirizar suas cargas de trabalho de IA, seja enviando seus dados diretamente a organizações como a OpenAI para processamento, enquanto outras se sentem mais à vontade construindo pequenas centrais de processamento em seus próprios instalações para lidar com essas cargas de trabalho, sejam elas quais forem.

Este blog se concentra na segunda opção, analisando como você pode construir internamente um equipamento de transcrição de alto desempenho que também possa ser usado para outros fins, como treinamento ou ajuste de modelos no futuro.

A Estrela Desta Montagem

Asus TUF 5090 32GB OC

Selecionamos a ASUS TUF 5090 32GB OC Edition. Escolhemos a série ASUS TUF por sua conhecida confiabilidade e durabilidade. Mesmo que tivéssemos que escolher novamente, ainda assim escolheríamos esta placa em vez de variantes que, segundo debates na internet, são mais rápidas. Esta variante custa cerca de US$ 3.900, o que é significativamente menos do que a maioria das outras variantes, e a diferença real de velocidade para inferência é insignificante. Não vale a pena gastar US$ 500–US$ 1.000 a mais por um aumento marginal de 1 a 3% no desempenho!

Por que um PC de IA de Alto Desempenho para o 3CX?

A solução de IA integrada do 3CX permite que as empresas executem modelos de transcrição localmente, aumentando significativamente a privacidade dos dados e oferecendo melhor controle sobre a capacidade de processamento. Se você tem uma empresa que precisa de transcrição quase em tempo real e tem muitas chamadas para processar, vai precisar de um equipamento de alta velocidade como o que estamos montando aqui.

Componentes do Equipamento

  • Placa de vídeo: ASUS TUF Gaming GeForce RTX 5090 OC Edition 32 GB GDDR7 (NVIDIA RTX 5090, PCIe 5.0) – US$ 4.140
  • SSD de alta velocidade (SO/Primário): Samsung 9100 PRO NVMe M.2 4 TB (PCIe 5.0, 14.800 MB/s de leitura) – US$ 620
  • Processador: Intel® Core™ Ultra 9 Desktop Processor 285K (24 núcleos, até 5,7 GHz) – US$ 568
  • RAM: 1 × 48 GB (2×24 GB) DDR5 6000 MHz Corsair Dominator Titanium RGB Intel XMP (CMP48GX5M2B6000C30) – US$ 1.420
  • Fonte de alimentação: CORSAIR HX1200i (2025) 1200 W, compatível com ATX 3.1 e PCIe 5.1 (totalmente modular, Platinum) – US$ 259
  • Placa‑mãe: ASUS TUF Gaming Z890‑PRO WiFi (Intel LGA 1851, ATX, PCIe 5.0, DDR5, WiFi 7) – US$ 315
  • Cooler de CPU: Noctua NH‑D15 G2 chromax.black (Torre Dupla Premium) – US$ 189

Total: US$ 7.511

Agora, alguns de vocês já devem estar vendo esse preço e pensando: “Ei, por que eu simplesmente não compro um DGX Spark da NVIDIA? É mais barato.” Mas, você já estaria no caminho errado se pensasse assim!

Embora o DGX Spark e soluções all‑in‑one semelhantes sejam anunciados como extremamente rápidos — e, reconhecidamente, tenham um ótimo marketing por trás —, eles são de 3 a 6 vezes mais lentos na transcrição de chamadas do que o equipamento que acabamos de montar. O DGX Spark e soluções semelhantes não possuem memória de GPU dedicada e, em vez disso, compartilham a memória RAM com o restante do sistema. Embora isso tenha a vantagem de permitir mais memória do que o normal, a desvantagem é que o sistema fica mais lento.

Reduzindo Especificações para Maior Economia

No que diz respeito especificamente a este equipamento, é verdade que parte do hardware é um pouco exagerado. Por exemplo, a quantidade de RAM pode ser reduzida para 16 GB, já que usaremos a VRAM da GPU para tarefas de inferência em vez da RAM comum. Além disso, se você quiser economizar mais US$ 100, pode trocar o 9100 PRO NVMe pela série 970‑990 PRO da Samsung. Um processador menos potente também serve, como um Core Ultra 5 245K/250K.

Na verdade, desde que a 5090 esteja presente, o restante pode ter suas especificações reduzidas consideravelmente, com exceção, talvez, da fonte de alimentação. Você poderia economizar cerca de US$ 1 mil reduzindo as especificações desse tipo de servidor.

Imagens da Montagem

 Asus TUF 4080 RTX 16GB OC vs an Asus TUF 5090 RTX 32GB OC

Na imagem acima, há uma comparação lado a lado entre uma ASUS TUF 4080 RTX 16 GB OC e uma ASUS TUF 5090 RTX 32 GB OC. Ambas as GPUs pesam cerca de 3 kg e são quase tão grandes quanto o antebraço de uma pessoa. Se você está planejando comprar uma GPU NVIDIA da série RTX de ponta para montar seu próprio equipamento personalizado, certifique‑se de verificar se o gabinete que você está comprando realmente terá espaço suficiente. O espaço livre é quase sempre um problema com essas GPUs de ponta.

Desempenho?

O desempenho de transcrição desse equipamento pode variar entre 32× e 64× a velocidade de transcrição ao vivo, o que significa que, se você tiver gravações de 32 a 64 segundos para transcrever, a transcrição levará cerca de 1 a 2 segundos, além de algum tempo adicional relacionado à velocidade de carregamento do modelo e outros fatores.

Não se esqueça, é claro, de que há uma segunda etapa de análise de IA da transcrição resultante, que pode levar vários segundos a mais, dependendo da duração da transcrição. O equipamento pode lidar com um contexto de 32 a 64 mil tokens, o que equivale aproximadamente a 4 horas de contexto de conversa. Isso significa que mesmo as chamadas mais longas de 3 horas no 3CX terão todo o contexto da conversa levado em consideração ao realizar a análise da chamada.

Abaixo estão mais detalhes sobre os testes de desempenho de nossos benchmarks internos:

Benchmarks internos

Conclusão

Decidimos criar uma estação de trabalho de IA de alto rendimento. Para organizações que utilizam o Sistema Telefônico 3CX e seu recurso de IA integrado, essa configuração representa o ápice do poder de processamento local, ao mesmo tempo em que equilibra os custos e garante que a transcrição de chamadas seja feita com rapidez e precisão, mantida em segurança dentro da sua rede.

Pronto para ver com que rapidez você pode transcrever chamadas?