Um usuário identificado como Cleric07 montou um servidor com 70 GB de memória de vídeo ao combinar duas NVIDIA Titan RTX de 24 GB com uma GeForce RTX 2080 Ti modificada para 22 GB. As três placas foram instaladas em um sistema de refrigeração líquida.
A máquina também conta com um Ryzen 9 5950X e 64 GB de memória DDR4. O proprietário afirma usar o computador no desenvolvimento com modelos de linguagem, em trabalhos criativos e em atividades de modelagem 3D e CAD/CAM para usinagem CNC.
Refrigeração e consumo
A adoção de um circuito líquido reduziu as temperaturas das GPUs. Sob carga, as placas saíam da faixa superior dos 80 °C e passaram a operar em torno de 45 °C. Em repouso, o sistema fica próximo de 30 °C.
O conjunto usa dois radiadores de 360 mm. Cada placa pode atingir 320 W, conforme Cleric07, enquanto o consumo habitual da máquina fica entre 500 e 600 W, com picos superiores. A fonte de alimentação tem capacidade de 1.200 W.
A RTX 2080 Ti é a parte mais incomum do projeto. O modelo saiu originalmente de fábrica com 11 GB de memória GDDR6, mas recebeu chips de 2 GB no lugar dos componentes de 1 GB, elevando a capacidade para 22 GB. A alteração também exige ajustes nos resistores de configuração para que a placa reconheça a memória adicional.
Desempenho em modelos de IA
Cleric07 informou que uma versão quantizada do DeepSeek V4 Flash, distribuída entre as três GPUs, alcança cerca de 24 tokens por segundo com contexto de 96 mil tokens.
Em outro teste, o Qwen 3.8 27B Q8 foi executado somente nas duas Titan RTX ligadas por NVLink. Com MTP ativado, o resultado foi de aproximadamente 55 tokens por segundo; sem o recurso, caiu para 27 tokens por segundo. Modelos MoE podem passar de 85 tokens por segundo, dependendo da quantização e do tamanho do contexto.







