Zürcher Nachrichten - ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

EUR -
AED 4.211192
AFN 74.534894
ALL 91.798294
AMD 418.583419
ANG 2.052982
AOA 1051.508635
ARS 1734.686313
AUD 1.61298
AWG 2.06403
AZN 1.9526
BAM 1.95619
BBD 2.324263
BDT 142.088317
BGN 1.930374
BHD 0.435087
BIF 3451.587861
BMD 1.146684
BND 1.469493
BOB 12.688529
BRL 5.908976
BSD 1.15403
BTN 110.738069
BWP 15.652119
BYN 3.504498
BYR 22474.997001
BZD 2.320963
CAD 1.604761
CDF 2648.838265
CHF 0.945767
CLF 0.027702
CLP 1093.84416
CNY 7.690122
CNH 7.690783
COP 3593.924023
CRC 516.202873
CUC 1.146684
CUP 30.387113
CVE 110.286979
CZK 24.326834
DJF 205.500954
DKK 7.475132
DOP 68.123576
DZD 153.519917
EGP 59.858023
ERN 17.200253
ETB 188.498165
FJD 2.569431
FKP 0.852762
GBP 0.856842
GEL 2.98718
GGP 0.852762
GHS 13.253641
GIP 0.852762
GMD 84.854456
GNF 10147.022181
GTQ 8.809756
GYD 241.438116
HKD 8.996082
HNL 30.973173
HRK 7.534514
HTG 150.830059
HUF 364.99048
IDR 20354.779172
ILS 3.486142
IMP 0.852762
INR 109.959209
IQD 1511.801284
IRR 1576202.500407
ISK 139.803249
JEP 0.852762
JMD 182.116294
JOD 0.813022
JPY 178.606852
KES 149.045502
KGS 100.277358
KHR 4672.93126
KMF 490.780837
KPW 1032.015533
KRW 1586.488226
KWD 0.354061
KYD 0.961692
KZT 513.142263
LAK 25832.007893
LBP 103332.632108
LKR 382.464534
LRD 200.219901
LSL 18.786488
LTL 3.385858
LVL 0.693617
LYD 7.329461
MAD 10.882269
MDL 20.118343
MGA 4989.994447
MKD 61.537264
MMK 2407.651041
MNT 4124.449997
MOP 9.324758
MRU 46.206208
MUR 54.650852
MVR 17.670513
MWK 2001.098795
MXN 19.762248
MYR 4.697937
MZN 73.304886
NAD 18.788044
NGN 1525.960921
NIO 42.468463
NOK 10.806425
NPR 177.18131
NZD 2.000826
OMR 0.4409
PAB 1.15403
PEN 3.871672
PGK 5.21804
PHP 71.954853
PKR 319.861345
PLN 4.363635
PYG 6828.360812
QAR 4.195236
RON 5.263736
RSD 117.372257
RUB 96.606803
RWF 1702.739336
SAR 4.244305
SBD 9.174055
SCR 15.903892
SDG 689.732465
SEK 11.282193
SGD 1.463151
SHP 0.856533
SLE 28.254038
SLL 24045.370772
SOS 659.531437
SRD 43.290166
STD 23734.033729
STN 24.504884
SVC 10.098012
SYP 14909.179425
SZL 18.785744
THB 38.252789
TJS 10.645722
TMT 4.013392
TND 3.378573
TOP 2.760939
TRY 55.814717
TTD 7.824559
TWD 36.571523
TZS 3045.508853
UAH 51.464956
UGX 4517.900364
USD 1.146684
UYU 46.42905
UZS 13605.711457
VES 969.469258
VND 29808.611456
VUV 135.660782
WST 3.145254
XAF 655.957
XAG 0.017967
XAU 0.000266
XCD 3.098969
XCG 2.079814
XDR 0.810765
XOF 655.957
XPF 119.331742
YER 271.362267
ZAR 18.723823
ZMK 10321.524262
ZMW 22.647513
ZWL 369.231626
SSP 6488.13688
MXV 2.240628
ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU
ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

ockwork.io presenta una nueva clase de tolerancia a fallos para acabar con el desperdicio de GPU

La nueva solución TorchPass aborda un desafío multimillonario en la infraestructura de IA; utiliza migración en vivo de GPU para mantener el entrenamiento de IA a gran escala en funcionamiento ante fallos de hardware en lugar de obligar a costosos reinicios

Tamaño del texto:

PALO ALTO, CA / ACCESS Newswire / 10 de marzo de 2026 / Clockwork.io, líder en Software-Driven AI Fabrics™, una capa de software programable y neutral respecto a proveedores que optimiza clústeres de GPU a gran escala para observabilidad en tiempo real, tolerancia a fallos y rendimiento determinista, anunció hoy la disponibilidad general de TorchPass Workload Fault Tolerance. Esta nueva clase de tolerancia a fallos impulsada por software elimina uno de los modos de fallo más costosos en el entrenamiento de IA a gran escala: los reinicios catastróficos de trabajos provocados por fallos de infraestructura.

Ofrecido como una capacidad central de la plataforma FleetIQ de Clockwork.io, TorchPass aplica los principios de Software-Driven AI Fabrics al entrenamiento distribuido, utilizando migración en vivo de GPU para permitir que las cargas de trabajo continúen ejecutándose a través de fallos de GPU, interrupciones de red, errores de controladores e incluso caídas completas de nodos, sin reinicios desde checkpoints ni pérdida de progreso.

"Las empresas están invirtiendo miles de millones en chips de nueva generación, y sin embargo los costes de ejecutar trabajos de IA distribuidos siguen estando enormemente inflados porque el ecosistema ha aceptado el fallo como una constante", afirmó Suresh Vasudevan, CEO de Clockwork.io. "Construimos TorchPass para rechazar fundamentalmente esa premisa. En lugar de tratar el fallo como inevitable y reiniciar después, TorchPass hace que los fallos de infraestructura sean invisibles para la carga de trabajo: el entrenamiento continúa a través de los fallos de forma transparente, en software. Para un despliegue típico de 2.048 GPU, eso se traduce en más de 6 millones de dólares al año en capacidad de cómputo recuperada. Esto es exactamente lo que nuestro enfoque de Software-Driven AI Fabric fue diseñado para ofrecer: infraestructura de IA tolerante a fallos".

Dylan Patel, fundador y CEO de SemiAnalysis, coincidió en que los trabajos de entrenamiento a gran escala están limitados por interrupciones. "A medida que se despliegan clústeres Blackwell con un dominio NVL72, y mirando al futuro con el dominio NVL576 de Rubin Ultra, la idea de que un solo error de GPU o una fluctuación en un enlace de red pueda detener toda una ejecución es totalmente inaceptable", afirmó Patel. "TorchPass resuelve un enorme desafío de fiabilidad de clústeres: proporciona conmutación por error transparente y migración en vivo de cargas de trabajo que mantiene alto el MFU, lo que a su vez impulsa una mejor economía de GPU".

Por qué el entrenamiento de IA falla a escala
El entrenamiento distribuido de IA sigue siendo una de las cargas de trabajo más propensas a fallos en la infraestructura moderna. A medida que crece el tamaño de los clústeres, la fragilidad aumenta de forma pronunciada. Investigaciones de Meta FAIR muestran que el tiempo medio hasta el fallo desciende a 7,9 horas en un clúster de 1.024 GPU y a solo 1,8 horas en uno de 16.384 GPU. Esto significa que, para la mayoría de las grandes empresas centradas en IA o nubes de IA, los reinicios provocados por fallos son completamente inevitables, lo que convierte este problema en una gran barrera para escalar el impacto de la IA.

Cada fallo obliga a los trabajos de entrenamiento a retroceder hasta el checkpoint más reciente, descartando minutos u horas de trabajo completado y perdiendo tiempo adicional en intervención manual, reprovisión de recursos y reinicio del entrenamiento. Estos reinicios limitan silenciosamente la utilización de GPU, lo que convierte la fiabilidad en uno de los mayores costes ocultos de la infraestructura de IA.

TorchPass aborda este problema al gestionar de forma proactiva los fallos costosos de cargas de trabajo de IA, resolviéndolos antes de que el trabajo se detenga o necesite reiniciarse. Fundamental para empresas que ejecutan grandes cargas de trabajo de IA y para nubes de IA por igual, TorchPass mejora drásticamente la fiabilidad de las cargas de trabajo y la utilización de los clústeres. Para las nubes de IA, que ahora pueden solucionar problemas en GPU afectadas mientras mantienen la ejecución del entrenamiento según lo previsto, esto se traduce en mejores SLA para los clientes y una economía global de nube de IA más favorable, mejorando su capacidad para proteger márgenes y ofrecer nuevos modelos antes.

"Gestionar la producción de cómputo en clústeres de GPU a gran escala es vital para garantizar que estamos ofreciendo capacidad fiable a nuestros clientes. Al usar TorchPass contamos con el respaldo de una empresa que se centra en la resiliencia como si fuera una función central del negocio: sustituye cualquier GPU específica que falle y mantiene el resto del trabajo en marcha, en lugar de permitir que un pequeño problema afecte a nuestras operaciones a gran escala", afirmó David Power, CTO de Nscale.

Habilitando la próxima generación de infraestructura de IA
Al convertir la fiabilidad en una capacidad definida por software en lugar de una limitación de hardware, TorchPass proporciona la confianza operativa necesaria para desplegar sistemas de nueva generación altamente acoplados, como los NVIDIA GB200 y NVIDIA GB300 NVL72, así como futuros sistemas a escala de rack, donde las arquitecturas densas amplifican el coste incluso de pequeños fallos.

TorchPass se basa en el lanzamiento previo de Network Fault Tolerance de Clockwork.io, que aplica los mismos principios de Software-Driven AI Fabric a la resiliencia de red mediante el redireccionamiento transparente del tráfico alrededor de fallos de enlace.

Para obtener más información sobre el lanzamiento de TorchPass, visitar al equipo de Clockwork.io en persona en NVIDIA GTC 2026 del 16 al 19 de marzo, en el stand n.º 205, o visitar https://clockwork.io.

Acerca de Clockwork.io
Clockwork.io es pionera en Software-Driven AI Fabrics™, ofreciendo una capa de software programable que hace que los clústeres de IA a gran escala sean observables, deterministas y resilientes por diseño para impulsar el progreso continuo de las cargas de trabajo y la máxima utilización del clúster. Su plataforma FleetIQ permite a las empresas entrenar, desplegar y servir las cargas de trabajo de IA más exigentes del mundo de forma más rápida, fiable y a menor coste. Empresas como Uber, Wells Fargo, Nebius, Nscale y White Fiber confían en Clockwork.io para impulsar su infraestructura de IA. Más información en www.clockwork.io.

Contacto:

Dana Trismen
[email protected]
650-269-7478

SOURCE: Clockwork

U.Ammann--NZN