Homus TalksTopicsOrganizations

Organizations / Together AI

Together AI

Cloud cho inference và training model open-source. · 1 talks

Anatomy of an AI Request: Where Latency and Cost Are Really Born

Dan Fu · Together AI · 35 min

Sáu stage một AI request đi qua (routing tới decode) và sáu lever giảm latency, cost: kernels, disaggregation, parallelism, routing, speculative decoding, quantization.