Realizzata, in 1h36’28” per desktop e mobile, con il modello LLM splittato su una RTX 4000 Pro Blackwell e una RTX 3060, con 200K di finestra di contesto, Llama.cpp e speculative decoding MTP, 35 token/sec. 2026/09/02
Realizzata, in 1h36’28” per desktop e mobile, con il modello LLM splittato su una RTX 4000 Pro Blackwell e una RTX 3060, con 200K di finestra di contesto, Llama.cpp e speculative decoding MTP, 35 token/sec. 2026/09/02