Qwen3.8-27B is Live on Chutes! 🪂

Qwen3.8-27B is Live on Chutes! 🪂

Qwen shipped Qwen3.8-27B's weights on Friday. Dense 27B, Apache 2.0, and the model half of X spent the weekend benchmarking. It is already live on Chutes.

Qwen3.8-27B on Chutes: 262K context, text + image input, $0.40 per million input tokens, $3.00 out.

Runs inside a hardware-attested TEE with end-to-end encryption, like every model we serve.

Qwen's published scores: 61.7 on SWE-bench Pro (Claude Opus 4.6 Max: 53.4), 90.3 on LiveCodeBench v6 (Opus 4.6 Max: 88.8), 84.3 on OSWorld-Verified (Opus 4.6 Max: 72.7), 89.2 on GPQA Diamond.

Try it out: https://chutes.ai/app/chute/chutes-qwen-qwen3-8-27b-tee

$TAO

u/thestreamcode — 1 day ago

DeepSeek ha rilasciato il suo harness open source: tutto è un plugin

DeepSeek ha aperto il developer preview di DeepSeek Harness (dsh): l'harness per agenti che DeepSeek usa nei suoi benchmark ufficiali, ora open source con licenza MIT. Non è un wrapper CLI intorno alla chat API: è un runtime agente completo in TypeScript, con decine di gruppi di pacchetti in un monorepo pnpm, web UI, SDK Python e quattro modalità operative.

Il principio architetturale è una frase sola: everything is a plugin. Il model adapter, il registry dei tool, il session log, l'agent loop, perfino la UI sono plugin montati su Cordis, il framework che gestisce mount/unmount e dipendenze. Non c'è un core privilegiato da patchare: estendi dsh montando un plugin accanto agli altri. DeepSeek ha vendored Cordis (fork 4.0.0-rc.7 con 18 modifiche locali documentate), facendone il consumatore di produzione più in vista di quel paradigma.

Come si avvia:

npx @deepseek-ai/dsh web

Web UI su http://127.0.0.1:3080. Poi Settings → Models, chiave API DeepSeek, workspace e via. Da sorgente: clone, pnpm install, pnpm run build, pnpm dsh web. Serve Node 22.19+ o 24+. Esiste anche un SDK Python (deepseek-harness-sdk) che pilota il runtime come subprocess via JSON-RPC su stdio, e dei bridge per gli hook di Claude Code e Codex.

Le quattro modalità:

  • Standard — coding agent completo: file editing, shell, ricerca, skills, planning, subagenti, workflow
  • Code — il modello orchestere i tool scrivendo un programma TypeScript che combina più operazioni in un solo passo
  • Minimal — solo bash persistente e str_replace_editor. È la modalità usata per valutare i modelli: è lo stesso "minimal mode" citato nei benchmark ufficiali di V4 Flash 0731 come framework di test
  • Creator — ispeziona il runtime corrente, prova plugin in memoria, combina preset

Il pezzo che differenzia dsh dagli altri harness: il session log append-only. Tutto quello che il modello vede (system prompt, reasoning, tool call e risultati, scheduling dei subagenti, iniezioni di contesto) finisce in un unico event stream. Puoi ispezionare la traiettoria per sorgente, riprendere, forkare, cercare e fare replay sullo stesso stream. Per chi fa debugging di agenti che si perdono, è la feature che conta.

Da tenere a mente prima di entusiasmarsi:

  • È developer preview. Il README scrive in maiuscolo: "THERE WILL BE COMPATIBILITY-BREAKING CHANGES". Il repo stesso dice "no external consumers" e che schemi e formati cambieranno senza promesse di compatibilità
  • Nel repo non c'è alcuna tabella benchmark: BENCHMARK.md è di tre righe. Nessuna claim di performance da ripetere
  • Il sandbox è un POC basato su E2B, più un eseguibile landlock nativo. Roba seria ma giovane
  • 125.7k stelle al momento del check, ma è aperto da un giorno: il numero conta poco, conta quanto la community di plugin decollerà. Esiste già il topic dsh-plugin su GitHub per la discoverability

Il quadro per chi segue la famiglia V4: prima i modelli, poi il tool con cui DeepSeek li valuta. Il changelog di Flash 0731 citava "DeepSeek Harness minimal mode (to be released soon)" come framework dei benchmark ufficiali. Ora quel pezzo è pubblico, MIT, e gira anche con provider non-DeepSeek via endpoint OpenAI-compatibili.

Fonti:

u/thestreamcode — 4 days ago
▲ 29 r/chutesAI+1 crossposts

GLM-5.3: stesso base di 5.2, post-training su coding e cybersecurity

Z.ai ha rilasciato GLM-5.3. Non è un modello nuovo da zero: è lo stesso base da 743B di GLM-5.2, con un mese di post-training in più su ambienti lunghi e task da produzione. I pesi non ci sono ancora. Oggi si usa via GLM Coding Plan e ZCode. API e open weights arriveranno a scaglioni, i pesi pubblici "tra due settimane" dopo la "safety evaluation".

Il posizionamento è stretto. A giugno Jie Tang aveva chiesto alla community cosa mettere nel prossimo GLM, e la risposta più rumorosa era la vision. GLM-5.3 non è quello. Il blog ufficiale parla di due cose: coding agentico e cybersecurity.

Cosa cambia in pratica per chi già usa 5.2:

  • Model ID: glm-5.3
  • Tre livelli di thinking: low, high, max. Default max, raccomandato per il coding
  • thinking.type: disabled non è più accettato. Chi lo ha in config deve passare a enabled e reasoning_effort: low prima di cambiare modello, altrimenti la request fallisce
  • Coding Plan: quota a punti (input, cache hit e output contati a parte). Fuori dalle ore di punta i punti costano la metà. Peak: 14:00–18:00 UTC+8, lunedì–venerdì
  • ZCode dichiara cache hit sopra il 98% e un boost di quota 1.5x fino al 31 agosto

I numeri del blog (vendor-run, harness documentati, spesso Claude Code 2.1.207 a max effort):

  • Terminal Bench 2.1: 88.2 (5.2 era 81.0). DeepSeek-V4-Pro-0813 è a 87.9, GPT-5.6 Sol a 88.8
  • Terminal Bench 3.0: 28.3 da 4.6. Qui il salto è grosso, ma Fable 5 e Sol restano sopra (33.7 e 34.6)
  • DeepSWE v1.1: 66.9 da 46.2. Kimi K3 67.5, Sol 72.7
  • SWE-Marathon v1.1: 42.5 da 19.4
  • Z.ai Code Bench (interno): +50% su 5.2. A High fa 31.4% con ~50K token di output, contro 29.5% di Opus 4.8 con 120K. A Max arriva a 34.5%. Fable 5 resta avanti a 39.5%
  • CyberGym: 84.5, sopra 5.2 (77.2), DeepSeek 0813 (83.3) e Sol (83.6)
  • ExploitBench: 54.4 da 24.4. Il closed frontier è ancora lontano (Fable 78.0)

Z.ai dice che la capability cyber è cresciuta più in fretta del previsto salendo la catena di exploitation, e pubblica un ledger di disclosure (cvd.z.ai): 2.436 finding su 269 progetti, 53 già pubblici, il resto sotto embargo. Sono numeri interni, da leggere come tale.

Cosa non è in questo lancio:

  • Nessun peso su Hugging Face. Il bottone del blog dice "Coming Soon"
  • Nessuna licenza dichiarata per 5.3. La famiglia 5.x finora era MIT, ma 5.3 non lo ripete
  • Nessuna spec nuova di contesto. Le footnote delle eval usano 300K, 400K o 1M a seconda del bench; non è riaffermato come prodotto
  • Nessuna vision
  • Le release notes delle docs Z.ai, al momento della verifica, non elencano ancora 5.3. La fonte è il tech blog

Fonti:

u/thestreamcode — 6 days ago

DeepSeek-V4-Pro-0813 is official: agent benchmarks land, Responses API goes native, and peak/off-peak pricing starts August 16

DeepSeek published the changelog entry for V4 Pro today, dated 2026-08-13: "The GA release of DeepSeek-V4-Pro has been rolled out on the APP, Web, and API." The rollout itself started earlier — OpenRouter listed deepseek/deepseek-v4-pro-0813 at 15:42 UTC on August 12, served directly by DeepSeek — but this is now a documented release rather than a silent one. The model ID is unchanged: deepseek-v4-pro now serves 0813.

Specs, unchanged from the family:

  • 1.6T total / 49B active parameters, MoE, 1M context, 384K max output, MIT license (preview weights)
  • API: OpenAI ChatCompletions, Anthropic format, and now native Responses API — specifically adapted for Codex, with a one-click setup script covering Codex CLI, the ChatGPT desktop app, and the VS Code extension
  • New: thinking effort now has three levels (low / high / max) on both V4-Pro and V4-Flash

The benchmarks (DeepSeek's own, from the changelog):

Benchmark Pro 0813 Pro Preview Delta Opus-4.8 Kimi-K3
HLE (wo/w tools) 42.7/60.0 37.7/48.2 +5.0/+11.8 49.8/57.9 43.5/56.0
Terminal Bench 2.1 87.9 72.1 +15.8 85.0 88.3
NL2Repo 61.5 38.5 +23.0 69.7 -
Cybergym 83.3 52.7 +30.6 78.3 80.0
DeepSWE 62.7 12.8 +49.9 58.0 67.5
Toolathlon-Verified 74.1 55.9 +18.2 76.2 76.5
Agents' Last Exam 25.7 16.5 +9.2 25.7 27.6
AutomationBench (Public) 31.8 12.8 +19.0 27.2 30.8
DSBench-FullStack † 71.1 41.8 +29.3 71.6 73.7
DSBench-Hard † 67.2 31.1 +36.1 71.7 63.0

(† internal test sets. Comparison columns from the table DeepSeek shared with the release; DeepSeek columns match the changelog.)

Directional signal, vendor-run, and the comparison table has the usual caveats — but the shape is consistent with what Flash 0731 did three weeks ago: a post-training pass aimed squarely at agent workloads. 0813 passes Opus-4.8 on Terminal Bench, Cybergym, DeepSWE, AutomationBench, and on HLE with tools (60.0 vs 57.9), trails it on HLE without tools and NL2Repo, and Kimi-K3 still leads the agentic pack on Terminal Bench and DeepSWE.

The pricing rework is the other half of this release:

Current rates ($0.435/M input, $0.87/M output, $0.003625/M cache hit) end at 16:00 UTC on August 16. After that, peak/off-peak billing kicks in:

  • V4-Pro off-peak: $0.66 input / $1.98 output / $0.022 cache hit
  • V4-Pro peak: $1.32 input / $3.96 output / $0.044 cache hit
  • Peak hours are 01:00–04:00 and 06:00–10:00 UTC — everything else is off-peak

So the permanent discount era ends with a real increase: off-peak output nearly 2.3x current, peak output 4.5x. For agentic pipelines with prompt caching and flexible scheduling, off-peak + cache hits soften it; for anything latency-insensitive, scheduling outside two morning UTC windows becomes a cost lever.

The serving picture, which is the actual gap:

There are still no 0813 weights. The public deepseek-ai/DeepSeek-V4-Pro repo on Hugging Face was last updated June 22, and no DeepSeek-V4-Pro-0813 repo exists — DeepSeek has not said whether they will publish them. The Flash precedent (weights same day as the API update) is encouraging, but right now 0813 is DeepSeek-API-only, and self-hosting means the April preview weights: FP4+FP8 mixed checkpoints, 1.6T MoE, the tech report claiming deployment on a single HGX B200 node. If 0813 weights land, the open question is how the new agent post-training holds up under quantized serving at long context.

The Chutes question, asked plainly:

Don't read anything into this post. Whether V4 Pro 0813 ever becomes available on Chutes depends on hardware resources, licensing, and other technical considerations — an MIT license is a starting point, not a guarantee. Wait and see, as always.

Sources:

Anyone already running 0813 through the API — does it feel materially different from the preview in agent workflows, or is this mostly a benchmark-story release? And would you want it on Chutes if weights or a viable serving path appear? Comments help prioritize what lands next.

u/thestreamcode — 7 days ago
▲ 67 r/vibecodingitalia+1 crossposts

DeepSeek V4 Pro è ufficiale: rilasciata la build 0813, in silenzio

DeepSeek ha rilasciato la versione ufficiale di V4 Pro. Niente post su X, niente blog post, nessuna voce nel changelog: l'unica traccia ufficiale è una riga nella pagina Models & Pricing della loro API, dove alla voce "MODEL VERSION" ora compare DeepSeek-V4-Pro-0813.

È il terzo rilascio consecutivo fatto così: la preview di V4 ad aprile, Flash 0731 il 31 luglio annunciato solo nel changelog, ora il GA di Pro senza nemmeno quello.

Cosa si può verificare oggi:

  • La pagina prezzi ufficiale indica DeepSeek-V4-Pro-0813 come versione corrente del modello deepseek-v4-pro. Il model ID non cambia: chi già usa l'API si ritrova la nuova build senza toccare nulla
  • OpenRouter ha listato deepseek/deepseek-v4-pro-0813 oggi alle 15:42 UTC, servito direttamente da DeepSeek, descritto come "the GA release of DeepSeek V4 Pro"
  • La feature matrix ufficiale segna Responses API supportata anche per Pro. La pagina Codex di DeepSeek ha perso il vecchio caveat "solo Flash è supportato" e ora pubblica uno script di setup one-click: Pro è utilizzabile da Codex CLI, dall'app desktop di ChatGPT e dall'estensione VS Code
  • Contesto 1M token, output massimo 384K, prezzi invariati: $0.435/M input, $0.87/M output, $0.003625/M cache hit

Cosa non si può dire, onestamente:

  • Non c'è un changelog, quindi non sappiamo cosa sia cambiato rispetto alla preview di aprile. Nessun benchmark nuovo pubblicato, nessun confronto con Flash 0731, che il 31 luglio superava la preview di Pro su tutti i benchmark agent dichiarati da DeepSeek
  • Non c'è un nuovo repo pesi su Hugging Face: l'ultimo aggiornamento del repo pubblico di V4 Pro è di giugno, e la versione scaricabile resta quella della preview. Per ora 0813 è solo API
  • La sigla "0813" suggerirebbe il 13 agosto, ma il modello è listato già dal 12. DeepSeek non ha commentato

Per chi vuole provarlo subito:

V4 Pro è già nel listino di OpenCode Go: $5 il primo mese, poi $10/mese, con 3.450 richieste ogni 5 ore e dati di training dichiarati come non utilizzati. I dati pubblici di OpenCode lo mostrano già come secondo modello più usato sulla piattaforma, con il 14% del volume dietro solo a Flash. In alternativa la via diretta: API key DeepSeek e /connect su OpenCode, oppure lo script one-click pubblicato da DeepSeek per Codex (su Windows: irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex).

Un dettaglio da segnare: nella stessa pagina prezzi DeepSeek scrive che intende alzare i prezzi dell'API "in the near future, with a significant increase expected". Le tariffe attuali sono quelle promozionali rese permanenti a maggio, e potrebbero non durare.

Il rilascio di oggi porta Pro in pari con Flash sul piano delle integrazioni (Responses API, Codex) e chiude la fase preview della famiglia V4 lato API. Restano aperti due punti: i pesi della nuova build e l'Harness proprietario citato nei benchmark ufficiali, ancora non rilasciato.

Fonti:

u/Medium-Spinach-3578 — 7 days ago
▲ 1.3k r/vibecodingitalia+1 crossposts

Introducing Unsloth Desktop app

Hi LocalLlama, we're super excited to release Unsloth Desktop today! 🦥
It's the first desktop app that enables you to run and train models locally.

Open-source. Available on Mac, Windows, and Linux

  • Supports MLX, diffusion image/video models, audio models, and GGUF
  • You can run MiniMax-H3, Muse Glimmer, soon Qwen 3.8 etc
  • Connect Claude Code and Codex to local LLMs
  • 50% more accurate with self-healing tool calls and sandboxed code execution
  • Supports CPU and multi-GPU setups across NVIDIA, AMD, Intel, and Mac
  • Train models 2× faster while using 70% less VRAM
  • Includes private web search, deep research, RAG, MCP, and exports (NVFP4, GGUF)
  • Use Unsloth’s OpenAI-compatible API with OpenAI and Anthropic cloud models
  • Securely deploy LLMs remotely and access them anywhere via Cloudflare HTTPS

We do not collect any telemetry or data.

Unsloth Desktop is now available on unsloth.ai and GitHub.

Thanks for the support as always and we're here to answer any questions! 💗

u/danielhanchen — 9 days ago

Command Code lancia il piano GOAT: 10$ al mese per 70$ di crediti

Command Code ha aperto le sottoscrizioni al piano GOAT: 10 dollari al mese per usare oltre trenta modelli, open e closed, dentro il suo coding agent da terminale. La cifra su cui il team insiste è il moltiplicatore: 10$ comprano fino a 70$ di crediti, sette volte tanto, e con gli sconti attivi il valore dichiarato supera i 100$. La pagina ufficiale lo presenta come il miglior piano a basso costo sul mercato: è un claim del vendor, e come tale va trattato. La mossa arriva dopo il piano Go da 1$, che era piaciuto per il prezzo ma non per la capienza: un buon modo di entrare, non abbastanza credito per arrivare a fine mese. GOAT è la risposta: stesso approccio, budget più largo.

I crediti sono per modello, non un portafoglio unico

La prima cosa da capire è come sono strutturati i 70$. Non è un pool condiviso: ogni modello ha la propria allocazione mensile, che varia in base agli accordi negoziati con i provider. I modelli con capacità negoziata arrivano al pieno di 70$; quelli nuovi o già scontati partono da 20$, comunque il doppio del prezzo API pubblico, e salgono automaticamente quando parte un accordo migliore, senza codici da inserire.

  • 70$/mese: GLM-5.2, GPT-5.6 Luna, Tencent Hy3, Qwen 3.7 Max, Qwen 3.7 Plus, Qwen 3.6 Plus
  • 60$/mese: DeepSeek V4 Flash, Kimi K2.7 Code
  • 47$/mese: MiniMax M3, con sconto del 50% permanente
  • 30$/mese: MiMo V2.5, con sconto del 98%
  • 25$/mese: Qwen 3.8 Max
  • 20$/mese: DeepSeek V4 Pro (-75%), MiMo V2.5 Pro (-99%), Kimi K3, Grok 4.5, Muse Spark 1.2, GLM-5.2 Fast e i modelli più vecchi Le finestre d'uso seguono lo schema già visto su altri piani di questo tipo: non più del 20% del budget mensile in 5 ore e del 50% in 7 giorni. Il budget si ricarica a ogni ciclo di fatturazione. Se si supera una finestra, le richieste scalano dai crediti extra acquistati a parte; senza quelli, i modelli a pagamento si fermano fino al reset della finestra, mentre i modelli gratuiti (come Laguna S 2.1, a costo zero finché c'è capacità) continuano a funzionare. I crediti extra si comprano al costo puro del modello, si cumulano e non scadono.

Quante richieste ci stanno in un mese

Command Code pubblica stime per modello, calcolate su una richiesta agentica di riferimento: circa 800 token di input freschi, 50.000 di cache read e 125-200 di output. Con questi numeri, un mese di GOAT vale circa:

  • DeepSeek V4 Flash: 195.000 richieste
  • MiMo V2.5: 97.400
  • GPT-5.6 Luna: 51.800
  • GLM-5.2: 4.740
  • Qwen 3.8 Max: 1.630
  • Kimi K3: 980
  • Grok 4.5: 719 Il dato su Luna è quello che il team spinge di più: allocazione piena da 70$ anche sul modello OpenAI, con sconto del 50% fino a metà agosto, la più generosa tra i piani da 10$ secondo i loro conti. Sono numeri del vendor, costruiti su un profilo d'uso specifico: il consumo reale dipende da quanto contesto si trascina a ogni richiesta, e con finestre da 20% e 50% le richieste davvero distribuibili in una giornata intensa sono meno di quelle che la cifra mensile suggerisce.

Come giustificano il moltiplicatore

La risposta ufficiale è infrastruttura. Command Code dichiara cache hit rate del 95-98% sui propri server: in un coding agent la gran parte del volume è cache read, quindi servire bene la cache riduce drasticamente il costo di ogni richiesta, e il risparmio torna sotto forma di crediti più alti. A questo si aggiungono gli accordi diretti con i provider: dove Command Code negozia capacità, l'allocazione sale; dove il prezzo pubblico è già scontato di suo, l'allocazione resta al minimo. Nella documentazione c'è anche una frecciata ai concorrenti: molti provider e coding agent applicherebbero fino al 400% di markup sui prezzi di listino dei modelli, mentre qui gli sconti arrivano a pareggiare o battere le tariffe API dei lab. È una dichiarazione di parte, senza confronti indipendenti a supporto.

Il contesto: la v1 e l'open source in arrivo

Di Command Code avevamo già parlato a giugno, quando si presentava come harness ottimizzato per i modelli open con apprendimento dello stile. Il piano GOAT si appoggia ora alla v1, la riscrittura completa del runtime: otto mesi di lavoro su un codebase che il team descrive come vecchio di sei anni, con permission engine unico, task in background, git worktree, sessioni con rewind e fork, e una Mods API per estendere l'agente. A fine mese il codice diventa open source. Al momento il repository GitHub CommandCodeAI/command-code contiene solo un readme: per mettere le mani sull'harness completo tocca aspettare il rilascio. Due dettagli operativi utili: il piano è utilizzabile anche via Provider API, quindi collegabile ad altri agenti oltre alla CLI ufficiale, e lanciando la CLI con CMD_ZDR=1 si attiva la zero data retention, senza conservazione dei prompt né uso in training. L'infrastruttura è distribuita tra USA, UE e Singapore.

Il confronto con gli altri flat

GOAT entra in una corsa già raccontata da queste parti. ClinePass, il flat di Cline da 9,99$ al mese, da fine giugno è aperto al pubblico: un pacchetto di modelli open-weight con rate limit dichiarati 2-5 volte quelli API standard, dentro l'harness di Cline. OpenCode Go dichiara circa 6x sul canone. GOAT risponde con 7x e un catalogo più largo, che include anche closed di fascia alta come Luna e Grok 4.5. L'avvertenza è la solita: le contabilità non sono identiche, allocazioni per modello di qua e moltiplicatori sui rate limit di là, quindi il confronto va preso come ordine di grandezza. Rispetto ai flat dei big la differenza di filosofia resta quella già vista: Copilot Pro e Cursor Pro sono piani a consumo mascherati da abbonamento, con conguagli a fine corsa. Qui il prezzo è fisso e il catalogo è in gran parte open.

Cosa tenere presente

  • "Il miglior valore sul mercato" è il benchmark di Command Code, non una misura indipendente.
  • Le allocazioni sono mobili: gli accordi sono in negoziazione continua e i crediti per modello possono salire o spostarsi sui modelli nuovi in qualsiasi momento.
  • Il flat conviene con uso regolare. Per un uso sporadico, il pay-as-you-go su un modello economico come DeepSeek V4 Flash (0,14$ per milione di token in input) può costare meno di 10$ fissi al mese.
  • La formula "unlimited coding" è quella della pagina ufficiale; le finestre da 20% e 50% ci sono e si sentono nei picchi. Resta la domanda che vale per ogni flat: quanta dell'autonomia promessa sopravvive a una settimana di lavoro reale. Chi lo prova su progetti veri ci faccia sapere quante richieste riesce a spremere da un mese di GOAT, e su quali modelli.

Fonti:

u/thestreamcode — 14 days ago

Meta lancia Muse Code con Spark 1.2. Nei benchmark Meta, Opus 5 resta primo

Meta ha rilasciato Muse Code (beta), un coding agent da terminale costruito sul nuovo modello Muse Spark 1.2. L'installazione è documentata solo per macOS e Linux, con un comando da shell:

curl -fsSL https://dev.meta.ai/install.sh | bash

Il progetto punta ai task di ingegneria del software su repository grandi: pianificazione delle modifiche, scrittura del codice e verifica dei risultati, con più subagent coordinati per ogni task. Di Windows non c'è traccia nella pagina ufficiale. Le due scelte architetturali che distinguono Muse Code dagli altri agent CLI sono i background agent persistenti e l'event log. I primi restano attivi per tutta la sessione invece di essere creati e distrutti per ogni task: raccolgono contesto una volta sola e decidono loro quando riportare qualcosa all'agente principale. Meta sostiene che questo riduce latenza e interventi di correzione sui task multi-step. Il secondo registra ogni passaggio, dalle chiamate al modello alle esecuzioni dei tool fino alle modifiche ai file, e dopo un crash l'agente riprende esattamente da dove si era fermato. Per i task che durano ore è la differenza tra perdere tutto e continuare. Ci sono anche alcuni comandi integrati: /plan trasforma un task in un piano con approvazione esplicita, /grill mette il piano sotto stress finché non regge, /goal lavora fino al completamento dell'obiettivo. In una delle demo, l'agente riceve nel terminale un video mp4 con il fly-through di una casa e genera una pagina di marketing e prenotazione per una casa vacanze.

Come è addestrato Spark 1.2

Spark 1.2 è un aggiornamento dell'1.1 orientato al coding: generazione, debugging complesso, comprensione delle codebase, workflow end-to-end. Il punto interessante è che modello e harness sono stati addestrati insieme, con trajectory generate dall'harness stesso e selezione tramite rejection sampling. La conseguenza pratica è che nei benchmark Meta ogni modello gira con il proprio agent di riferimento. L'addestramento ha coperto anche i task lunghi: generazione di interi repository, progetti end-to-end e auto-research, con goal conditioning e compaction del contesto. E c'è un loop di self-improvement: Spark 1.1 ha generato ambienti di coding difficili, poi ha valutato le soluzioni candidate per produrre il dataset usato per addestrare l'1.2.

I benchmark, con le pinze

I numeri arrivano dai grafici ufficiali e dal report metodologico, e vanno letti con qualche avvertenza. Meta stessa ammette che la propria configurazione potrebbe non essere ottimale per i modelli di terze parti. E il confronto tra Spark 1.2 e l'1.1 è in parte falsato: l'1.1 girava con mini-swe-agent, non con un agent Meta.

  • Terminal-Bench 2.1: Opus 5 86,7%, Muse Spark 1.2 82,9%, GPT 5.6 Terra 81,8%, Grok 4.5 81,6%, Gemini 3.6 Flash 78,9%, Muse Spark 1.1 76,2%
  • DeepSWE v1.1: Opus 5 65,0%, GPT 5.6 Terra 64,8%, Muse Spark 1.2 59,3%, Grok 4.5 56,6%, Muse Spark 1.1 53,0%, Gemini 3.6 Flash 40,0%
  • Meta Internal Coding Bench: Opus 5 79,4%, Muse Spark 1.2 70,6%, Muse Spark 1.1 68,3%, GPT 5.6 Terra 65,4%, Gemini 3.6 Flash 63,9%
  • GDPVal-AA v2 (Elo di Artificial Analysis, baseline umano a 1.000): Opus 5 1.852, Muse Spark 1.2 1.631, GPT 5.6 Terra 1.577, Grok 4.5 1.526, Gemini 3.6 Flash 1.423, Muse Spark 1.1 1.371
  • MCP Atlas (uso di tool via MCP, risultati Scale AI): Muse Spark 1.2 90,3%, Muse Spark 1.1 88,1%, Opus 5 85,8%, gli altri tra 83,6% e 81,8% Sul coding puro Opus 5 è davanti in tutte e tre le prove. Spark 1.2 si piazza nel gruppo di testa e supera sempre l'1.1, mentre sull'uso di tool via MCP è primo, davanti anche al proprio predecessore.

Il test sui kernel GPU

La parte più originale dell'annuncio è l'ottimizzazione iterativa di kernel GPU: oltre 1.000 tool call e fino a 24 ore di lavoro, su kernel KDA e MLA per GPU NVIDIA Hopper, con il divieto di importare librerie di terze parti come FLA. L'agente doveva reimplementare l'algoritmo in Triton, non fare wrapping di codice esistente. Nei grafici ufficiali, Spark 1.2 chiude a +68,7% rispetto al baseline su KDA e a +61,1% su MLA. Il migliore però è Opus 5, a +74,0% e +75,4%. Il claim di Meta non è il primato ma il miglioramento iterativo rispetto al baseline, e i numeri quello dicono.

Disponibilità

Muse Spark 1.2 è disponibile da subito in Muse Code e sulla Meta Model API, con accesso globale ampliato rispetto alla preview statunitense di luglio. La copertura effettiva per paese va verificata su dev.meta.ai, e il post non parla di prezzi: per l'1.1 la Model API costava $1,25/$4,25 per milione di token in input/output, ma per l'1.2 il listino non è pubblicato. Vi interessa provarlo, o con i coding agent che usate oggi siete già a posto? Fonti:

u/thestreamcode — 14 days ago

DeepSeek ha un coding agent nella doc ufficiale: si chiama Reasonix, e il prefix-cache gli fa risparmiare l'80% sui token

DeepSeek ha aggiunto Reasonix alla sezione "Agent Integrations" della propria documentazione API ufficiale. E sviluppato da esengine, non direttamente da DeepSeek, ma e l'agent che DeepSeek raccomanda nella propria doc: progettato attorno alla meccanica prefix-cache e pensato per girare nel terminale.

La frase chiave nella doc: "talks to api.deepseek.com without a translation shim". Niente layer di compatibilita, niente adapter. Il loop e disegnato byte-per-byte per massimizzare la cache hit.

Cosa fa in pratica:

  • Coding agent da terminale con filesystem tools, shell, SEARCH/REPLACE con review prima dell'apply
  • Di default usa V4-Flash (economico), con /pro passi a V4-Pro per il turno successivo, /preset max per tutta la sessione
  • MCP first-class: stdio, SSE, streamable HTTP. I server esterni mergiano i tool in un unico registry
  • Plan mode (/plan): il modello pianifica prima di eseguire, con permessi e sandbox che governano ogni tool call
  • Subagent integrati: explore, research, review, security-review. Piu skill in Markdown con tool isolati
  • Funziona come TUI, browser UI locale (reasonix serve), estensione VS Code, o via ACP per altri editor

Il punto vero: i costi

Il loop e append-only e allineato al prefix-cache di DeepSeek. In sessioni lunghe la cache hit supera il 90%, e i token in input vengono fatturati a circa 1/5 del prezzo pieno.

Dalla loro case study (utente reale, singolo giorno, 2026-05-01):

  • 435 milioni di token in input
  • 99.82% cache hit
  • Costo effettivo: ~$12
  • Stesso workload senza cache su V4-Flash: ~$61

Cinque volte meno. E non e un benchmark sintetico, e un log di utilizzo reale.

Installazione:

cd /path/to/progetto
npx reasonix code

Al primo avvio chiede la API key di DeepSeek (da platform.deepseek.com) e la salva in ~/.reasonix/config.json. Nessun env var necessario.

Richiede Node >= 22. Funziona su macOS, Linux, Windows (PowerShell, Git Bash, Windows Terminal).

C'e anche un alias piu corto: npx dsnix code.

Stato del progetto:

Il repo GitHub (esengine/deepseek-reasonix) ha due linee:

  • main: versione TypeScript originale (0.x), in maintenance mode. Solo bugfix
  • main-v2: rewrite in Go, single binary CGO-free cross-compilato per darwin/linux/windows × amd64/arm64. E il nuovo default

La versione Go non richiede Node a runtime. Il binary e autonomo.

C'e anche un desktop client in Tauri (prerelease): multi-tab, pannello file, metriche cost/cache/token. Stessa config, stesso loop. Non e ancora code-signed.

Cosa lo differenzia dagli altri agent CLI:

Claude Code e Anthropic-only, Codex CLI e OpenAI-only, Aider e multi-provider. Reasonix e DeepSeek-only, ma la differenza non e solo il vendor lock-in: e che l'intero loop e progettato come invariante di cache. Non e un agent generico con un adapter DeepSeek sopra; ogni layer (append-only history, tool-call repair, flash-first routing) esiste per mantenere il prefix stabile e massimizzare la hit rate. Il risultato e che su sessioni lunghe il costo crolla, mentre un agent generico che chiama DeepSeek via shim non ottiene lo stesso risparmio.

Il fatto che sia nella doc ufficiale di DeepSeek sotto "Agent Integrations" gli da uno status particolare: non e un esperimento community, e l'integrazione raccomandata dal provider stesso.

Limiti attuali:

  • Solo modelli DeepSeek. Niente OpenAI, Anthropic, o provider terzi
  • La versione Go (v2) e ancora in sviluppo attivo, la TS e in maintenance
  • Il desktop client e prerelease e non firmato
  • I benchmark nella doc usano il loro harness, non ancora pubblico

Fonti:

u/thestreamcode — 18 days ago

Parallax Removes the Biggest Bottleneck in Distributed AI Training

Train a big AI model across machines on the open internet and you hit a wall. Every single step, the machines have to ship hundreds of gigabytes of expert traffic to each other. The next step cannot start until all of it lands.

Parallax removed that traffic from the critical path. What replaces it is about 100 MB of background sync. The training never stops to wait.

The full mechanism is in the Parallax paper: https://chutes.ai/parallax.pdf

u/thestreamcode — 19 days ago

Please update Alibaba Cloud BYOK support for the new Token Plan

TRAE currently supports Alibaba Cloud only through Pay-As-You-Go and the old Coding Plan.

Could you please add support for the new Alibaba Cloud Personal Token Plan and update the available model list accordingly?

The Token Plan is now the main subscription option for many Qwen users, but it cannot currently be configured correctly in TRAE. Updated endpoint support and the latest Qwen coding models would be greatly appreciated.

reddit.com
u/thestreamcode — 20 days ago

DeepSeek ha aggiornato V4 Flash in silenzio, e i numeri sono assurdi

Nessun blog post, nessun annuncio su X, nessun countdown. Ieri DeepSeek ha aggiornato V4 Flash e l'unico segnale e una riga nel changelog della loro API: "DeepSeek-V4-Flash Update".

La parte interessante? Stessa architettura, stessa dimensione del modello. Hanno solo rifatto il post-training.

Cosa e cambiato in pratica:

  • Il modello si chiama sempre deepseek-v4-flash, nessuna modifica al modo in cui lo chiamate via API
  • Supporta nativamente il formato Responses API ed e adattato specificamente per Codex
  • I benchmark agent superano quelli di V4-Pro-Preview, che fino a ieri era il modello di punta

I numeri (preview → 0731):

Benchmark Preview 0731 Delta
Terminal Bench 2.1 56.9 82.7 +25.8
Toolathlon verified 51.8 70.3 +18.5
DeepSWE - 54.4 -
NL2Repo - 54.2 -
Cybergym - 76.7 -
Agent Last Exam - 25.2 -

Per contesto, su Terminal Bench 2.1 Flash fa 82.7 contro il 78.4 di GPT-5.6 Terra. Su Toolathlon siamo a 70.3 contro 53.1 di Terra. Poi Terra recupera su DeepSWE (69.6 vs 54.4) e Agent Last Exam (50.4 vs 25.2), quindi non c'e un vincitore netto. Ma un modello che fino a ieri era la versione "economica" che scambia colpi con Terra e una notizia.

Perche "stealth":

DeepSeek ha sempre comunicato in modo minimale. Anche stavolta nel changelog scrivono "significantly enhanced agent capabilities" e basta. Su HN un utente ha commentato: "They're always very understated in their update descriptions. This is actually a HUGE improvement." E ha ragione.

Il dettaglio tecnico piu interessante e che non hanno toccato architettura o dimensione. DeepSeek-V4-Flash-284B-A13B resta un MoE con 284B di parametri totali e 13B attivi. Hanno solo rifatto il post-training, probabilmente usando dati raccolti da sviluppatori reali tramite le integrazioni con OpenRouter e altri provider.

Cosa manca ancora:

  • I benchmark sono stati fatti con il loro harness proprietario (DeepSeek Harness minimal mode), non ancora rilasciato. Quindi il confronto non e perfettamente apples-to-apples con altri modelli testati con harness diversi
  • DSBench-FullStack e DSBench-Hard sono test set interni, non pubblici
  • I pesi della versione 0731 non sono ancora disponibili: per ora e solo API. Chi lo gira in locale ha ancora la versione preview
  • V4-Pro resta invariato. Dicono che la versione ufficiale "will follow soon"

Angolo locale:

Per chi lo fa girare in proprio, il modello e un 284B-A13B. Su HN c'e chi riporta ~60 token/s su 2 DGX Spark (~8k EUR totali), e chi lo usa quantizzato su MacBook Pro M5 Max 128 GB. Appena escono i pesi della 0731, chi ha gia l'hardware si ritrova un upgrade gratuito senza cambiare setup.

Fonti:

u/thestreamcode — 20 days ago

GPT-5.6 Luna costa l'80% in meno, Terra il 20%: OpenAI taglia i prezzi API

OpenAI ha annunciato ieri un taglio netto dei prezzi API per due dei tre modelli della famiglia GPT-5.6. La mossa arriva a tre settimane dalla GA del 9 luglio e, secondo l'azienda, riflette i guadagni di efficienza ottenuti anche grazie al fatto che GPT-5.6 Sol è stato usato per ottimizzare i propri kernel di serving.

I nuovi prezzi (per 1M token, dal 30 luglio)

  • Luna: $0,20 input / $1,20 output (era $1 / $6) → -80%
  • Terra: $2 input / $12 output (era $2,50 / $15) → -20%
  • Sol: $5 input / $30 output → invariato

Il taglio si riflette anche su ChatGPT Work e Codex: le subscription non cambiano prezzo, ma l'uso di Terra e Luna consuma meno crediti. Su AWS il rollout dei nuovi listini parte in giornata.

Cosa cambia in pratica

Luna a $0,20/M input è il modello più economico della famiglia, e OpenAI lo posiziona come opzione per lavoro ad alto volume: classificazione documenti, interazioni customer, implementazione di modifiche ben specificate. Secondo i dati pubblicati, su Agents' Last Exam Luna supera Fable 5 con un costo per task stimato inferiore di circa il 99%, a velocità quasi 9 volte superiore.

Il pattern consigliato è quello del routing: Sol per pianificare e gestire l'incertezza, Luna per eseguire i passi operativi e scrivere test. Un workflow di coding, ad esempio, può usare Sol per definire il piano e Luna per implementare.

Fast mode per Sol

Novità anche per Sol: il Fast mode sostituisce il Priority Processing e offre fino a 2,5x la velocità dello Standard a 2x il prezzo, senza cambiamenti nell'intelligenza. Le richieste API già taggate priority continuano a funzionare e vengono instradate automaticamente su Fast mode. In Codex corrisponde al comando /fast.

Disponibilità

Terra e Luna restano disponibili su ChatGPT Work, Codex e API. Gli utenti Free e Go accedono a Terra; Plus, Pro, Business ed Enterprise possono scegliere sia Terra sia Luna.

Dove il quadro è meno lineare

  • I benchmark citati (Agents' Last Exam, Artificial Analysis Intelligence Index v4.1) sono riportati da OpenAI nella propria pagina. Non equivalgono a una verifica indipendente.
  • Il taglio dell'80% su Luna è impressionante, ma Luna resta il modello con i punteggi più bassi della famiglia su Terminal-Bench 2.1 (84,7% contro l'88,8% di Sol). Il trade-off costo/capacità va valutato sul proprio caso d'uso.
  • "Meno crediti" su ChatGPT Work e Codex è utile, ma OpenAI non ha pubblicato una tabella di conversione aggiornata. Chi dipende dai budget mensili dovrebbe verificare il consumo effettivo dopo il rollout.

Michele Catasta (President & Head of AI di Replit) ha commentato: "GPT-5.6 Luna is the closest we've come to intelligence too cheap to meter. I've never seen a model this affordable be this powerful."

Voi cambiate qualcosa nel vostro stack dopo questo taglio? Luna a questi prezzi diventa l'opzione default per i task ripetitivi, oppure Terra resta il punto di equilibrio?

TL;DR: OpenAI taglia i prezzi API di GPT-5.6: Luna -80% ($0,20/$1,20 per 1M token), Terra -20% ($2/$12). Sol invariato. Nuovo Fast mode per Sol: 2,5x velocità a 2x prezzo. Meno crediti consumati su ChatGPT Work e Codex.

Fonti:

u/thestreamcode — 20 days ago

OmniRoute, gateway open-source che aggrega 90+ free tier AI in un unico endpoint per coding agent

In breve: OmniRoute è un gateway AI locale e open-source (MIT) che raccoglie 290 provider, di cui oltre 90 con free tier, in un singolo endpoint OpenAI-compatibile. Si installa con npm, gira sulla propria macchina e evita di dover gestire decine di API key e rate limit separati quando si usano coding agent come Claude Code, Codex CLI o OpenCode.

Chi usa coding agent con modelli gratuiti lo sa: ogni provider ha il suo SDK, i suoi limiti, la sua dashboard. L'idea di OmniRoute è semplice: mettere in comune i free tier documentati di 43 pool di provider (516 modelli) ed esporli su localhost:20128/v1. Il progetto stima circa 1,53 miliardi di token gratuiti al mese sommando tutte le quote disponibili, ricalcolate ogni due settimane contro il catalogo live.

Setup in tre passaggi.

npm install -g omniroute
omniroute
  1. La dashboard si apre su http://localhost:20128
  2. Si collega un provider gratuito (Pollinations non richiede nemmeno la key, OpenCode Free è senza autenticazione)
  3. Nel coding agent si imposta Base URL http://localhost:20128/v1 e modello auto

Il routing automatico valuta 12 fattori (tra cui salute, quota, costo e latenza) e sceglie il provider migliore. Se una quota si esaurisce, il fallback passa al successivo in millisecondi.

Oltre al routing:

  • Compressione token RTK + Caveman: il progetto riporta risparmi dal 15% al 95% a seconda della sessione (media ~89% su output tool-heavy)
  • Resilienza a 3 layer: circuit breaker per provider, cooldown per connessione, lockout per modello
  • MCP server con 104 tool e A2A server con 6 skill
  • Gira anche con Docker, su ARM/Raspberry Pi, via Termux su Android e come PWA

Alcuni provider gratuiti che vale la pena guardare:

Provider Modelli Quota
Pollinations GPT-5, Claude, Llama 4 Nessuna key richiesta
Qoder Kimi-K2, DeepSeek-R1 Illimitato
Kiro Claude Sonnet 4.5, Haiku 4.5, Opus 4.6 50 crediti/mese
Cerebras Qwen3 235B, GPT-OSS 120B 1M token/giorno
NVIDIA NIM 129 modelli ~40 RPM
Cloudflare AI 50+ modelli 10K neurons/giorno

Cosa tenere presente:

  • Il progetto è partito a febbraio 2026: molto attivo (oltre 33k star, 360+ contributori, 5.900+ commit) ma giovane, con rischio di breaking changes
  • I free tier restano soggetti ai rate limit dei singoli provider: non è "illimitato" in senso assoluto
  • Il traffico passa comunque da server terzi, a meno di usare provider locali (Ollama, LM Studio)
  • Richiede Node.js 22.22.2 o superiore
  • Il numero da 1,53B token/mese è la somma di tutte le quote, non una disponibilità singola

Fonti:

  1. GitHub - diegosouzapw/OmniRoute
  2. Sito ufficiale
  3. npm - omniroute

Chi lo sta usando con Claude Code, Codex o OpenCode? Come vi trovate con il fallback automatico?

u/thestreamcode — 22 days ago

Kimi K3 is Available Now on Chutes 🪂

Moonshot shipped Kimi K3's weights yesterday. 2.8T parameters, the largest open-weight model released to date. It is already live on Chutes.

Kimi K3 on Chutes: 1M context, native text + image + video input, $3.00 per million input tokens, $15.00 out. Runs inside a hardware-attested TEE with end-to-end encryption, like every model we serve.

Moonshot's published scores: 88.3 on Terminal-Bench 2.1 (Claude Opus 4.8: 84.6), 67.5 on DeepSWE, 91.2 on BrowseComp, 93.5 on GPQA Diamond.

Base URL: http://llm.chutes.ai/v1.

Works with Claude or any OpenAI-compatible client. Model page: https://chutes.ai/app/chute/chutes-moonshotai-kimi-k3-tee and sign up at http://chutes.ai

u/thestreamcode — 23 days ago

Harvard × Chutes Research Data Collection Is Ending — Opt-In Endpoint Removed July 24

Harvard × Chutes

research data collection wrapping up

The data-collection phase of our research collaboration with Harvard is coming to a close. The opt-in research endpoint (http://research-data-opt-in.chutes.ai) will be removed this Friday, 24th July.

If you're still routing requests through the research endpoint, switch back to the primary endpoint (http://llm.chutes.ai/v1) before Friday, after removal, requests to the research URL will no longer work. The research discount and request/response recording end at the same time.

No other changes, your API keys and everything else work as normal on the primary endpoint.

Thanks to everyone who opted in and contributed.

u/thestreamcode — 23 days ago