ChatGPT e le LLM (Part 2)

a me non era successo prima e non è ancora successo ora

io ho disattivato questo nelle impostazioni:
" Cambia modello quando un messaggio viene segnalato

Quando le misure di sicurezza segnalano un messaggio, passa automaticamente a un modello diverso per continuare a chattare. Se disattivato, la sessione verrà messa in pausa. Si applica alle sessioni web e remote."

We’ve raised Claude Platform API rate limits for all users and simplified the tiers, which are no longer based on API spend.

The latest Sonnet and Haiku models now provide 5x higher rate limits at the highest tier.

Each rate limit tier offers the same requests per minute and token throughput across the latest Opus, Sonnet, and Haiku models.

This lets you choose the right model for the task, instead of making trade-offs for rate limiting.

Advancement through rate limit tiers is automatic. To manually request a higher rate limit, click “Request rate limit increase” in the Claude Console.

non avevo voglia :asd: touchè

progettino figo di un italiano

Comunque in 1 ora ho maxato i token di 5 ore con fable 5 :argh: del max x5

fable non l’ho manco considerato per adesso ma col pro non riesco a maxare opus 4.8 alto :asd:

lui è in gamba, no question. Speriamo che non sia una scammata (nel senso, progetto fine a se stesso da usare come stepping stone per carriera professionale o startup pointless).

si lo sto seguendo anche io a Sanfilippo però quel modello deve girare su 128 GB di RAM…

ve voglio bene ma chi si fa ad oggi 8k di pc apple :asd: ( è una critica all’entusiasmo di questo del video fatto un po così alla carlona)

tra l’altro uno di questi “cluster” che sta usando lui c’è l’ha grazie al ministro di taiwan che gl ha mandato un mac book pro ultra fugo max e un suo conscente americano mi sembra che gli sta prestando la potenza di calcolo della suo altro mac

sicuramente il potenziale è ENORME (anche perchè per settembre/fine anno dovrebbero uscire modelli con 1TB di ram alla modica cifra di 20k minimo che ti permetterà di avere a casa un AI di livello frontiera simil chatgpt/et similia se non meglio) e sta cosa che open source tanto di cappello…

Nota che la licenza è MIT, comunque, che più o meno vuol dire zero restrizioni (rispetto a una GPL). Per quello dico che mi aspetto una commercializzazione veloce.

la cosa che mi ha spaventato testuali parole di Sanfilippo è che ha fatto sta roba senza aprire nulla.

ha scritto solo il README del progetto :rotfl: il resto tutto AI

(fa da mantainer etc quindi cmq gli input/istruzioni verifica di quello che scrive l’ai fa lui)

ma è una roba per PMI non è per l’uso smanettone casalingo :asd:

1 Like

Ha scritto le specs se lo segui vedrai che è uno totalmente dalla parte della “programmazione automatica” come la chiama lui.

Comuque passare dal tessere lodi alla China e al suo modello socioeconomico ad acchiapparsi i regali da un politico di Taiwan… molto italiano :asd:

2 Likes

La gente sui forum/reddit: l’AI è inutile nella programmazione1!!1 fa troppi errori, è inusabile1!!.
I migliori programmatori al mondo: “ah io ormai è più di 1 anno che non scrivo una riga di codice”.

:asd:

1 Like

“ma chi è sto Sanfilippo, sarà un altro vibecoder che poi piange quando gli bucano il sito fatto coi prompt!!!
Redis? E che è, io giá uso Reddit, mi basta!”

5 Likes

GPT 5.6 launches next week.

The SAME WEEK Anthropic pulls Fable 5 from subscriptions.

And for the first time, OpenAI actually has a shot:

  • GPT 5.6 Sol Ultra already beats Fable 5 on TerminalBench: 91.9% vs 84.3%
  • Half the price
  • Less guardrails killing normal coding tasks
  • No weekly limit that serious builders burn in 24 hours

Fable 5 is the best model on earth, but the guardrails and rate limits are nerfing it.

GPT 5.6 is going to have less guardrails and the rate limits will be WAY better.

Next week decides everything.

A me interessa 5.6 Luna : nei bench è vicinissima alla 5.5 ( che in xhigh è un vampiro ciucciatoken e finisco per usarla sempre a medium ) costa appena 1$ in input /6$ output che è meno della la metà della 5.4 e appena il 25% in più della 5.4 mini chè è il modello mulo da soma che comuque in xhigh è rispettabile per certe task :sisi:

una domanda un po’ ot: da 1-2 giorni Gemini non ricorda più il contesto personale e le istruzioni in memoria che avevo impostato. successo a qualcuno? problemi di Google?

ma si era quella la mia critica, da come se ne parla in giro pare che fra qualche anno saremo tutti in grado di avere una roba del genere in casa, locale, su proprio hardware…

al momento ci si sta provando ma i costi ci sono e non sono da semplice consumer…

sperando cali la ram si :asd:

comunque sta roba applicata a modelli piccoli magari la fai girare bene su un mac mini da 16 gb

per un uso pratico tipo assistente locale, riassunti, coding leggero, classificazione log, query su documenti, va già bene un modello del genere

se prendi in considerazione un livello da “modello frontier” non è solo un LLM che risponde bene, vuol dire che ha capacità molto alte su ragionamento, coding, multimodale, tool use, contesto lungo, affidabilità, agenticità.

ad oggi questa roba richiede ancora modelli enormi, hardware pesante e ottimizzazioni molto spinte

quell oche sta proponendo sanfilippo è ottimizzato per pochi modelli specifici, in particolare deepSeek V4 Flash/PRO

l’importantanza è che quello che ha constatato sanfilippo si parla di modello “quasi frontier” grazie a quantizzazione molto aggressiva 2/8 bit, può girare con 96 o 128 GB di RAM.

quindi non siamo assolutamento nel territorio “Mac mini 16 GB”, ma siamo già nel territorio di roba ad hoc corazzata.

si quello lo so, dico che magari, con questo approccio, tra un annetto riesci a far stare un modello “mid” (roba per un singolo professionista) dentro hw locale che faccia cose che vadan oltre le use case di un pur ottimo gemma4

1 Like