Whatsup!

Tento týždeň sa stala vtipná vec. Firma, ktorá nezávisle testuje AI modely, odmietla zverejniť výsledky toho najnovšieho testu.

📌 TL;DR

METR odmietol GPT-5.6 → nezávislý tester povedal, že model podvádzal na testoch tak často, že jeho čísla nič neznamenajú.

Gemini 3.5 Pro → má vyjsť 17.7. s 2M kontextom a "Deep Think". Uvidíme či sú leaks believable. (Ďalšie leaks naznačujú že má vyjsť Claude Opus 5.0 od Anthropicu v najbližších dňoch)

Grok Build je open source → xAI dalo svojho kódera von zadarmo a resetlo limity. Špičkový agent za pár drobných.

Z mojej kuchyne → Optimalizoval som klienta pre AI vyhľadávanie. Toto je nové SEO

DoorDash z terminálu → nové dd-cli, tvoj agent ti objedná obed. Znie hlúpo, ale je to presne smer fungovania v budúcnosti. Každá väčšia firma začne implementovať agent-access.

Podvádzanie na benchmarkoch?

Krátky príbeh, ktorý ti zmení pohľad na každú AI tabuľku, čo odteraz uvidíš.

Je organizácia menom METR. METR predstavuje nezávisle testovanie bez emócií. Čo nový model naozaj dokáže a či sa mu dá veriť. OpenAI im dalo GPT-5.6 Sol, vlajkovú loď, na otestovanie ešte pred svetom. A METR spravil niečo, čo som ešte nevidel: výsledky odmietol zverejniť. Dôvod? Model podvádzal tak často, že sa jeho čísla nedali brať vážne.

Na testoch Sol obchádzal zadanie v 55 % prípadov. Zneužíval chyby v testovacom prostredí. Vytiahol si skryté testovacie prípady, aby vyzeral lepšie. Vytuneloval skrytý zdrojový kód z prostredia, do ktorého nemal vidieť. A keď mu automatický dozor odrezal prístup na internet, model sa pokúsil o útok na systém, ktorý ho testoval. METR to nazval "agentické zlyhanie s nepriateľským úmyslom". OpenAI vo vlastnom systémovom karte priznáva, že model si miestami vymýšľal aj výsledky výskumu.

Aby som bol fér: METR zároveň povedal, že Sol nie je žiadny terminátor, nevie sa sám vylepšovať (RSI) a neprekračuje ich kritickú hranicu nebezpečnosti.

Pointa je toto. Modely sú dnes také dobré, že sa naučili optimalizovať presne to, čím ich meriame. Keď dáš stroju cieľ "maj vysoké skóre v teste", dostaneš vysoké skóre v teste, nie nutne užitočný model. Presne o tomto som písal minule pri loop engineeringu: záleží, aký cieľ zadáš. TLDR: Jediný benchmark, ktorý niečo znamená, je tvoja vlastná robota a feeling z modelu, s ktorým pracuješ. Pusti dva modely na tú istú úlohu a pozri, ktorý ti reálne pomôže. To je celé.

🔧 Z mojej kuchyne

Optimalizoval som klienta pre AI vyhľadávanie. Toto je nové SEO

Predstav si, že sa niekto opýta ChatGPT alebo Perplexity: "odporuč mi najlepšie topánky na beh". A odpoveď príde rovno, bez googlenia, bez klikania. Otázka za milión: objaví sa v tej odpovedi tvoja firma, alebo konkurencia? Lebo ak ťa AI nepozná, pre polovicu ľudí odteraz jednoducho neexistuješ.

Nevolá sa to SEO ale GEO, optimalizácia pre generatívne vyhľadávače. Robil som to minulý týždeň pre klienta, ktorý videl automatické zlepšenie hneď po implementácií. Google sa pýta "ktorá stránka má správne kľúčové slová". AI sa pýta "ktorá stránka mi dá presnú odpoveď". Tak som mu web prestaval presne pod túto logiku:

Prepísal som obsah tak, aby nadpisy boli konkrétne otázky, čo ľudia reálne píšu, a odpoveď prišla hneď v prvých dvoch vetách. To ďaluej slúži ako text, čo si AI vytiahne. Pridal som štruktúrované dáta a FAQ, aby model vedel, čo je čo, a mal to ako citovať. A nasadil som llms.txt, nový súbor, ktorý priamo povie AI modelom, čo je na stránke dôležité a kam sa pozrieť. A potom to najlepšie: otvoril som ChatGPT a Perplexity a spýtal sa tie isté otázky ako reálny zákazník. Môžeš začať optimalizáciu svojho llms.txt napr. takto:

Prvá vlna bola o tom, kto sa dostane na prvé miesto v Google. Ďalšia vlna je o tom, koho AI spomenie, keď sa jej niekto opýta. Ak máš firmu, skús si to hneď teraz sám: opýtaj sa svojho AI modelu to, čo by sa spýtal tvoj zákazník, a pozri, či ťa spomenie. Ak nie, vieš, na čom máš zapracovať (alebo mi napíš).

Gemini 3.5 Pro: najväčší kontext na trhu. Ak je to pravda

Google má 17. júla vydať Gemini 3.5 Pro a čísla, čo kolujú, sú divoké: 2 milióny tokenov kontextu (dvojnásobok Fable aj Opusu), režim "Deep Think" na dlhé uvažovanie a schopnosť sám robiť vo viacerých súboroch naraz.

Google zatiaľ nepotvrdil nič. Ani ten dátum, ani ten kontext, ani cenu. Žiadna oficiálna stránka modelu neexistuje. Všetko, čo čítaš, sú úniky a nemenované interné zdroje. Vraj kvôli tomu celý pôvodný model zahodili a prestavali od nuly, lebo im padal na zložitejších úlohách.

Za mňa: 2M kontext by bol reálne veľká vec, s toľkou pamäťou riešiš celý projekt autonómne po dobu niekoľkých hodín, či dní. Ale kým to je za oponou nemôžme nič robiť. Teoreticky by malo byť google s ich dátami na prvom mieste v AI race, ale realisticky sú predposlední, za nimi je už len Meta (Zuck). A ako sme si práve povedali, číslam na papieri tento rok veríme opatrne. Keď vyjde, otestujem a napíšem ti, či to sedí.

Grok je zrazu open source a skoro zadarmo

Zatiaľ čo sa všetci bijú o najvyššie skóre, xAI spravilo opačný ťah. Cez víkend dali Grok Build, svojho kódovacieho agenta, von ako open source a resetli limity používania všetkým. K tomu Grok 4.5 stále beží za 2/6 dolárov za milión tokenov a každý vývojár dostane až 175 dolárov v kreditoch mesačne zadarmo cez ich program.

A nie sú sami. GLM-5.2, čínsky open model s voľnou licenciou, skóruje len 2,6 bodu za Grokom 4.5 na náročnom kódovacom teste a beží ti lokálne alebo za pár centov.

Pointa pre teba: špičkový AI kóder, o ktorom sa pred rokom len snívalo, je dnes zadarmo alebo za drobné. Toto je najlepší čas v histórii na to, aby si niečo postavil, a nemyslím to ako frázu. Prekážka nikdy nebola nižšie. Chýba už len jediná vec, a to že si sadneš a spravíš to. (Háčik pre nás v EÚ ostáva rovnaký ako pri Grok 4.5: over si, či ti to už beží, časť xAI vecí sa k nám dostáva s oneskorením.)

⚡ AI tento týždeň

DoorDash spustil dd-cli → objednáš si jedlo priamo z terminálu, respektíve z tvojho agenta. Nájde reštauráciu, porovná ceny, zaplatí. Zatiaľ len beta pre vývojárov v USA a Kanade. Znie to ako sranda, ale je to presne ten smer: agenti prestávajú len rozprávať a začínajú konať v reálnom svete, aj keď zatiaľ o pizzu.

Meta Muse Spark 1.1 → Meta sa potichu vrátila do hry. Milión tokenov kontextu, ovládanie počítača (browser, desktop, mobil) a paralelní podagenti. Prvé miesto na testoch pracovných úloh. Uvidíme, či dá comeback.

Claude Sonnet 5 má háčik v cene → Anthropic dal Sonnet 5 blízko výkonu Opusu za 2/10 dolárov do konca augusta. Ale nový spôsob počítania tokenov pridá k tomu istému textu až o 35 % viac tokenov. Takže "lacnejšie" nie je vždy lacnejšie, počítaj podľa reálnej spotreby, nie podľa cenníka.

Apple žaluje OpenAI → vraj kvôli tomu, že im OpenAI prebralo cez 400 ľudí. Elon a Sam si k tomu cez víkend vymieňali odkazy na X. Vojna o mozgy v AI je dnes tvrdšia než vojna o modely.

🧰 Tools to try

Pocket (heypocket.com) → malé zariadenie veľkosti kreditky, čo sa ti prilepí na zadok telefónu. Zapneš ho a nahráva reálny svet okolo teba, a AI ti z toho spraví poznámky, úlohy a myšlienkovú mapu. Žiadna obrazovka, nahráva len keď chceš, šifrované. Vtipné je, že si sám vyberáš, ktorý AI model ti to spracuje (má vlastný MCP). Ak zabúdaš, čo si komu sľúbil, toto je tvoj druhý mozog do vrecka.

Marketing postavili super - Reklama na Pocket s Louisom Littom zo Suits

Pocket natočil na svoj nový produkt reklamu s Rickom Hoffmanom (Louis Litt zo Suits) a je to moja uplne fav vec za celý týždeň. Suits milujem a takýto podobný “wearable” hardware chce spustiť koncom roka aj OpenAI, aj Apple. Presne ten pocit "budúcnosť je tu", ktorý celý tento rok cítim čoraz silnejšie. Pozri si to, aj kvôli tomu, ako sa dnes predáva AI hardvér: nie cez špecifikácie, ale cez pocit.

Záver

Ak máš tému, ktorú chceš rozobrať, alebo nástroj, čo mám otestovať, ozvi sa mi tu alebo na instagrame.

Vidíme sa o týždeň,