OpenAI znižujú počet matematických dôkazov napísaných umelou inteligenciou a nechávajú pole v chaose
OpenAI práve nahádzal 372 matematických výsledkov z nevydaného modelu Frontier do repozitára GitHub. The Verge eviduje 722 rukopisov v 372 rodinách výsledkov. Mnohé dôkazy sú už overené v Lean, takže logika je pravdepodobne v poriadku, aj keď novinka je ešte len upresnená.
Spoločnosť tvrdí, že dosiahla úspechy v štvorrozmernej hypotéze Kakeya, vylepšila hlavné algoritmy a dokonca dosiahla „skutočný pokrok“ smerom k Riemannovej hypotéze. Hovorca pre Scientific American uviedol, že takmer každý výsledok pochádza z jednej výzvy pre jedného agenta – nie z multimiliónového roja 10 000 agentov, ktorý predtým prelomil Navier-Stokesovu hypotézu. Priemerné náklady: zhruba tri hodiny premýšľania v ChatGPT Pro.
Nie všetci matematici jasajú. Andrew Sutherland z MIT v podstate povedal: ukážte model alebo považujte jednorazový príbeh za neoverený. Vlastná poradná skupina OpenAI chcela výzvy, názvy modelov a výpočtové potvrdenky. OpenAI namiesto toho zverejnila priemery a niektoré Lean formalizácie. „Zahodili sme dôkazy, prosím, spracujte ich“ je odvážna výskumná stratégia.
Mistral predstavuje Large 4, „Le Chonk“ s parametrami 1 bilióna, ktorého cieľom je dosiahnuť nadvládu v otvorenej váhe
Francúzske laboratórium Mistral spustilo verejnú ukážku projektu Mistral Large 4 – neoficiálne ML4, „veľmi oficiálne: le Chonk“. Ide o natívnu multimodálnu zmes s celkovým počtom 1 bilióna parametrov a 49 miliardami aktívnych. Váhy sú sľúbené do konca mesiaca po spolupráci s partnermi a vládami.
Tréning prebiehal na 3 800 grafických procesoroch NVIDIA Grace Blackwell vo vlastných európskych dátových centrách spoločnosti Mistral. Hlavnou témou je suverenita plus sústo: kybernetická bezpečnosť, financie, právo, návrh čipov. V jednom kybernetickom teste umelej analýzy, ktorý vyžaduje od modelu reprodukciu a opravu skutočnej zraniteľnosti, Mistral uvádza, že ML4 dosiahla 82 % – najvyššie skóre zo všetkých modelov – zatiaľ čo niektorí uzavretí giganti to odmietajú a dosiahnu skóre takmer nulové.
Európa teda stále chce tretiu cestu medzi uzavretými americkými laboratóriami a čínskymi otvorenými váhami. Či sa to udrží, je iná vec. Samotná prezývka naznačuje, že vedia, ako absurdne vyzerá pretekanie parametrov zvonku.
Claude sa presúva do Dokumentov, Tabuliek a Prezentácií Google ako bočný panel prvej strany
Anthropic Claude pre Google Workspace je vo verejnej beta verzii v platených programoch. Nainštalujte si doplnok Marketplace, otvorte súbor a Claude sa zobrazí v bočnom paneli, kde si môže dokument prečítať a upraviť ho na mieste. Nové konektory vám tiež umožňujú vytvárať a upravovať súbory Google priamo z chatu Claude.
V Dokumentoch dokáže opraviť vetu bez poškodenia formátovania alebo zobraziť väčšie prepracované návrhy ako karty s návrhmi. Tabuľky dokážu nájsť vzorce, pivoty, grafy a dokonca aj obchádzku Pythonu pre zamotané spojenia. Prezentácie dokážu vytvoriť nové snímky z existujúcej témy a potom označiť prekrývajúce sa nepotrebné snímky. Predvolený režim sa pred úpravami spýta. Ak radi žijete nebezpečne, k dispozícii je režim „Prijať všetko“.
Gemini tu už býva a Microsoft Copilot robí verziu balíka Office – niekedy na antropických modeloch, čo je zábavný malý rozpor. Claude sa teraz snaží byť vrstvou umelej inteligencie v oboch ekosystémoch. Nazvime to produktovou stratégiou alebo jednoducho odmietaním vybrať si stranu. Pravdepodobne oboje.
Meta a Sierra navrhujú protokol pre osobných agentov, aby obchody dokázali rozlíšiť dobrých robotov od zlých
Spoločnosti Sierra a Meta spolu s Genesys, Instinct, Rocket, Shopify, Stripe a Walmart budujú otvorený štandard pre to, ako osobní agenti s umelou inteligenciou komunikujú s firmami. Spotrebitelia si vyberajú, k čomu má ich agent prístup. Firmy určujú, čo môžu agenti robiť na webových stránkach, v API alebo prostredníctvom firemného agenta. Relácie fungujú na protokole OAuth.
Špecifikácia a referenčná implementácia v0.1 by mali byť dostupné koncom tohto mesiaca. Bret Taylor sa vyjadril priamo: kým niečo takéto neexistovalo, bol to poriadny chaos. Amazon zablokoval Meta’s Muse. Walmart je partnerom Muse a stále vidí agentov vyraďujúcich trením CAPTCHA. Letecké spoločnosti a ďalší ľudia stanovujú prísnejšie hranice.
OpenAI a Anthropic ešte nie sú súčasťou programu. Taylor hovorí, že by bol naozaj sklamaný, keby sa konkurenti vyhli tomuto kroku. Je to úprimné, čo sa týka zavedenia štandardov. Tiež je to trochu trápne, keď predseda predstavenstva OpenAI spoluvytvára protokol.
Rozhranie API pre rozhodnutia od OpenAI je vo verejnej beta verzii a umožňuje rýchle odpovede typu áno alebo nie
OpenAI vydalo rozhranie Decisions API vo verejnej beta verzii na platforme gpt-6-luna prostredníctvom protokolu POST /v1/decisions. Po zadaní textu, obrázkov alebo oboch parametrov získate napísané odpovede približne 10-krát rýchlejšie ako cez Responses API – pravdepodobnosť splnenia podmienky, výber z vášho zoznamu alebo skóre oproti zoradeným úrovniam.
Predstavte si, že sťažnosť na „dvojité zaúčtovanie“ smerujete na fakturáciu alebo že fotografiu produktu označíte ako crack. Obrázky musia byť vložené v kóde base64. Cena je 0,10 USD za milión vstupných tokenov, pričom na tomto koncovom bode sa neúčtuje žiadny poplatok za výstupný token. Pre oprávnených zákazníkov existujú cesty Zero Data Retain a HIPAA.
Na DevDay sa objavila v obmedzenej ukážke a teraz je otvorená. GA je „v najbližších týždňoch“. Toto sú nepríťažlivé inštalatérske produkty, ktoré potrebujú – klasifikátory bez toho, aby ste zakaždým písali román.
EmbeddingGemma 2 od spoločnosti Google DeepMind zhromažďuje text, obrázky, zvuk a video do jedného vektorového priestoru na zariadení
EmbeddingGemma 2 je model Apache 2.0 so 740 miliónmi parametrov, ktorý mapuje text, kód, obrázky, video a zvuk do zdieľaného 768-rozmerného priestoru. Je postavený na platforme Gemma 4. Je zameraný na telefóny a iný hardvér s úzkym rozhraním, nie na ďalší obrovský cloudový embedder.
Načítajte iba to, čo potrebujete: 270 MB pre text, pridajte vizuálnu alebo zvukovú grafiku alebo využite celý zásobník. Skrátenie Matryoshky dokáže zmenšiť vektory na 128 dimenzií, čím sa ušetrí až 6-krát menej úložného priestoru. Kontext má 8 kB tokenov – dosť na zhruba 5,5 minúty zvuku alebo desiatky snímok. Google uvádza, že kód MTEB vzrástol takmer o 10 bodov oproti prvej EmbeddingGemme.
Na Pixeli 11 Pro s kvantizáciou potrebujú váhy iba pre text približne 191 MB aktívnej pamäte RAM; plne multimodálne zobrazovanie približne 567 MB. Pôvodný textový model už prekonal 20 miliónov stiahnutí. Tichšie spustenia od Googlu majú niekedy väčší význam ako tie okázalé.
Juhokórejský minister vedy zdvojnásobuje úsilie o hraničný projekt umelej inteligencie v hodnote 3,5 miliardy dolárov po projekte Mythos
Na parlamentnom audite podpredseda vlády Bae Kyung-hoon povedal, že Soul si ponechá svoj projekt modelu suverénneho základu a pridá samostatný program umelej inteligencie na hraniciach. Spojenie investícií vo výške 4,7 bilióna wonov (3,5 miliardy dolárov) spojil s „šokom okolo Mythos“ okolo Clauda Mythosa z Anthropic a s hrozbami v kybernetickej bezpečnosti.
Toto suverénne úsilie prešlo druhým hodnotením a smeruje k tretiemu. Bae označil súčasné výsledky za globálne stredné a chce niečo bližšie k popredným systémom s otvorenou váhou. Do konca roka tiež predstavil službu „AI pre všetkých“ – bezplatnú a bez obmedzení používania – a mega projekty v oblasti dátových centier, fyzickej AI a čipov.
Takže príbeh nie je o „zrušení domáceho modelu“. Ide o „pridaní väčšej a strašidelnejšej trate vedľa neho“. Národné preteky umelej inteligencie sú stále drahšie. Či je 3,5 miliardy dolárov dosť v porovnaní s americkým a čínskym rozsahom, je otázne. Zdá sa, že Bae si myslí, že sedieť na mieste je horšie.
Často kladené otázky
Čo OpenAI nahádzala na GitHub so svojím nevydaným modelom hraničnej matematiky?
Spoločnosť OpenAI zverejnila 372 rodín matematických výsledkov – približne 722 rukopisov – z nezverejneného hraničného modelu. Mnohé dôkazy sú už k dispozícii v Lean. Spoločnosť tvrdí, že dosiahla pokrok v štvorrozmernej Kakeyovej hypotéze, vylepšila algoritmus a pracuje na Riemannovej hypotéze. Hovorca uviedol, že takmer každý výsledok pochádza z jednej výzvy pre jedného agenta, čo v priemere trvalo približne tri hodiny premýšľania v ChatGPT Pro – nie je to obrovský multiagentový roj.
Prečo sú matematici skeptickí voči príbehu OpenAI o jednorazových matematických dôkazoch?
Andrew Sutherland z MIT naliehal na spoločnosť OpenAI, aby ukázala model alebo aby tvrdenie o jednorazovom pokuse považovala za neoverené. Vlastná poradná skupina OpenAI požadovala výzvy, názvy modelov a výpočtové potvrdenia. Namiesto toho spoločnosť zverejnila priemery a niektoré Lean formalizácie. Dôkazy sa síce môžu formálne potvrdiť, ale novosť a naratív o jednom agentovi zostávajú sporné, kým sa neobjavia úplnejšie dôkazy.
Čo je Mistral Large 4 a kedy dorazia závažia?
Mistral Large 4 – nazývaný aj ML4 alebo „Le Chonk“ – je natívne multimodálny model so zmesou expertov s celkovým počtom 1 bilióna parametrov a 49 miliardami aktívnych. Trénoval sa na 3 800 grafických procesoroch NVIDIA Grace Blackwell v európskych dátových centrách spoločnosti Mistral. Verejná ukážka je k dispozícii; plné váhy sú sľúbené do konca mesiaca po spolupráci s partnermi a vládami. Mistral predstavil prípady použitia v oblasti kybernetickej bezpečnosti, financií, práva a návrhu čipov.
Ako Claude funguje v Dokumentoch Google, Tabuľkách a Prezentáciách?
Claude pre Google Workspace je vo verejnej beta verzii v platených programoch prostredníctvom doplnku Marketplace. Nachádza sa v bočnom paneli, ktorý umožňuje čítať súbor a upravovať ho na mieste, alebo vytvárať a upravovať súbory Google z chatu Claude. V Dokumentoch dokáže opravovať vety alebo vkladať karty s návrhmi; Tabuľky načítavajú vzorce, pivoty, grafy a voliteľný Python; Prezentácie dokážu vytvárať prezentácie z vašej témy. Predvolený režim sa pred úpravami spýta; režim „Prijať všetko“ preskočí výzvy.
Aký problém sa snaží vyriešiť protokol osobného agenta Meta a Sierra?
Osobní agenti s umelou inteligenciou často narážajú na CAPTCHA alebo priame blokovania pri nakupovaní alebo volaní obchodných API. Sierra a Meta spolu s partnermi vrátane Genesys, Shopify, Stripe a Walmart pripravujú otvorený štandard, aby spotrebitelia mohli kontrolovať prístup agentov a spoločnosti nastavovali povolené akcie cez OAuth. Špecifikácia v0.1 a referenčná implementácia by mali byť dostupné koncom tohto mesiaca. OpenAI a Anthropic ešte nie sú k dispozícii.
Kedy by ste mali použiť rozhranie Decisions API od OpenAI namiesto rozhrania Responses API?
Siahnite po rozhraní Decisions API, keď potrebujete rýchlu odpoveď typu áno alebo nie – pravdepodobnosť, že podmienka je pravdivá, výber zo zoznamu alebo skóre na zoradených úrovniach. Beží na gpt-6-luna prostredníctvom POST /v1/decisions, akceptuje text a vložené obrázky base64 a je približne 10-krát rýchlejšie ako Responses API. Cena je 0,10 USD za milión vstupných tokenov bez poplatku za výstupný token. Pre oprávnených zákazníkov existujú cesty Zero Data Retention a HIPAA; GA sa očakáva v nasledujúcich týždňoch.
Čo robí EmbeddingGemma 2 od Google DeepMind užitočným na telefónoch?
EmbeddingGemma 2 je model Apache 2.0 so 740 miliónmi parametrov, ktorý mapuje text, kód, obrázky, video a zvuk do jedného 768-rozmerného priestoru. Môžete načítať iba text (270 MB), pridať obraz alebo zvuk alebo zachytiť celý zásobník. Skrátenie Matryoshka dokáže zmenšiť vektory na 128 dimenzií, čím sa ušetrí až 6-krát menej úložného priestoru. Na kvantizovanom Pixeli 11 Pro potrebuje iba text približne 191 MB aktívnej pamäte RAM a plný multimodálny režim približne 567 MB s kontextom tokenu 8K.