Zo zákulisia
A to boli len hlavné princípy.
Pripojiť AI model a nechať ho rozprávať je začiatok. Potom príde každodenné používanie — a s ním množstvo drobných rozhodnutí, ktoré určujú, či vám asistent skutočne pomáha.
Tu je 100 vybraných otázok, ktoré sme pri vývoji Darwina riešili. Od prvého kliknutia na mikrofón až po situácie, keď pracuje viac agentov, vypadne spojenie alebo príde aktualizácia.
01Rozprávanie a počúvanie10
- Musíte počas rozprávania držať tlačidlo, alebo stačí jedným kliknutím začať a druhým skončiť?
- Čo sa má stať, keď začnete hovoriť, kým asistent ešte odpovedá?
- Zastaví prerušenie aj zvuk, ktorý už čaká na prehratie?
- Ako asistent rozlíši prestávku uprostred vety od ukončeného zadania?
- Ako zabránite tomu, aby asistent počúval a spracúval vlastný hlas?
- Čo sa stane, keď mikrofón zachytí iba ticho alebo hluk?
- Dá sa rozpracovaná nahrávka zrušiť bez odoslania?
- Má medzerník zapnúť mikrofón aj vtedy, keď práve píšete do formulára?
- Kedy sa má po odpovedi znova zapnúť počúvanie?
- Ako používateľ spozná, či asistent počúva, premýšľa alebo už odpovedá?
02Keď kombinujete hlas, text a prílohy10
- Dá sa reč iba nadiktovať do textového poľa a pred odoslaním opraviť?
- Pripojí sa ďalšie diktovanie k rozpísanému textu, alebo ho prepíše?
- Čo sa odošle, keď máte v poli napísaný text a zvyšok zadania poviete nahlas?
- Dokážete presnú cestu k súboru vložiť písaním a pokyn k nej vysloviť?
- Vráti sa rozpísaný text do poľa, ak spracovanie hlasového zadania zlyhá?
- Dá sa snímka obrazovky vložiť priamo zo schránky bez ukladania do súboru?
- Dá sa dokument pridať pretiahnutím do okna?
- Môžete k jednému zadaniu priložiť viac súborov?
- Odošle sa pripravená príloha aj spolu s hlasovým zadaním?
- Ako používateľ zistí, že príloha už bola odoslaná a nečaká na ďalšie zadanie?
03Odpovede, hlas a každodenné ovládanie10
- Dá sa s asistentom pracovať úplne potichu?
- Vypne tichý režim aj generovanie hlasu, alebo iba stíši reproduktory?
- Dá sa už zobrazený text odpovede dodatočne prečítať nahlas?
- Budú sa krátke priebežné oznámenia a záverečná odpoveď prehrávať v správnom poradí?
- Môžu agenti používať rôzne hlasy bez toho, aby rozprávali jeden cez druhého?
- Môže sa jazyk rozhrania líšiť od jazyka odpovedí?
- Ako sa upraví spôsob vyjadrovania pri zmene mužského hlasu na ženský?
- Zostanú vybraný hlas, jazyk a režim zachované aj po reštarte?
- Čo sa stane, keď hlasová služba zlyhá, ale textová odpoveď je už hotová?
- Dá sa zobraziť tvár asistenta na druhom monitore bez druhého prehrávania hlasu?
04Keď odídete alebo vypadne spojenie10
- Zamkne sa prístup k citlivým funkciám, keď asistenta necháte bez dozoru?
- Znamená otvorené okno automaticky aj oprávnenie pracovať so súbormi a poštou?
- Čo uvidí neznáme zariadenie, ktoré otvorí adresu vášho asistenta?
- Čo sa stane s rozpracovanou úlohou, keď sa zamkne displej telefónu?
- Dokončí asistent odpoveď aj po prerušení spojenia?
- Dostanete výsledok po opätovnom pripojení?
- Zobrazí sa doručená odpoveď dvakrát, ak už bola načítaná z histórie?
- Má sa generovať platený hlas, keď už nie je pripojený žiadny poslucháč?
- Čo sa stane, keď máte asistenta otvoreného vo viacerých kartách?
- Otvorí pokyn z telefónu stránku na vzdialenom počítači, alebo ponúkne odkaz priamo v telefóne?
05Pamäť a vlastné dokumenty10
- Čím sa líši história rozhovoru od informácie, ktorú si má asistent pamätať dlhodobo?
- Ako asistent nájde poznámku, keď si nepamätáte jej presný názov?
- Ako vyberie relevantnú pamäť bez načítania celého archívu do každej otázky?
- Ako zabránite tomu, aby tisíce dokumentov prekryli niekoľko dôležitých osobných poznámok?
- Dá sa hľadanie obmedziť na konkrétny projekt alebo zbierku?
- Ako sa do vyhľadávania premietne zmena pôvodného dokumentu?
- Čo sa stane s indexom, keď pôvodný súbor odstránite?
- Ako zabránite tomu, aby sa ten istý dokument vo výsledkoch objavoval cez viac kópií?
- Čo presne sa má odstrániť, keď používateľ povie „toto zabudni"?
- Ako odlíšite vlastnú pamäť od informácie doručenej iným asistentom?
06Agenti a rozdelenie práce10
- Vie používateľ určiť, ktorému agentovi zadanie patrí?
- Ako sa vyberie agent, keď používateľ jeho meno vôbec nespomenie?
- Môže mať každý agent vlastný mozog, hlas a pracovné zdroje?
- Čo ak hlavný asistent funguje, ale mozog jedného agenta odmieta požiadavky?
- Dá sa zadať práca ďalšiemu agentovi, kým prvý ešte pracuje?
- Dá sa zastaviť jeden agent bez prerušenia ostatných?
- Ako zabránite tomu, aby si súbežní agenti pomiešali prílohy a kontext?
- Kam si agent uloží výsledok a poznatky zo svojej práce?
- Ako používateľ rozlíši zadanie prijaté agentom od skutočne dokončenej práce?
- Čo sa stane s nástrojmi rozpracovaného agenta, keď sa medzitým reštartuje backend?
07Procesy a automatizácie10
- Čo spúšťa proces — používateľ, čas, nová správa alebo zmena v priečinku?
- Vie proces sledovať viac pracovných priečinkov naraz?
- Má sa vznik nového priečinka považovať za udalosť rovnako ako nový súbor?
- Ako zabránite spusteniu procesu nad súborom, ktorý sa ešte len kopíruje?
- Má proces spracovať každý nový súbor zvlášť, alebo počkať na celú skupinu?
- Zapamätá si sledovanie priečinka svoj stav aj po reštarte?
- Čo sa stane, keď sledovaný disk dočasne nie je dostupný?
- Dostane proces konkrétne nové podklady, alebo iba všeobecnú informáciu, že sa niečo zmenilo?
- Ako sa má proces správať po pozastavení a opätovnom zapnutí?
- Ako zabránite tomu, aby dokončenie jedného procesu spustilo nekonečný kruh ďalších?
08Nástroje, pluginy a pripojené služby10
- Znamená nainštalovaný plugin aj správne nastavenú a použiteľnú funkciu?
- Ako sa asistent dozvie, aké operácie nový plugin podporuje?
- Čo sa stane, keď má jeden plugin chybnú definíciu nástroja?
- Funguje rovnaká schopnosť aj po prepnutí na iný mozog?
- Platia rovnaké oprávnenia pri hlasovom pokyne aj pri kliknutí na stránke pluginu?
- Znamená agent pomenovaný „Účtovník" aj skutočné prepojenie s účtovnou aplikáciou?
- Ako asistent rozlíši pripravený e-mail od už odoslanej správy?
- Ako sa overí, že používateľ schválil práve tú verziu správy, ktorá sa má odoslať?
- Vie asistent pred platenou mediálnou operáciou rozlíšiť odhad od skutočného spustenia?
- Ako používateľ zistí, či problém spôsobila licencia, oprávnenie, chýbajúce nastavenie alebo externá služba?
09Aktualizácie a dlhodobé používanie10
- Zostanú používateľovi po aktualizácii jeho nastavenia, pamäť a agenti?
- Čo sa stane s pluginom, ktorý si používateľ sám upravil?
- Ako sa doručí oprava vstavaného pluginu bez straty vlastných rozšírení?
- Dostane nová funkcia spolu s aktualizáciou aj knižnice, ktoré potrebuje?
- Čo sa stane, keď sa načíta nová stránka rozhrania so starými súbormi v pamäti prehliadača?
- Dokáže používateľ po chybe zistiť, ktorý krok práce zlyhal?
- Rozlíši chybové hlásenie dočasný výpadok služby od nesprávneho nastavenia?
- Ako zabránite tomu, aby sa prístupové údaje dostali do diagnostiky alebo odpovede asistenta?
- Zostanú používateľské dáta zachované aj po skončení skúšobnej verzie?
- Ako sa dá obnoviť funkčná inštalácia, keď aktualizácia nedopadne správne?
10A ďalšie detaily mimo samotného rozhovoru10
- Ako asistent rozlíši dve podobne pomenované udalosti, keď chcete jednu z nich presunúť v kalendári?
- Z ktorého účtu má čítať poštu, keď máte pripojenú pracovnú aj súkromnú schránku?
- Dá sa vybrať správna kamera, keď je k počítaču pripojených viac zariadení?
- Ako zabránite tomu, aby bežné gestikulovanie počas reči spúšťalo ovládacie gestá?
- Má gesto meniť veľkosť tváre asistenta, alebo priblíženie práve otvorenej mapy pamäte?
- Ako sa konkrétne svetlo priradí k správnej miestnosti v modeli domu?
- Bude zobrazenie domu fungovať aj bez pripojených teplotných čidiel?
- Čo sa stane s odovzdaním úlohy spolupracovníkovi, keď jeho Darwin práve nie je dostupný?
- Má preklad videa zachovať pôvodný hlas a časovanie, alebo vytvoriť nové nahovorenie preloženého textu?
- Dá sa pred spracovaním nahrávky zistiť, koľko obsahuje reči a koľko plateného času by tvorilo iba ticho?
A aj toto je iba zlomok.
Toto je len 100 vybraných otázok, nie úplný zoznam toho, čo Darwin obsahuje. Kalendár, ovládanie gestami, kamera, dom a zariadenia, tímová spolupráca, spracovanie videí a ďalšie už hotové oblasti majú vlastné nastavenia, prepojenia a desiatky podobných detailov. Navyše sa funkcie stretávajú: počas práce agenta príde ďalšie zadanie, zmení sa nastavenie alebo vypadne pripojená služba — a aj vtedy musí byť jasné, ako sa má asistent zachovať.
Za každou takouto otázkou je rozhodnutie o správaní, prepojenie viacerých častí a overovanie toho, čo sa stane aj mimo ideálneho scenára. Na Darwinovi pracujeme každý deň: rozvíjame jeho schopnosti, dolaďujeme každodenné používanie a riešime ďalšie situácie z praxe. Práve z tejto práce vzniká asistent, s ktorým sa dá každý deň pracovať.
Aj vývoj s AI má svoju réžiu.
Pri malom prototype môže stačiť niekoľko zadaní a základný paušál. Keď však aplikácia narastie, aj krátke „oprav toto správanie" môže znamenať čítanie viacerých častí projektu, hľadanie súvislostí, úpravy a opakované overovanie. Náročnosť sa preto nedá počítať iba podľa počtu správ: záleží aj na modeli, rozsahu kontextu a práci, ktorú zadanie vyvolá. Ako sa líši spotreba pri vývojových úlohách.
Súčasťou práce je aj to, ako AI zadávame úlohy a aké podklady jej pripravíme. Jedno vlákno pre všetky nesúvisiace problémy postupne hromadí nepotrebnú históriu; začínať každú drobnú úpravu úplne odznova zase znamená opakovane vysvetľovať projekt. Pomáha držať súvisiacu prácu pokope, oddeľovať samostatné témy a priebežne zachytávať rozhodnutia, aby sa pri pokračovaní nemuselo všetko zisťovať znova.
Úlohu môže hrať aj cache — opätovné využitie už spracovanej spoločnej časti vstupu. Pri podporovaných API môže znížiť čas spracovania aj cenu opakovaného kontextu, jej využitie však závisí od zhody obsahu, modelu a pravidiel poskytovateľa. Súvislá práca tak môže za určitých podmienok využiť cache lepšie než návraty po dlhších prestávkach, samotná dĺžka prestávky však neurčuje spotrebu ani cenu. A pravidlá API cache samy osebe nevysvetľujú, ako sa odpočítava konkrétny paušálny limit. OpenAI: cache vstupov, Anthropic: cache vstupov.
Podobne záleží na usporiadaní kódu. Rozdelenie podľa zodpovedností do prehľadných modulov pomáha človeku aj AI pracovať s relevantnou časťou namiesto opakovaného prechádzania jedného obrovského súboru. Samotný vyšší počet súborov však nič nezaručuje: rozhodujú jasné hranice, zrozumiteľné prepojenia a možnosť overiť zmenu bez poškodenia ostatných funkcií. Aj Darwin počas rastu ukazuje, kde už pôvodné usporiadanie potrebuje ďalšie rozdelenie.
Aj pri premyslenom zadávaní a organizácii práce sa nám pri intenzívnom vývoji stáva, že týždenný limit vyššieho paušálu vyčerpáme už približne v polovici obdobia. Je to naša skúsenosť z vývoja, nie pravidlo pre každý projekt. Za hotovým asistentom je preto aj čas venovaný práci s kontextom, testovaniu a údržbe — nielen samotnému generovaniu kódu.
Chceš to skúsiť z druhej strany?
Ak staviaš vlastného, vezmi si od nás štyri prompty. Ak by si radšej videl hotovú vec, napíš si o skúšobnú verziu — na tej istej stránke.
Prompty zadarmo › Pozri Darwina ›