1. Разбор с говорящим названием - сравнение цен на генерацию видео - сложил цифры трёх сервисов рядом. Kling берёт семь центов за секунду, Sora 2 - десять центов, а у Runway разброс от пяти до десяти центов в зависимости от настройки. Это не объявление самого Kling, а чужой независимый подсчёт, и это стоит держать в голове, читая любые проценты дальше
2. Переведём это в единицу, которую держишь в голове, когда планируешь серию. Минута непрерывного видео у Kling - это шестьдесят секунд по семь центов, то есть чуть больше четырёх долларов. У Sora 2 та же минута обойдётся уже в шесть долларов. У Runway минута качнётся от трёх долларов до тех же шести, смотря какую настройку выберешь на старте
3. Разница с Sora у Kling получается не половина и не две трети, а примерно треть - и это честная цифра, а не округлённая для эффекта. С Runway сравнение сложнее: если брать его самую дешёвую настройку, Kling внезапно выходит дороже, а не дешевле. Один и тот же сервис можно назвать и выгодным, и невыгодным - зависит, с какой именно настройкой конкурента его сравнивать
4. Здесь легко попасться на округление. Кто-то посчитает разницу в процентах красивее, чем она есть на самом деле, и цифра начнёт гулять по постам без ссылки на источник. Гайд честно называет себя сравнением цен, а не заявлением производителя, и это разница, которую видно только если дочитать текст до конца, а не до заголовка
5. За этими центами стоит обычный вопрос бюджета. Секунда становится минутой, минута - серией из нескольких сцен, и разброс в несколько долларов на секунду превращается в разброс на десятки долларов за одну серию. Дальше это уже не про технологию, а про то, сколько денег ты готов заложить на один эпизод своего мультика ещё до первого кадра
Сколько ты вообще готов вложить в одну серию своего мультика, прежде чем цена генерации начнёт останавливать тебя?
1. Одиннадцатого августа CapCut объявил, что рисовалка Nano Banana Pro встроена прямо в интерфейс монтажника. Раньше герой для мультика рождался в одной программе, а собирался в другой, и картинки перекидывались между вкладками. Теперь лицо персонажа рисуется и сразу монтируется в одном окне на телефоне. Страница инструмента прямо называет CapCut местом, где это происходит
2. Первая заявленная способность - апскейл изображения до 4K. Раньше картинка героя, нарисованная под маленький экран телефона, при переносе на монтажный холст рассыпалась на пиксели, и под это держали отдельный апскейлер. Теперь этот шаг встроен туда же, где рисуется сам персонаж. Страница инструмента заявляет это прямой строкой, без пояснения, на каких исходниках проверяли результат
3. Вторая способность касается текста и диаграмм внутри картинки. CapCut пишет о заметно улучшенном рендеринге текста и диаграмм - раньше подписи на кадре и схемы почти всегда выходили кашей из нечитаемых символов. Для обложки серии или титульного кадра с именем персонажа это разница между кадром на перерисовку и кадром, который можно сразу оставить как есть
4. Про цену страница формулирует расплывчато: «обычно доступен для бесплатного использования». Точную квоту - сколько картинок в день, есть ли предел по разрешению - CapCut не называет вообще. По сети уже гуляют разные цифры, но ни одна из них не с этой страницы, и повторять их было бы обманом
5. Вывод здесь без обещаний. Шаг, с которого начинается любой мультик - как выглядит герой - переехал внутрь приложения, которое и так стоит на телефоне у половины страны для монтажа сторис. Рисовать и увеличивать картинку больше не нужно в двух вкладках. Герой всё равно должен ожить в видео и заговорить, но первый кадр теперь собирается там же, где потом склеивается ролик
Ты бы стал рисовать своего персонажа прямо в CapCut, или всё равно тянет открыть для этого отдельное приложение по привычке?
1. На этой неделе поймал себя на смешном. Сидим на кухне, разговор заходит про д*ньги, и я машинально переворачиваю телефон экраном вниз. Как будто микрофон живёт в стекле и его можно накрыть, будто одеялом. Собеседник, кстати, сделал ровно то же самое, только на секунду позже меня
2. Ритуалов таких у нас накопилось прилично. Кто-то заклеивает камеру ноутбука и тем же вечером выкладывает сторис из спальни. Кто-то говорит шёпотом рядом с колонкой. Кто-то уносит телефон в другую комнату и оставляет его там с открытым приложением, что особенно трогательно. Толку в этих движениях примерно ноль, зато спокойнее
3. А что работает, выяснилось за ту же неделю и заняло меньше десяти минут. Список разрешений в настройках телефона: кому выдан микрофон, кому контакты, кому геолокация. Отзывается всё там же, потому что доступы раздаёт операционная система, а не приложение. Ни одного переворота телефона в этом списке почему-то не предусмотрено
4. Про те полторы секунды в боевой настройке я к воскресенью, честно говоря, успокоился. Это короткое окно перед командой, и часть аудио оттуда может передаваться на сервер для проверки распознавания, и Яндекс написал об этом сам, хотя мог спокойно отмолчаться. Зацепило меня другое: размер окна настраивается удалённо, а жёсткий потолок компания только планирует зашить в приложение
5. С понедельника у нас другая тема, эту закрываю. Итог недели скучный и поэтому честный: телефон не злодей, ритуалы не работают, а десять минут в настройках работают. Всё остальное упирается в доверие, а доверие проверкой не заменишь, как ни старайся. Переворачивать телефон я при этом, кажется, всё равно не перестану
А у тебя какой ритуал: телефон экраном вниз, заклеенная камера или разговор шёпотом на кухне?
1. Всю неделю мы обсуждали полторы секунды буфера в боевой настройке, а в том же тексте лежит раздел поспокойнее и попрактичнее. Он про то, как приложение вообще понимает, где ты находишься. Называется пункт «Как Android определяет местоположение по Wi-Fi и сотовым сетям». И это механизм самой операционной системы, а не выдумка одного приложения
2. Место считается не только спутниками. В ход идут отпечатки ближайших сетей Wi-Fi, идентификаторы сотовых вышек и Bluetooth-маячки рядом с тобой. Все три источника перечислены в разборе прямым списком, вместе с сокращениями вроде Cell ID и MCC. Работает это через системное разрешение, а выдаёт разрешение пользователь, то есть ты
3. И деталь, которая решает больше, чем кажется. В статье сказано: если разрешение действует только во время использования приложения, механизм не работает в фоне. То есть строчка «только при использовании» в списке разрешений это не косметика, а рабочий выключатель. Лежит он там же, где раздаются все остальные доступы
4. Рядом стоит пункт, который отменяет самый популярный страх. Про логи сказано дословно, что «читать логи других приложений невозможно», потому что доступ к чужим логам закрыт на уровне системы ещё с Android 4.1. Механизм собирает события самого приложения, «не банков, не мессенджеров, ничьих других», это тоже цитата. Свои логи шифруются при передаче и уходят на сервер аналитики
5. Вывод получается неожиданно спокойный. Половина того, что принимают за слежку конкретной компании, оказывается механикой операционной системы и работает у всех приложений одинаково. Вторая половина, вроде окна перед голосовой командой, действительно настраивается на стороне сервиса, и Яндекс это подтвердил сам. Полезно понимать, какая из половин перед тобой, потому что выключатели у них разные
Как у тебя выдана геолокация, «всегда» или «только при использовании», и когда этот список проверялся последний раз?
1. Показываю оба экрана, потому что первый мне до сих пор не нравится. Запись на пять минут моя первая сборка на питоновском Whisper переваривала восемь с половиной минут, то есть дольше самой записи. На длинных файлах та же large-v3 держала 0,85 от реального времени, на коротких проседала ещё сильнее. Тогда я и списал всю затею считать у себя в утиль
2. Виноват оказался не компьютер и не модель, а способ, которым модель запускают. Тот же самый файл через Buzz уложился в пятьдесят пять секунд, а через whisper.cpp в двадцать. Один файл, один компьютер, а между восемью с половиной минутами и двадцатью секундами лежит только способ запуска. После этого я перевёл на whisper.cpp с Metal вообще всё
3. Дальше пошли цифры, ради которых я и мерил. На Mac mini M4 вебинар в час тридцать три уложился в шесть минут десять секунд. Parakeet в быстром режиме идёт двадцать пять раз быстрее реального времени, Whisper Turbo примерно в 2,8 раза. Полтора часа звука и шесть минут ожидания это уже не дело на выходные, а пауза на кофе
4. И наблюдение, ради которого я вообще полез это проверять. Интернет на машине выключен, а расшифровка спокойно идёт. Значит считает мой компьютер, а не чужой сервер, и проверяется это одним движением: отключаешь сеть и смотришь, продолжается работа или встала. Что данные не уйдут когда-нибудь потом, такой тест не доказывает, он доказывает ровно первое
5. Неделю мы искали, в каком месте у голосового помощника стоит невидимая граница и чья рука её двигает. В приложении её двигает производитель, и это его законное право. А тут граница видна руками: пока сеть выключена, звук остаётся на столе, и никакая удалённая настройка на это не влияет. Что я в итоге поменял в запуске и какие вышли цифры - расписал в канале
Что для тебя убедительнее: обещание сервиса в тексте на сайте или выключенный интернет на своём экране?
1. Разбор Яндекса удобен одним: там перечислены места, куда можно зайти и увидеть всё своими глазами. Я собрал из них три шага и добавил четвёртый от себя. Все делаются за один вечер и все бесплатные. Пунктов из серии «поверь на слово» здесь нет, каждый проверяется руками. Начинаем с самого простого
2. Шаг первый: включи голосовой ввод в любом приложении и подними взгляд к верхнему краю экрана. Точку микрофона там зажигает операционная система, и это единственное место, где работу микрофона видно глазами. Шаг второй: зайди в разрешения телефона, посмотри, кому выдан микрофон, и у лишних отзови. В разборе сказано прямо, что доступ контролирует сама ОС и отозвать его можно в настройках устройства
3. Шаг третий, самый недооценённый из четырёх. В Яндекс ID есть раздел «Данные», и вот дословная цитата из статьи: «Им доступен инструмент, где они могут проверить, какие данные хранит о них Яндекс, и удалить их при желании из разных сервисов компании». Путь называет сама компания, значит и спрашивать разрешения не у кого. Открываешь, изучаешь список и вычищаешь оттуда лишнее
4. Шаг четвёртый уводит от телефона к компьютеру. Когда запись такая, что чужому серверу её показывать нельзя, расшифровку делают прямо у себя на машине, никуда файл не отправляя. И сразу оговорка, чтобы не подменять одно другим: помощника в телефоне это не чинит и не отменяет, там границу провёл производитель. Чинится другое, та запись, которая уже лежит у тебя файлом
5. Первые три шага занимают минут десять. Первые два шага работают у всех, даже если приложения Яндекса на телефоне нет вовсе, для третьего нужен аккаунт Яндекса. Четвёртый длиннее, зато границу там ставишь ты. Прежде чем идти в четвёртый, посмотри, нужен ли он тебе: я разобрал отдельно, что реально дают бесплатные сервисы, где у них лимиты и что происходит с твоим файлом на их серверах. Лежит у меня в Telegram-канале. Первые три сделай прямо сейчас
Сколько приложений найдётся в твоём списке с доступом к микрофону, и все ли они там по делу?
1. Всю неделю мы считаем полторы секунды перед командой в боевой настройке. А теперь смотри, что тот же человек делает добровольно и не моргнув. Берёт запись планёрки на полтора часа, где звучат имена, суммы и то, что говорилось точно не для чужих ушей, и жмёт «загрузить файл» на первом попавшемся сайте. Уже не короткое окно перед командой, а полтора часа целиком
2. Дальше сценарий предсказуемый. Бесплатный сервис упирается в лимит по длине примерно на том месте, где вступление кончилось и пошла суть, и предлагает оплатить. Сервис без лимита забирает файл целиком и уносит его к себе, а куда именно и надолго ли, ты уже не проверишь. Русский текст оттуда потом правишь дольше, чем идёт сама запись
3. Разница между двумя этими историями простая. Помощнику чужой сервер нужен по устройству задачи: он обязан сходить за ответом наружу, иначе никакой он не помощник, и границу там провёл производитель. А запись, которая уже лежит файлом, никуда ходить не обязана, потому что вопроса, на который отвечает чужая машина, у неё нет. Ей нужно только время процессора, а процессор стоит у тебя на столе
4. Скажу честно, помощника в телефоне это не чинит и не отменяет. Чинится другое: та запись, которая уже лежит у тебя файлом. У меня на этот случай собрана статья, где разобраны три бесплатных сервиса
с их настоящими лимитами, грабли каждого и честный ответ, что происходит с твоим файлом на их серверах. Ролик закончится раньше, чем я успею дойти хотя бы до второго сервиса
5. Ссылку в подписи не ставлю, здесь от неё толку нет. Статья у меня на сайте, а ссылку на неё выдаёт бот в Telegram-канале по одному слову. Слово назову в свежем посте канала, там же и забирается. Читать её можно бесплатно и целиком, а в конце честно сказано, с какого момента возня с бесплатными сервисами перестаёт окупаться и запись дешевле считать у себя. А что делать со своей папкой записей, ты решишь уже без меня
Сколько часов записей у тебя лежит нерасшифрованными, и когда до них в последний раз доходили руки?
1. Под любым таким разбором в комментариях начинается одно и то же. Первые пишут, что пишут всё подряд и давно, просто теперь признались. Вторые отвечают, что компания расписала механику по пунктам и никакой постоянной записи там нет. Спорят обе стороны об одном тексте, а проверить его не может ни одна из них
2. В разборе Яндекса про приложение на Android написано вот что. Активационную фразу ловит модель на самом устройстве, а короткое окно перед командой крутится в буфере: в боевой настройке примерно полторы секунды до и полсекунды после. Дословно: «Часть аудио перед командой может передаваться на сервер для проверки качества распознавания активационной фразы». Может передаваться, а не передаётся, это разные вещи
3. Дальше в том же тексте лежит место, которое цепляет сильнее полутора секунд. Про адресную книгу сказано: «При первом запуске может быть передана вся адресная книга». И следом: «Имена и номера телефонов не хэшируются», потому что серверу нужны сами значения, чтобы узнать нужный контакт в голосовой команде. Синхронизация запускается при открытии ассистента и только при четырёх условиях сразу
4. Отсюда и растёт развилка, на которой стоит каждый. Первый способ: зайти в разрешения телефона, посмотреть, кому выдан микрофон и кому выданы контакты, и у лишних отозвать. Второй способ: оставить как есть, потому что помощник экономит тебе несколько движений в день и в этой сделке тебя всё устраивает. Оба варианта рабочие, и выбрать между ними за тебя никто не сможет
5. Выбор здесь идёт не между «следят» и «не следят». Разрешения раздаёт операционная система, отзываются они там же, в настройках устройства, и это записано в самом разборе. Значит единственная часть истории, где решает не удалённая настройка, а ты, это как раз тот список галочек. Всё остальное решили ещё до того, как телефон попал к тебе в руки. Что из этого выбрал я сам, рассказал в Telegram-
канале
Ты в каком лагере: отбираешь микрофон у всего лишнего или оставляешь помощника работать как раньше?
1. Седьмого августа компания опубликовала ответ на чужой разбор и расписала одиннадцать своих механизмов подряд. Речь идёт про Яндекс Браузер и приложение Яндекса на Android, а не про телефон вообще. Про активацию сказано прямо: «Если приложение закрыто, этот механизм не работает». Закрыто, а не свёрнуто, разница тут принципиальная
2. В приложении слово «Алиса» ловит встроенная модель прямо на устройстве, постоянного потока звука наружу нет. Пока ты молчишь, звук живёт в коротком прокручиваемом буфере, где старые куски непрерывно затираются новыми. Формулировка компании: «Это не постоянная запись всего звука». В боевой настройке окно примерно полторы секунды до активации и полсекунды после
3. В том же тексте лежит кусок поинтереснее. Дословно: «Часть аудио перед командой может передаваться на сервер для проверки качества распознавания активационной фразы». Может передаваться, а не передаётся, и ни частота, ни объём, ни условия там не названы. Рядом живёт второй, отдельный канал, который может отправлять фрагмент до и после активации при разборе сбоев
4. Дальше выясняется, что размер окна задан не только тем, что установлено у тебя в телефоне. Ещё цитата: «Часть этих параметров действительно может настраиваться удалённо». То есть с сервера и без обновления из магазина приложений. Жёсткий потолок этого буфера компания только собирается закрепить внутри приложения, и обещание стоит в будущем времени, без даты и без номера релиза
5. Вывод из этого не про злодейство. Это официальное заявление стороны о собственном продукте, а не независимая проверка: внешних замеров и логов трафика в разборе нет. При этом компания могла отмолчаться и про буфер не рассказывать, а вышла и расписала его сама. Просто у голосовой функции есть невидимая граница, и проводит её не тот, кто говорит. Разбор целиком, с цитатами, выложил в Telegram-канале, он в шапке профиля
Как думаешь, полторы секунды в боевой настройке это мелочь, или про такое лучше узнавать не через год?
