Start the conversation!
Читайте также
- Дизайн и маркетинг 27 мартFreechising на практике: Успех после подкаста
Читать далееВдохновившись подкастом “Фриланс 2026: Полный курс для начинающих” на Mave.stream, применили freechising для создания франшизы с автоматизацией лидов — партнёры из digital-ниши быстро запустили свои версии без вложений.
Шаги реализации по урокам подкаста
Скопировали шаблон JS-бота из эпизода, интегрировали с Yandex API для локального таргетинга СПб и упаковали в брендированный пакет. Рассылка по TenChat привлекли маркетологов и e-com проекты — они внедрили ботов самостоятельно с комиссией от продаж.
Инструменты подкаста на практике
• Автоматизация: GitHub Actions для деплоя ботов.
• Техстек: Hugo-лендинги + Markdown для документации.
• Продажи: Email-воронка с AI-генерацией.
• Партнёрка: Пассивный доход от партнёрских конверсий.
Результаты внедрения freechising
Партнёры: несколько активных внедрений. Время: несколько дней. Ключ: 80% автоматизации + локальная ниша СПб для быстрого масштаба, как в финальном эпизоде.
Внедряйте решения, полученные в результате подкаста
Готовые шаблоны ждут на https://mave.stream/freechising — запускайте свой кейс с ботами, виджетами или блогами. Делитесь в комментах первым результатом!
- Дизайн и маркетинг 24.10.2025Amazon запускает ИИ-помощника, который объясняет целесообразность покупки
Читать далееAmazon продолжает активно интегрировать функции искусственного интеллекта в свой покупательский опыт. Сегодня компания представила новую функцию под названием «Помоги мне решить» (Help me decide), которая представляет собой значительный шаг вперед в персонализации электронной коммерции. Этот инструмент не просто предлагает товары, но и обосновывает, почему тот или иной продукт подходит именно вам, анализируя вашу историю поиска, просмотра и покупок на платформе.
«Помоги мне решить» использует сложный алгоритм для анализа поведенческих данных пользователя. Например, если вы ищете палатку для кемпинга, при этом ранее просматривали спальные мешки на четверых, походные плиты и уже приобрели походные ботинки, инструмент предложит всесезонную четырехместную теплую палатку. Изначально система ориентируется на текущий ценовой диапазон, в котором вы просматриваете товары, но также может предложить более дешевые или дорогие альтернативы, если вы выберете опцию «показать больше вариантов».
Кнопка «Помоги мне решить» будет появляться после того, как пользователь просмотрел множество похожих товаров, а также будет доступна под опцией «Продолжить покупки» в верхней части главной страницы. Функция будет доступна для потребителей в США через приложение Amazon Shopping на iOS и Android, а также на веб-сайте.
Дэниел Ллойд, вице-президент по персонализации в Amazon, подчеркивает важность новой функции: ««Помоги мне решить» экономит ваше время, используя ИИ для предоставления рекомендаций по продуктам, адаптированных к вашим потребностям после просмотра нескольких похожих товаров, что дает вам уверенность в решении о покупке». Это ключевой момент: Amazon стремится не просто предложить, а убедить пользователя в правильности выбора, снижая так называемый «паралич выбора» (decision fatigue) и повышая уверенность в покупке.
В основе инструмента лежат большие языковые модели (LLM), а также собственные облачные сервисы Amazon Web Services (AWS): генеративный ИИ-сервис Bedrock, поисковый сервис OpenSearch и рекомендательный сервис SageMaker. Это демонстрирует глубокую интеграцию и практическое применение передовых ИИ-разработок Amazon в реальных бизнес-сценариях.
За последний год Amazon значительно активизировал свои усилия по внедрению ИИ в сферу шопинга. Среди других инициатив компании:
- : Запущен в прошлом году для ответов на вопросы пользователей о продуктах.
- : Добавлены в октябре 2023 года для более чем 100 категорий товаров.
- : Представлены в этом году для быстрого ознакомления с информацией о товарах.
- : Дебютировал в сентябре, позволяя пользователям наводить камеру телефона на объекты в реальном мире и получать рекомендации по продуктам на Amazon.
Эти шаги показывают, что Amazon видит в ИИ ключевой фактор для улучшения пользовательского опыта и увеличения конверсии. Компания стремится создать максимально интеллектуальную и интуитивно понятную среду для покупок, используя свои обширные данные о пользователях и передовые технологии.
Важно отметить, что Amazon не одинок в этой гонке. Такие технологические гиганты, как Google, OpenAI и Perplexity, также активно инвестируют в разработку ИИ-инструментов для шопинга, стремясь увеличить продажи и предложить пользователям более персонализированный и эффективный опыт. Это свидетельствует о формировании нового стандарта в электронной коммерции, где ИИ играет центральную роль в процессе принятия решений покупателем.
- Генеративные нейросети 25 янвГоворилка Qwen3-TTS с поддержкой русского языка. Бесплатная нейросеть озвучит что угодно вашим голосом + портативная версия
Читать далееВсем привет! Команда Qwen от Alibaba выложила в открытый доступ Qwen3-TTS — нейросетевую модель для синтеза речи с клонированием голоса. Сегодня хочу рассказать об этой технологии подробнее и поделиться портативной версией.
Меня зовут Илья, я основатель сервиса для генерации изображений ArtGeneration.me, блогер и просто фанат нейросетей. А еще я сам собрал портативную версию Qwen3-TTS под win11 и успел её как следует протестировать.
Главная особенность системы в том, что она умеет не только озвучивать текст готовыми голосами, но и клонировать любой голос по короткому образцу, а ещё создавать новые голоса по текстовому описанию.
И всё это с нативной поддержкой русского языка.
Как это работает
В основе Qwen3-TTS лежит End-to-End архитектура с дискретным многоканальным токенизатором речи (12.5 Гц, 16 слоёв). В отличие от традиционных систем, которые работают по цепочке "текст → фонемы → звук" и теряют информацию на каждом этапе, здесь всё обрабатывается одним махом.
Такой подход полностью исключает эффект "роботизированности" и каскадные ошибки генерации. Модель сохраняет интонации, эмоции и особенности тембра.
Работает очень быстро даже на старшей модели 1.7B.
Поддерживаемые языки
Qwen3-TTS работает с 10 языками:
- Китайский (включая пекинский и сычуаньский диалекты)
- Английский
- Японский
- Корейский
- Немецкий
- Французский
- Русский
- Португальский
- Испанский
- Итальянский
Возможности
Синтез с готовыми голосами (CustomVoice)
9 встроенных голосов разных типов — молодые и зрелые, мужские и женские. Можно управлять эмоциями и стилем речи через текстовые инструкции.
Создание голоса по описанию (VoiceDesign)
Описываете словами, какой голос нужен — модель его генерирует. Например: "молодой женский голос, игривый, с высоким тоном". Лучше работает если писать промпты на голос на английском.
Клонирование голоса (Voice Clone)
Загружаете аудио от 3 секунд — получаете синтез этим голосом. По бенчмаркам качество клонирования превосходит ElevenLabs и MiniMax по показателям сходства спикеров. Оно и правда веского качества, уровень VibeVoice, но гораздо легче по ресурсам.
Multi-Speaker режим
Создание диалогов и подкастов с несколькими спикерами одновременно (до 4 голосов).
Можно эмулировать разговор между друзьями, актерами, персонажами из игры, все теперь ограничивается только вашей фантазией.
Кому пригодится
Создателям контента — озвучка роликов, подкастов, стримов.
Разработчикам игр — озвучка персонажей без найма актёров, особенно актуально для инди.
Аудиокнигам — разные голоса для персонажей.
Автоматизации — голосовые уведомления, IVR-системы, ассистенты.
Как попробовать
Онлайн-демо
Тут в демо меньше возможностей и нет локализации, но тоже отлично работает.
Hugging Face Demo — https://huggingface.co/spaces/Qwen/Qwen3-TTS
Официальный GitHub
Можно попробовать установить самостоятельность с гитхаб, но это потребует опыта и навыков.
GitHub: https://github.com/QwenLM/Qwen3-TTS
API
Официальное API от Alibaba для production-интеграции.
Ссылка: https://www.alibabacloud.com/help/en/model-studio/qwen-tts-realtime
Портативная версия
Я с каналом Нейро-Софт подготовил улучшенную портативную сборку Qwen3-TTS Portable PRO, видео выше как раз из неё и записаны. А еще там:
- Русифицированный интерфейс
- Установка в один клик (install.bat)
- 50+ готовых голосов в комплекте
- 700+ дополнительных голосов для скачивания из интерфейса
- Multi-Speaker режим до 4 спикеров
- Поддержка NVIDIA GPU и CPU
Скачать: https://github.com/timoncool/Qwen3-TTS_portable_rus
Системные требования
- NVIDIA GPU с 8+ ГБ видеопамяти (или CPU, но медленнее)
- Windows 10/11 64-bit
- 16 ГБ оперативной памяти
- 20 ГБ свободного места на диске
Текущие ограничения
- Ударения иногда расставляются неправильно
- С длинными текстами могут быть проблемы
- Инструкции для VoiceDesign лучше писать на английском
Распакуйте в корень диска (путь без кириллицы), запустите install.bat. Модели скачаются при первом запуске. А если будут сложности в установкой в посте в канале найдете версию с уже установленным env (окружением).
Я рассказываю больше о нейросетях у себя на YouTube, в Телеграм и на Бусти. Буду рад вашей подписке и поддержке. Ну и на канал Нейро-Софт тоже подпишитесь, чтобы не пропустить полезные репаки. Всех обнял и удачных генераций.
- AI-инструменты 21 авгWhen a Video Prompt Isn't Enough: Building a Handoff Contract Between Writers and Reviewers
Читать далееThe Gap Between Writing a Prompt and Approving a Video
Official Flux 3 Video product page preview used to illustrate the article workflow.
Anyone who has moved from writing scripts to producing short video content has hit the same wall: the person who writes the prompt and the person who reviews the output are rarely the same person, and they rarely share the same mental model of what "done" looks like. A marketer drafts a 30-second concept for a product teaser. A creative lead reviews the resulting clip and asks for changes that have nothing to do with the original brief, because the brief was never explicit about pacing, tone, or which visual beats mattered most.
This isn't a tooling problem first — it's a communication problem. Prompts for AI video tools function like lightweight specs, but most teams treat them as throwaway text rather than as a contract between the person requesting a clip and the person judging it. When that contract is missing, review cycles multiply, and nobody can say with confidence whether a revision failed because the prompt was ambiguous or because the output simply missed the mark.
What a Prompt Handoff Contract Actually Contains
A workable handoff contract doesn't need to be formal, but it does need a few fixed elements that travel with the prompt itself:
- Intent: one sentence describing what the clip needs to accomplish (explain a feature, set a mood, demonstrate a workflow).
- Constraints: length, pacing expectations, and any visual or narrative elements that must appear or must not appear.
- Reference material: images, existing footage, or style references the prompt is built from, so the reviewer can trace decisions back to a source.
- Acceptance criteria: what a reviewer checks before approving — not vague satisfaction, but specific markers like "the product is visible by second 3" or "the transition matches the reference clip's rhythm."
Without these four pieces, a prompt is just a wish. With them, it becomes something a second person can evaluate against a standard that isn't just their own taste that day.
A Short Example: Turning a Script Into a Reviewable Draft
Consider a product team preparing a short explainer for a new feature. The writer starts with a two-line script and a still image of the interface. Instead of handing that off as loose text in a chat message, they attach the four contract elements above: the intent ("show the feature activating in under 10 seconds"), the constraint ("no voiceover, text overlay only"), the reference (the interface screenshot), and the acceptance criteria ("overlay text must be readable for at least 1.5 seconds per line").
That structured prompt then goes into a text-to-video or image-to-video workflow. According to the product page, the Flux 3 Video Generator supports turning text prompts, images, and creative references into short AI video clips, which maps directly onto this kind of structured handoff — the image becomes the reference, the script becomes the intent and constraints, and the output becomes the draft the reviewer checks against the acceptance criteria already agreed on.
The value here isn't that the tool guesses correctly on the first try. It's that when it doesn't, the reviewer can point to a specific criterion that wasn't met, rather than issuing a vague "try again" that sends the writer back to guessing.
Where the Review Step Fits — and Where the Tool Fits
The review step should happen against the contract, not against personal preference. A reviewer opens the generated clip, checks it against the intent, constraints, and acceptance criteria the writer specified, and flags mismatches using the same language the prompt used. If the overlay text disappears too quickly, that's a constraint violation, not a matter of opinion. If the feature isn't visible early enough, that's an intent mismatch. This keeps revisions targeted instead of open-ended.
The generation tool sits in the middle of this process as the component that turns a well-specified prompt into a draft worth reviewing — it doesn't replace the contract, and it doesn't remove the need for a human check before anything ships. Teams exploring this kind of workflow can see how prompt, image, and reference inputs come together in practice through Flux 3 Video, and use that as a starting point for building their own handoff habits rather than treating the output as final.
The underlying discipline — writing prompts as contracts, not requests — matters more than any single tool. It's what turns a chaotic back-and-forth into a review process someone can actually trust.
- AI-инструменты 21 авгA Practical Checklist for Turning a Script Into a Video Draft Before You Commit to Rendering
Читать далееWhen a Script Isn't Enough to Judge a Video Idea
Official Flux 3 Video product page preview used to illustrate the article workflow.
A marketing lead hands you a two-paragraph script and asks for a 20-second video draft by end of day. You could jump straight into a generation tool and hope the first output lands, but that approach burns time when the motion doesn't match the pacing you imagined, or when the audio direction contradicts the visual beat. The real problem isn't generating a clip — it's deciding, before you generate anything, what the clip actually needs to prove: tone, pacing, continuity, or just a rough shape for feedback.
Teams that skip this step end up re-rendering the same idea five or six times, each pass reacting to the last one instead of working from a plan. A checklist forces the planning to happen before the render, not after.
Building a Checklist for Scene-to-Motion Decisions
Before choosing how to generate a scene, it helps to separate the decisions that actually change the outcome from the ones that are just preference:
- Source type: Is the starting point a written prompt, an existing image, or a reference clip you want to extend? Each implies a different kind of control over motion.
- Continuity need: Does this shot need to connect cleanly to the one before or after it, or is it a standalone beat?
- Frame anchoring: Do you need the first and last frames locked to specific compositions, or is drift acceptable for a rough draft?
- Audio direction: Is sound meant to be added later, or does the pacing depend on a cue that should be planned alongside the visual?
- Review purpose: Is this draft going to a client, an internal team, or just yourself as a sanity check?
Answering these five questions before generating anything narrows the number of retries, because you're no longer discovering constraints mid-process — you already know what the shot has to satisfy.
Applying the Checklist: A Product Update Video
Say a product team wants a short internal video summarizing a new feature, meant for a Friday review call, not for external release. The script has three beats: a problem statement, a screen-style reveal, and a closing line.
Running it through the checklist: the source type is a written prompt for beat one, since there's no existing footage; beat two might extend from a short reference clip if one exists; beat three needs first-and-last-frame anchoring so the closing shot lands on a specific composition rather than trailing off. Continuity matters between beats one and two but less so for beat three, which can stand alone as a closing card. Audio direction is loose here — a voiceover will be added after review, so the visual pacing just needs to leave room for it.
This is the kind of planning where a structured approach to prompts and scenes helps rather than a single freeform request. According to the product page, Flux 3 Video is built around exactly this kind of structured planning — organizing text-to-video prompts, image-to-video motion, clip extension, and first/last-frame control into a workflow rather than a one-shot generation. That framing matters for a draft like this one, where the team needs to reason about each beat separately before committing to a final render.
What to Review Before Calling a Draft "Final"
Once a draft comes back, the checklist becomes a review filter rather than a planning tool. Before treating any generated sequence as done:
- Check whether the anchored frames actually match the intended composition, not just "close enough."
- Watch the transition points between beats for jarring motion or pacing that doesn't match the script's rhythm.
- Confirm the draft still serves its stated purpose — an internal review clip doesn't need the same polish as a client deliverable, and treating it otherwise wastes review cycles.
- Note anything that would require a different source type next time, so the next iteration starts from a better decision, not a repeated guess.
This review step is where most of the actual quality control happens. Generation gives you a candidate; the checklist tells you whether the candidate is worth keeping or whether one beat needs to be replanned from scratch.
Where This Leaves the Workflow
None of this replaces judgment about tone or story — a checklist only narrows the mechanical decisions so that creative judgment isn't spent re-litigating basic structure every time. For teams that regularly turn scripts or product updates into short video drafts, having a consistent way to plan scenes, motion sources, and frame anchoring before generating anything tends to save more time than chasing a better single prompt. If you're testing this kind of structured approach yourself, the workflow at Flux 3 Video is one place to see how prompt planning, image-to-video motion, and frame anchoring are organized together for exactly this kind of draft-first review process.
- AI-инструменты 19 авгI Stopped Trying to Get the First Video Right
Читать далееI used to spend too much time on the first version of an AI video.
I'd rewrite the prompt, look for better references, change the camera angle and worry about small details before I'd even seen the idea in motion.
Then I'd generate it and realize something much simpler:
I didn't like the idea.
So I changed the way I use that first attempt.
It doesn't need to be good.
It just needs to answer one question.
I Want the Big Answer First
Say I'm making a short video for a pair of running shoes.
Before worrying about lighting or camera movement, I might only want to know:
Does this look better indoors or outside?
That's enough for version one.
Maybe the outdoor scene feels too busy. Maybe a clean indoor setting makes the shoe easier to notice.
Once I know that, I can move on.
There's no point polishing the background of a scene I'm about to throw away.
It's Like Moving a Sofa
I think about it like rearranging a room.
You don't spend twenty minutes deciding where to put a lamp while the sofa is still in the wrong place.
Move the sofa first.
Stand back.
See how the room feels.
Then worry about the lamp.
I've started treating video drafts the same way.
One Version, One Question
I've been using this habit while working with Wan 3.0 too.
Instead of asking the first generation to give me something finished, I give it one small job.
Is this camera angle too low?
Do I actually need a person in the scene?
Would this work better at night?
Is the table making the product harder to see?
I don't need one version to answer all four.
If it answers one, it was useful.
A Bad Version Can Still Be Useful
Imagine a simple food clip.
A bowl of noodles sits beside a window, with steam rising into the afternoon light.
I generate the first version.
The steam isn't great. The bowl could look better.
But the bigger problem is obvious: the bright window pulls my eye away from the food.
Good.
Now I know what to change.
I remove the window and try again.
I don't spend ten minutes fixing the steam in a scene I already know I'm not keeping.
Polish What Survives
Once the basic idea works, then I start caring about smaller things.
Framing.
References.
Movement.
Sound.
But by then, I'm improving an idea I've already decided is worth another attempt.
That makes the process much simpler.
Version one doesn't need perfect lighting, perfect movement or a perfect prompt.
It doesn't even need to be something I'd show anyone.
The first generation doesn't have to impress me.
It just has to tell me what to do next.
- AI-инструменты 19 авгI Stopped Trying to Fill Every Second of an AI Video
Читать далееThirty seconds doesn't sound like much.
But give me a longer AI video and I'll immediately try to squeeze a whole story into it.
Someone enters a café, orders coffee, gets a message, looks surprised, walks outside, sees a taxi...
I've done this more times than I'd like to admit.
Now I do the opposite.
I give the scene less to do.
My Problem Wasn't the Prompt
I used to blame messy results on messy prompts.
So I added more detail: camera movement, lighting, hand movements, background activity.
Sometimes it helped.
But the bigger problem was simpler:
I was asking too much to happen in one clip.
Take a bakery scene.
I could ask a baker to enter, turn on the lights, make coffee, arrange the bread, open the shop and greet a customer.
Or:
Early morning in a small bakery. A baker enters, turns on the lights and places a tray of bread on the counter. The camera slowly moves toward the front window.
I'd rather work with the second version.
It has room to breathe.
I Give Every Shot an "Action Budget"
Before making a clip, I write down only the actions that matter.
For a coffee shop scene:
- She enters.
- She notices her friend.
- She walks over.
- They smile.
That's enough.
They don't need to sit down, order drinks and start talking in the same shot.
Before adding anything else, I ask:
What actually needs to happen before this shot can end?
If I already have an answer, I stop.
More Time Doesn't Mean More Action
I've noticed this even more while making longer clips with Seedance 2.5.
My first instinct was predictable:
Great. I can put more stuff in.
Now I'd rather use some of that time to slow things down.
Imagine someone coming home after work.
They put their keys on the table.
Then they notice a package by the door.
They stop.
That little pause matters.
If they immediately grab the package, open it and react, the scene starts to feel like a checklist.
Sometimes those extra seconds are useful because nothing needs to happen.
Find the Natural Ending
I've also started deciding where a shot ends before adding more actions.
For the bakery, it might end when the tray touches the counter.
For the café, when the two friends see each other.
For the package scene, when the person reaches down to pick it up.
That's enough for one shot.
The next clip can pick up from there.
Before generating, I do one final check:
Can I remove one more thing without losing the point?
Surprisingly often, I can.
Space Isn't Something I Need to Fill
I used to see an extra five or ten seconds as room for another action.
Now I see it as room for the scene itself.
Someone can walk across a room without doing anything else.
The camera can stay still.
A character can notice something and wait a second before reacting.
Those small pauses can make a simple scene work better.
So now my first question isn't:
What else can I add?
It's:
What can I leave out?
- What Does AI Really See When It Rates Your Face?
Читать далееAI-powered face analysis has become surprisingly popular lately. You upload a selfie, and within seconds, an algorithm can analyze different aspects of your face and give you an overall assessment.
But what actually goes into an AI face rating?
I recently came across a tool called Face Rating, which takes a more detailed approach than simply giving you a number.
If you're curious, you can try the free AI face rating test here and see how it analyzes your own face.
It’s Not Just About a Single Score
The interesting part of AI face analysis isn't necessarily the final rating.
A face can look different depending on its proportions, symmetry, facial structure, eye shape, jawline, and other characteristics. Looking at these individual elements can give you a much better idea of what an AI is actually evaluating.
Face Rating analyzes multiple aspects of facial appearance, including areas such as:
- Facial symmetry
- Facial proportions
- Face shape
- Eye characteristics
- Nose proportions
- Jawline
- Golden ratio
- Overall facial structure
Instead of simply saying “your face is X/10,” the idea is to break the analysis down into different components.
Why Are People Interested in This?
Part of the appeal is simple curiosity.
Most of us have looked at a selfie and wondered whether our face is symmetrical, what our actual face shape is, or which features stand out the most.
AI makes it possible to get a different perspective almost instantly.
For example, someone might already know they have a strong jawline, but they may not know how their overall facial proportions compare with common aesthetic measurements.
Someone else might be more interested in their eye shape, facial symmetry, or whether a particular hairstyle would complement their face.
That's where tools like Face Rating become interesting.
You Can Start With a Free Analysis
You don't have to spend money just to see what the experience is like.
You can start with the free Face Rating analysis by uploading a clear photo.
For a more useful result, it's generally better to use a front-facing photo with reasonable lighting and without heavy filters.
Once you've seen the basic analysis, you can decide whether you want to explore the more detailed report and other facial-analysis features.
More Than Just Face Rating
Another thing that makes the platform interesting is that face rating isn't the only type of analysis available.
There are additional tools focused on areas such as facial symmetry, face shape, color analysis, and hairstyles.
That makes it less like a simple “rate my face” website and more like a collection of AI-powered appearance analysis tools.
If you're currently experimenting with hairstyles, grooming, makeup, or simply curious about your own facial structure, it can be a fun way to get some additional insight.
Give It a Try
Of course, an AI-generated rating shouldn't be treated as an objective measurement of someone's attractiveness.
Beauty is subjective, and no algorithm can fully account for personality, expression, style, or the way someone looks in real life.
Still, if you're curious about how AI interprets facial proportions and features, it's an interesting experiment.
You can run a free AI face analysis and see what the system identifies about your own facial features.
It only takes a few minutes, and the results may give you a few things you hadn't noticed before.
- AI-инструменты 17 авгWhy I Test New AI Video Models With Boring Everyday Scenes
Читать далееWhenever I try a new AI video model, I have one rule:
I don't start with a cinematic trailer.
No explosions. No flying cars. No dramatic camera moves through a futuristic city.
I usually start with something boring.
A person putting a coffee cup on a table.
A dog walking through a kitchen.
Someone opening a small shop in the morning.
These scenes won't get many likes as demo videos. But they're surprisingly good at showing me what a model can actually handle.
Simple Scenes Make Mistakes Obvious
Imagine a woman walking into a small café.
She puts her bag on a chair, picks up a cup, and looks through the window.
Nothing special happens.
That's exactly why I like this kind of test.
I already know how everything should behave. If her hand changes shape, the cup moves before she touches it, or the bag suddenly disappears, I notice immediately.
Now imagine testing the same model with a robot riding a dragon through a thunderstorm.
Something strange happens.
Was it a mistake?
Maybe. Or maybe it just looks like part of the fantasy.
Boring scenes give mistakes fewer places to hide.
I Test One Thing at a Time
I also stopped putting ten instructions into my first prompt.
If I want to see how the camera behaves, I keep everything else simple.
For example:
A bicycle is parked outside a small bakery on a quiet morning. The camera slowly moves from left to right.
That's enough.
If that works, I add a person walking out of the bakery.
Next, they unlock the bicycle.
Then I might change the camera angle.
It's slower than throwing everything into one giant prompt, but I can actually tell what changed the result.
Give Every Reference a Job
I've been trying the same idea with Seedance 2.5 lately.
It can work with different types of reference material, including images, video and audio. My first instinct with tools like this used to be simple: more references must mean more control.
I don't think that anymore.
Now I want every reference to have a clear job.
Say I'm making a short clip for a coffee shop.
One image might show the room.
Another might show how the cup and packaging should look.
A short video reference might only be there because I like its camera movement.
That's easier for me to understand and easier to troubleshoot later.
If I throw ten loosely related files into a project and the result looks wrong, I have no idea where to start.
My Grocery Bag Test
One of my favorite boring tests is what I call the "grocery bag test."
Someone comes home carrying a paper bag.
They put it on the kitchen counter, take out an apple and a carton of milk, then walk away.
That's it.
But there are plenty of ways for this tiny scene to go wrong.
Does the bag stay the same size?
Does the apple actually come out of it?
Does the hand touch the object before it moves?
Does the milk carton suddenly change shape?
Is the kitchen still the same kitchen at the end?
A flashy five-second clip can distract me from those problems.
A boring kitchen can't.
I Keep the First Bad Result
I used to delete bad generations almost immediately.
Now I keep the first one.
If the grocery bag disappears, for example, I save that version and make one small change to the next attempt.
Maybe I simplify the action.
Maybe I remove an unnecessary camera instruction.
Then I put the two versions next to each other.
This sounds obvious, but it stopped me from doing something I used to do all the time: changing five things at once and then having no idea why the next result was better.
Bad generations are useful when I can compare them.
Sometimes they tell me more than the good ones.
The Best Test Doesn't Need to Look Impressive
Launch demos are supposed to look impressive. That makes sense.
But when I'm deciding whether I can actually use a video model, I care about much smaller things.
Can an object stay where it belongs?
Can a simple action happen in the right order?
Can I change one instruction and understand what happened?
Can I repeat a result without rebuilding everything from scratch?
Those aren't exciting questions.
They're just the ones that start to matter when the demo ends and I actually want to make something.
So the next time I test a new video model, I'll probably skip the spaceship.
I'll make another cup of coffee instead.
- AI-инструменты 14 авгRay 3.2: Cloud AI Video Tool Built for Professional Visual Creators
Читать далееIf you work in previsualization, VFX, advertising or game CG, you’ve likely run into two frustrating limits with mainstream AI video tools: either they produce messy, unstable footage unsuitable for post-production, or they demand expensive high-end GPUs to render even short clips. After two months of hands-on testing for my studio’s pre-production pipeline, I found a balanced cloud-based solution that solves most of these workflow pain points: Ray 3.2, accessible at https://ray32.net/. Unlike consumer AI generators designed purely for casual social clips, this model is engineered around studio-grade production requirements, with a focus on controllability and cross-software compatibility.
The core strength that separates Ray 3.2 from competitors is its frame-level keyframe control system. Most AI video platforms only let you adjust global style prompts for an entire clip, leading to inconsistent lighting, jittery camera moves and distorted character faces mid-shot. Ray 3.2 allows up to sixteen independent keyframes on a single timeline, letting users tweak lighting intensity, camera speed, character gestures and environmental details at exact timestamps. This granular direction eliminates the randomness that ruins narrative clips, which is critical for filmmakers and concept artists who need precise shot prototypes to pitch storyboards. It also delivers stable multi-subject tracking, smoothly rendering up to eight human figures without common AI artifacts like warped limbs or blurred facial expressions.
Another game-changing feature for professional teams is its native 16-bit HDR generation and full 16-bit EXR export pipeline. Many rival tools add fake HDR filters on top of standard compressed MP4s, requiring hours of color correction to fix washed-out tones when imported into DaVinci Resolve or Nuke. Ray 3.2 generates true high dynamic range color from its core rendering engine and outputs EXR files following the ACES2065-1 industry color standard. These files drop directly into existing VFX workflows without format conversion, cutting prep time drastically for small studios operating on tight budgets and limited staff. All rendering happens remotely on cloud servers, so creators only need a basic laptop browser to generate 1080p footage, eliminating costly GPU upgrades.
Ray 3.2 unifies four complete creative workflows within one browser interface to avoid jumping between separate AI tools. The Text-to-Video module generates cinematic 5 or 10-second clips from detailed scene prompts and optional reference images, ideal for fast storyboard mockups. Image-to-Video animates static concept art, character portraits and illustration assets while preserving the original artwork’s aesthetic identity, perfect for game cutscene previews. Its flagship Video Edit workflow remasters existing uploaded footage—swapping environments, outfits or lighting—while fully locking in the original actor’s movement and timing, with support for source clips up to 20 seconds long. Finally, the Reframe tool intelligently adapts one master 16:9 shot to vertical 9:16, square 1:1 or ultra-wide 21:9 formats, filling empty frame space with scene-matched visuals instead of crude cropping for cross-platform marketing batches.
Beyond core generation tools, it packs eight advanced production utilities tailored to commercial and film work: motion transfer to reuse choreography across new scenes, full character transformation without breaking performances, seamless environment swaps, full-scene relighting, product replacement for multi-SKU ad variants, and campaign localization to generate region-specific footage from a single master clip. Developers and agency ops teams also gain access to a full open API, enabling integration into custom internal asset pipelines for automated bulk content creation.
In real-world practice, I’ve deployed Ray 3.2 for indie film previsualization, branded advertising batches, mobile game cutscene drafts and vertical social content for client brands. The credit-based pricing model uses one-time purchase packs with no recurring subscriptions, and unused credits never expire, which offers more flexibility than subscription-only AI platforms. While it has a slight learning curve for beginners unfamiliar with keyframe editing, the professional payoff far outweighs the small setup time investment.
For any creator tired of choosing between low-quality quick AI clips or hardware-heavy desktop render software, this cloud model delivers a balanced middle ground focused on real production utility. I’d love to hear feedback from other VFX, game design or advertising creators who have tested comparable cloud AI video solutions, and what workflow pain points they still struggle with.
- AI-инструменты 12 авгThe AI Video Skill I Think Matters More Than Writing Longer Prompts
Читать далееFor a long time, I assumed better AI videos required better prompts.
So I kept making my prompts longer. I added camera terminology, lighting details, movement descriptions, visual styles, and increasingly specific instructions.
Sometimes it helped.
But after working on more AI video projects, I started noticing something else: the biggest improvement often came before I wrote the prompt.
It came from learning how to communicate a visual idea clearly.
A Detailed Prompt Isn't Necessarily a Clear Prompt
It's tempting to treat prompting like a technical formula.
If the output isn't right, add more information. If the movement looks wrong, add another camera instruction. If the scene doesn't match your idea, describe everything in greater detail.
The problem is that more instructions can also introduce more opportunities for conflict.
I've gradually moved toward a simpler approach.
Before writing anything, I try to answer four questions:
- What is the main subject?
- What should actually happen?
- How should the camera observe it?
- What should the viewer feel?
If I can't answer those clearly, adding another 100 words probably won't fix the underlying idea.
References Are Becoming Part of the Language
Another change I've noticed is that prompts are no longer the only way to communicate with a video model.
Images can communicate composition and character appearance.
Video references can communicate motion.
Audio can communicate rhythm, dialogue, and timing.
That changes the creative process considerably. Instead of describing every visual detail in text, creators can increasingly divide instructions between different types of input.
This is one reason I've been paying attention to Seedance 2.5. I'm interested less in whether it can produce a prettier isolated demo and more in how newer multimodal video systems change the way we communicate creative intent.
SeedancePro's current Seedance workflow already emphasizes combining images, video clips, audio, and prompts rather than relying on text alone.
That feels like a more important direction than simply making prompts longer.
I Now Think in Shots Before Words
My current process often starts with a very rough shot description.
For example:
Subject: cyclist
Action: slowing down after reaching the top of a hill
Camera: slow tracking shot from behind
Mood: quiet, exhausted, early morningOnly after those decisions are clear do I turn them into a complete prompt.
This approach sounds almost too simple, but it prevents me from hiding a weak idea inside complicated prompt language.
It also makes iteration easier.
If the camera movement is wrong, I change the camera instruction.
If the atmosphere feels wrong, I change the mood or reference.
I don't have to rewrite an entire paragraph every time.
Prompting Is Starting to Look More Like Direction
This is probably the biggest change in how I think about AI video.
The useful skill isn't memorizing a collection of "magic words."
It's direction.
You need to decide what belongs in the frame, what changes during the shot, how the camera moves, and which information should come from text versus a reference asset.
Even earlier Seedance prompting guidance reflects this structure: subject, action, scene, camera language, style, and atmosphere are treated as distinct building blocks rather than one giant description.
That way of thinking is transferable.
A model will eventually be replaced by something newer. A prompt trick may stop working after an update.
Knowing how to break a visual idea into clear instructions is much more durable.
What I'm Practicing Now
So I've stopped trying to become exceptionally good at writing extremely long prompts.
Instead, I'm practicing how to describe motion simply, choose useful references, separate essential details from optional ones, and think about a video as a sequence of intentional shots.
The technology will keep changing.
The interface will change too.
But I suspect the creators who understand how to communicate visual intent clearly will adapt much faster than those who depend on a particular prompt formula.
Maybe the next important AI video skill isn't prompt engineering at all.
Maybe it's learning how to direct.
- AI-инструменты 11 авгWhy a Single AI-Generated Clip Never Tells You What You Need to Know
Читать далееThe Concept You Can't Actually Judge From One Take
Official MiniMax H3 product page preview used to illustrate the article workflow.
A marketer pitches a 10-second product teaser. A podcaster wants to test whether a short visual clip with synced sound could open an episode. A product team needs a quick mockup of what a feature announcement might feel like in motion. In each case, someone generates one AI video clip, watches it once, and decides whether the idea works.
That single-clip judgment is where most concept testing quietly breaks down. One clip tells you whether a model can render a plausible scene. It does not tell you whether the pacing holds up, whether the audio actually supports the visual, or whether the same prompt produces something usable on a second or third attempt.
Why One Generation Isn't Evidence
The failure mode is familiar to anyone who has tested generative tools for real work: variance. The same prompt run twice can produce a clip that nails the tone and another that misses it entirely — wrong pacing, audio that feels bolted on, a composition that doesn't match the brief. Treating the first result as representative is how teams end up either overselling a tool internally or dismissing it after one unlucky generation.
This matters more with audio in the mix. A video-only clip is easier to judge quickly — you can tell in a glance if the visual is off. Native audio adds a second axis of quality: does the sound design match the scene, is the mix balanced, does it read as intentional rather than generic. Reviewing that requires actually listening, not just glancing at a thumbnail.
A Testing Loop That Fits the Constraint
A more reliable way to evaluate a short-form generation tool is to build a small, repeatable loop instead of a single pass:
- Write one prompt with a clear scene, action, and intended audio cue.
- Generate more than one variation of the same prompt.
- Watch each clip with sound, not muted.
- Note where pacing, composition, or audio timing breaks down.
- Adjust the prompt once based on what failed, and regenerate.
This loop is slower than a single generation, but it's the only way to separate a tool's actual behavior from a lucky or unlucky roll. It also mirrors how creative teams already test other production tools — nobody signs off on a video edit or a voiceover take after watching it exactly once.
Where a Tool Like MiniMax H3 Fits
This is the kind of testing where a tool that combines video and audio generation in one step becomes useful — not because it replaces production judgment, but because it shortens the loop. According to the product page, MiniMax H3 (Hailuo 3.0) generates short clips, in the 5 to 15 second range, at up to 2K resolution and 24fps, with native stereo audio rather than a separate audio pass. The product page also describes support for mixing text, image, video, and audio references within a single prompt, which is relevant for testing a concept that depends on a specific visual style paired with a specific sound cue.
For someone running the loop above, that means fewer separate tools to juggle when checking whether an idea holds together audibly and visually at the same time. The product page also notes that failed or rejected generations are automatically refunded, which matters less for the creative outcome and more for the practical mechanics of running several test passes without worrying about wasted attempts.
What Actually Counts as a Good Test Clip
The review step is where most of the real judgment happens, and it's easy to skip. A clip passes a reasonable bar when the pacing matches the intended length, the audio timing lines up with the visual action rather than trailing or leading it, and the composition would survive being shown to someone outside the project without extra explanation. A clip fails that bar even if it looks polished, if the sound feels disconnected from the scene or the motion reads as generic filler rather than the specific idea being tested.
Running a few variations through that checklist, rather than trusting the first output, is what turns a demo into a usable signal. Teams that skip this step tend to either overcommit to a concept that only worked once, or drop a workable idea because the first attempt happened to miss.
The Takeaway
The real lesson isn't about any specific tool's output quality — it's about the discipline of testing more than once before drawing a conclusion. If you're evaluating a video-and-audio generation workflow for a campaign, a demo reel, or a product concept, build the small loop first. You can try the process directly at MiniMax H3, but the loop itself is what will tell you whether the concept — and the tool — actually holds up.
- AI-инструменты 10 авгWhy Visual Alignment Breaks Down Before a Single Image Gets Approved
Читать далееThe Real Bottleneck Isn't Generation, It's Agreement
Official Qwen Image 3.0 product page preview used to illustrate the visual review workflow.
Most creative teams don't lose time making an image. They lose time deciding which image is right. A designer gets a brief, produces three directions, and by the time stakeholders weigh in, half the feedback contradicts the other half. The brief said "clean and modern." One reviewer reads that as minimal typography. Another reads it as bold color blocking. Neither is wrong, but now there are two production paths and one deadline.
This is a coordination problem, not a tooling problem, but tooling can make the coordination problem worse or better depending on how fast and how cheaply you can produce comparable options. If generating a new direction costs an hour, teams anchor on the first idea that's good enough. If it costs a few minutes, teams can actually compare.
Building a Checklist Instead of Chasing a Perfect First Draft
The fix that has worked reasonably well on smaller teams isn't a better brief template. It's a checklist that treats the first generation pass as disposable input, not a deliverable.
A workable sequence looks like this:
- Translate the brief into three distinct visual hypotheses, not three variations of the same idea. If the brief allows for "editorial" or "playful," generate one image that leans hard into each interpretation instead of hedging in the middle.
- Fix constraints before generating, including aspect ratio, whether the image needs legible on-image text, and where it will actually be placed (hero banner, social tile, product card). Changing these after the fact usually means starting over.
- Generate all three in the same session so lighting, composition style, and prompt phrasing stay comparable. Comparing images made a day apart under different moods is a common source of confused feedback.
- Route feedback against the hypothesis, not the pixel. Ask reviewers which direction fits the brand tone, not whether they like a specific shadow or color.
- Edit the surviving direction in place rather than regenerating from scratch, so the parts that already worked don't get lost.
None of this requires exotic tooling. It requires discipline about not skipping step 2, which is the step everyone skips under deadline pressure.
A Concrete Pass Through the Checklist
Say a product team needs a hero image for a feature launch page, and the brief says "trustworthy, not corporate." That phrase alone will produce three different images from three different people.
Running the checklist: aspect ratio is fixed at a wide banner because that's where it ships. No on-image text is required, since headline copy will overlay separately in the page layout. Three hypotheses get generated in one sitting: a realistic photo-style scene of people using the product, a softer illustrated abstract composition, and a middle-ground option with a real environment but muted, non-corporate color grading.
This is where a tool that can generate realistic imagery, handle different aspect ratios, and support editing on the same output matters practically rather than as a feature bullet. According to the product page, Qwen Image 3.0 is positioned around generating realistic images with clear text rendering, flexible sizing, and image editing available from the same preview, which fits a workflow where you need comparable outputs quickly rather than one polished result after several isolated attempts.
The Review Step Where Most Teams Skip a Beat
The review step is where the checklist earns its keep or falls apart. If reviewers see three images without context, they'll default to personal taste. Attach a one-line rationale to each direction before sharing it: what interpretation of the brief it represents, and what tradeoff it makes. This turns "I like the third one" into "the third one balances trust and approachability better than the photo-real option, which read as too generic." That distinction is what actually moves a project forward instead of triggering another round of ungrounded opinions.
One limitation worth naming: this checklist assumes the brief itself is stable. If stakeholders are still disagreeing on strategy, no amount of fast image generation will resolve that upstream ambiguity, and running more directions just produces more noise.
Where This Leaves the Workflow
Speed in generating options is only useful if the review process is structured enough to use that speed well. A checklist like this doesn't replace judgment, it just removes the friction that used to make teams settle for the first passable idea. If you're evaluating tools for this kind of comparative workflow, it's worth looking at how they handle realistic output, sizing flexibility, and in-place editing together, since those three factors determine whether iterating on a surviving direction is fast or another bottleneck. You can see how this is described on the Qwen Image 3.0 product page.
- AI-инструменты 8 авгShort-Form Video Feels Like a Grind. Maybe the Fix Isn’t “Edit Harder.”
Читать далееYou spend a night scrolling competitor accounts, bookmark every “viral template,” then sit down at your desk with the same question:
What do I post today—and how do I make it look like it actually belongs on the For You page?
Content work has a built-in contradiction: platforms want volume, audiences want quality and originality, and most teams only have the budget and headcount for “we’ll do it ourselves.”
You already know the tools. You know the jargon. Still, between idea and finished cut, there are storyboards, scripts, voiceover, assets, captions, and endless revisions.
So people hop from tool to tool—one site for images, another for video, a third for voice, another for editing.
More tools. More tabs. Less actual creating.
Content Is Shifting From Craft Alone to Systems
The old default pipeline looks like this:
Idea → script → shoot or source footage → voiceover → edit → captions → color → export
Every step needs a human. Every step can slip the schedule.
E-commerce teams need steady output. Creators need consistency. Brands need speed without looking cheap. Throwing more hours at the problem stops scaling.
AI doesn’t replace taste. It pulls creators out of repetitive execution so they can focus on what still matters most: judgment, brand, strategy, and final approval.
When what you really need is “from one sentence / one product / one reference video → publishable draft,” you don’t need another disconnected plugin.
You need a workspace that runs the full chain.
What If One Prompt Could Become a Full Video?
The ideal flow is simple:
You clarify the product, the angle, and the style
The system interprets intent, plans scenes, generates visuals and narration, and handles captions and pacing
You choose, refine, and ship—instead of rebuilding every shot from zero
That’s why more teams are trying AI Video Agents: not “one more generator,” but a production workflow that behaves more like a director’s assistant than a pile of menus.
If you want that “give direction, get a cut” experience in one place, take a look at CreatView. It brings together a Video Agent, viral-style remakes, text/image-to-video, digital humans, audio, and related creative tools in a single environment built for films & ads and social video.
Official site: https://creatview.ai/
Three Groups Feel the Difference Immediately
- E-commerce & brand operators
New SKUs, launches, lifestyle shots, daily short video.
The pain usually isn’t “we can’t make content”—it’s we can’t make enough.
AI-assisted product demos, pain-point stories, before/after cuts, unboxings, and try-ons turn “a few posts a week” into a more reliable content pipeline.
- Creators & content teams
Cadence and iteration decide who survives.
Instead of perfecting one edit for days, generate several versions fast, then put human effort only on the strongest cut.
Volume creates optionality—and optionality often beats a single overworked masterpiece.
- Solo creators & side projects
You’re the writer, camera, editor, and VO booth.
If a platform can carry you from idea to draft film, you can spend energy on personality, point of view, and community—the parts algorithms can’t copy for you.
“Viral” Isn’t Magic. It’s Structure You Can Reuse.
“Viral remake” gets a bad reputation when people hear “copy-paste.”
The useful version is different:
Break down hooks, pacing, shot language, and narrative structure
Keep what works
Swap the subject, scene, script, product, and persona
Generate a new piece that feels proven—without becoming a clone
That’s often more reliable than staring at a blank timeline, and cleaner than hard-copying someone else’s post.
Fewer Tools. More Finished Pieces.
In the second half of the content race, winning rarely means “knowing one NLE better than everyone else.” It means:
Can you ship consistently?
Can you test ideas on a shorter cycle?
Can your team stop drowning in production chores and focus on strategy?
AI creative platforms are becoming infrastructure—not a novelty you open once a month, but a line that runs every week.
If you’re stuck at “good idea, slow output,” open CreatView and try one real brief: a one-line concept, a product URL, or a reference video. See whether it can absorb the middle stretch of busywork between intent and draft.
From idea to cut—with fewer detours.
Website: https://creatview.ai/
- AI-инструменты 6 авгWhy AI Video Creators Should Stop Comparing Models All the Time
Читать далееOver the past year, almost every discussion about AI video has followed the same pattern.
A new model is released.
People immediately compare benchmark videos, rendering quality, motion consistency, and generation speed.
A few days later, another model appears, and the comparison starts all over again.
I used to follow these discussions closely because I thought choosing the "best" model would automatically improve my work.
Eventually, I realized that wasn't true.
Every Model Solves a Different Problem
One mistake I made early on was expecting a single AI model to perform perfectly in every situation.
In reality, each model has its own strengths.
Some are better for cinematic movement.
Some focus on speed.
Others produce stronger visual consistency or offer more control over references and editing.
Trying to rank them from best to worst often misses the point.
The more useful question is:
Which model fits this specific project?
That simple shift changed how I evaluate new AI tools.
Comparing Workflows Instead of Benchmarks
Now, when I see a new AI video release, I don't immediately ask whether it's better than everything else.
Instead, I ask different questions.
Will it reduce editing time?
Can it simplify scene planning?
Does it improve consistency across longer videos?
Will it fit naturally into an existing production process?
These questions usually provide more useful answers than another side-by-side benchmark.
Why Seedance 2.5 Is Interesting
That's one reason I've been following Seedance 2.5.
Based on the information that has been shared publicly so far, the discussion isn't only about image quality. It's increasingly about supporting richer creative workflows through multimodal inputs, longer native video generation, and more flexible editing capabilities.
Whether those improvements ultimately become the deciding factor depends on how well they fit real production needs.
For creators, that may be a more meaningful measure than simply asking which model looks slightly better in a short demo.
Better Questions Lead to Better Creative Decisions
Looking back, I think I spent too much time searching for the "perfect" AI model.
Now I spend more time improving my creative process.
That means building stronger references, writing clearer prompts, documenting successful experiments, and understanding which tools work best for different types of projects.
Ironically, those habits have improved my results far more than constantly switching to whatever model is trending.
Final Thoughts
AI video technology is evolving at an incredible pace, and comparisons will always be part of the conversation.
But comparison alone doesn't make anyone a better creator.
Understanding where a tool fits, when to use it, and how to build an efficient workflow around it is far more valuable in the long run.
For me, that's why following the development of Seedance 2.5 is interesting—not because I'm looking for a universal winner, but because each new generation helps redefine what's possible in AI-assisted video creation.
- AI-инструменты 6 авгWhat Changed My Mind About AI Video Creation Before Seedance 2.5
Читать далееThe conversation around AI video models usually starts with benchmarks.
People compare generation quality, motion consistency, rendering speed, and the latest demo videos. Those comparisons are useful, but over time I realized they weren't changing the way I actually worked.
What changed my workflow wasn't a better benchmark.
It was changing how I prepared projects before generating the first frame.
Better Inputs Usually Matter More Than Better Models
When I first started experimenting with AI video generation, I spent most of my time looking for the newest model.
Eventually I noticed something interesting.
The projects that produced the best results didn't necessarily use the newest technology. They usually had better preparation.
A clear storyboard.
Consistent reference images.
Well-structured prompts.
Simple scene descriptions.
These inputs often had a greater influence on the final video than switching between different models.
Preparing Before You Generate
Now, before opening any AI video tool, I usually prepare several things first:
- A short script with clear scene transitions.
- Character reference images that stay consistent across scenes.
- Notes describing camera movement and composition.
- A small prompt library that I can reuse instead of rewriting everything.
This preparation doesn't eliminate experimentation, but it makes each iteration much more productive.
Why I'm Following Seedance 2.5
One reason I've been paying attention to Seedance 2.5 is that the publicly available information suggests continued improvements in multimodal input and production workflows.
Instead of thinking about AI video as "type a prompt and wait," the direction seems to encourage creators to combine text, reference images, and other creative assets into a more structured production process.
That aligns closely with the way I already prefer to work.
Workflow Beats Hype
Every major AI release creates excitement.
Some of that excitement is justified.
But after trying different creative tools over the past year, I think the biggest improvement rarely comes from installing something new.
It comes from improving the workflow around it.
Better planning.
Better references.
Better organization.
Those habits continue to pay off regardless of which model becomes the most popular next month.
Final Thoughts
Technology will continue to evolve, and AI video generation will almost certainly become more capable over time.
What probably won't change is the importance of preparation.
The more organized your creative process is today, the easier it becomes to explore tomorrow's tools.
That's one of the main reasons I'm following Seedance 2.5—not because I expect it to solve every creative challenge, but because it represents another step toward more complete AI-assisted video production.
- AI-инструменты 4 авгWhy I Started Organizing My AI Video Workflow Around Seedance
Читать далееAI video generation is moving faster than most creators can follow.
Every month, there are new models, new demos, and new creative possibilities. At first, I tried to keep track of everything by saving links, screenshots, and interesting examples.
But after a while, I noticed a problem.
The challenge was not finding new AI video tools.
The challenge was building a repeatable workflow.
Too Many Tools, Not Enough Structure
When people talk about AI video creation, conversations often focus on the final result.
A cinematic clip.
A realistic character.
A creative animation.
However, the final output usually depends on many small decisions before generation starts:
- How references are prepared
- How prompts are structured
- How scenes are planned
- How visual consistency is maintained
- How different versions are compared
Without a workflow, creators often spend more time experimenting than actually creating.
That was the reason I started organizing my own AI video process.
From Collecting Tools to Building a Workflow
Initially, I simply wanted to understand how different AI video models worked.
I collected:
- model updates
- prompt examples
- creative workflows
- generation tips
- community experiments
But eventually, I realized that a collection of random information was not enough.
The information needed structure.
A useful resource should help answer practical questions:
What should I prepare before creating a video?
How should I organize references?
How can I improve consistency between scenes?
How do different models fit different creative goals?
Creating a More Organized Seedance Workflow
While researching different AI video solutions, I started paying closer attention to Seedance because it represents a shift from simple text-to-video generation toward more flexible creative workflows.
Modern AI video tools are increasingly combining multiple inputs, including text, images, audio, and video references, allowing creators to control more parts of the production process.
To make my research easier, I created a dedicated Seedance AI Video Generator resource page where I can organize information about Seedance models, workflow ideas, tutorials, and creative examples.
The goal is not just collecting another tool link.
It is creating a place where the learning process becomes easier.
What I Learned From Building This Resource
One important lesson is that AI tools change quickly, but good workflows remain useful.
A new model may improve generation quality, but creators still need:
- better ideas
- clearer prompts
- stronger references
- better planning
The difference between a random AI clip and a meaningful video project usually comes from the creative process behind it.
Another lesson is that documentation matters.
When experimenting with AI tools, small discoveries are easy to forget. Saving successful prompts, useful techniques, and workflow improvements creates a personal knowledge base that becomes more valuable over time.
Looking Forward
AI video creation is still developing.
New models will continue to appear, and existing platforms will keep improving. Instead of chasing every new release, I believe creators will benefit more from building flexible workflows that can adapt to new technologies.
For me, organizing Seedance-related resources is part of that process.
The technology will keep changing, but the ability to learn, organize, and create efficiently will remain valuable.
- AI-инструменты 21 июльWhy I'm Preparing for Seedance 2.5 Before It Officially Arrives
Читать далееEvery major AI video release creates the same cycle.
New benchmark screenshots appear on social media, creators rush to test the latest model, and everyone starts comparing results before understanding what actually changed.
I've been through this process several times, and eventually realized that preparing my workflow is far more valuable than waiting for launch day.
That's exactly why I've started organizing everything I know about Seedance 2.5 before it becomes part of my daily creative workflow.
The Real Challenge Isn't Learning a New Model
Learning a new interface usually takes only a few minutes.
The difficult part is rebuilding an efficient workflow around it.
Every new generation of AI video models introduces new capabilities, different prompt behaviors, improved motion control, or better editing options. If your references, prompts, and production process aren't organized, those improvements don't automatically make your projects better.
Instead, they often create more experimentation and more confusion.
That's why I now spend more time preparing than reacting.
Building Resources Before Release
Rather than collecting random links in bookmarks, I began organizing announcements, workflow ideas, prompt examples, and technical notes into one place that I can update continuously.
While doing that, I created a dedicated Seedance 2.5 page where I can keep release information, feature summaries, tutorials, and workflow references together.
The goal isn't to predict every feature.
It's simply to avoid searching dozens of different websites every time new information appears.
Why Organization Matters More Than Hype
I've noticed that many creators spend most of their time discussing benchmark videos instead of improving their production process.
In practice, a good workflow usually includes:
- organized reference images
- reusable prompt templates
- storyboard planning
- camera movement ideas
- version tracking
- consistent asset management
These habits remain valuable regardless of which AI model becomes the newest favorite.
Technology changes quickly.
A well-organized workflow lasts much longer.
Looking Beyond One Model
I'm excited about what Seedance 2.5 may bring, but I'm even more interested in how it fits into the broader AI video ecosystem.
No single model solves every creative problem.
Some projects require faster iteration.
Others need better consistency, stronger motion control, or more flexible editing.
Having structured documentation makes it much easier to compare tools objectively instead of relying only on first impressions.
Final Thoughts
Preparing before a new release has become one of the best habits in my creative process.
Instead of waiting for launch day and starting from scratch, I'd rather build a workflow that can immediately adapt when new capabilities become available.
Whether Seedance 2.5 becomes my primary production tool or simply another option in my workflow, the time spent organizing knowledge today will continue to pay off long after the excitement around the release fades.
- AI-инструменты 16 июльWhy I Built a Resource Hub for Kling 3.0 Instead of Waiting for More AI Video News
Читать далееOver the past year, AI video generation has evolved at an incredible pace. Every few weeks, a new model appears, benchmark results are shared across social media, and countless tutorials promise the "perfect workflow." At first, I tried to keep up simply by bookmarking useful pages, but it quickly became clear that this approach wasn't sustainable.
The biggest challenge wasn't a lack of information. It was the opposite. Valuable resources were scattered across official announcements, developer discussions, community forums, YouTube demonstrations, and personal blogs. Whenever I wanted to revisit a feature comparison or find an example prompt, I often had to search for it all over again.
Instead of continuing to collect random bookmarks, I decided to organize everything into one structured resource that I could update over time.
Information Is More Difficult to Manage Than the Tools Themselves
Many people assume that using AI video models is the hardest part. From my experience, the real challenge is organizing the growing amount of information around them.
For almost every new release, there are:
- Feature announcements
- Workflow discussions
- Prompt examples
- Community experiments
- Comparison articles
- Performance observations
Without a clear system, useful knowledge disappears surprisingly fast.
That's why I stopped focusing only on new releases and started building my own reference library instead.
Building a Personal Knowledge Base
Rather than creating another promotional website, my goal was to make it easier for myself to track updates and revisit useful resources.
While organizing everything, I created a dedicated Kling 3.0 resource page where I can collect release news, feature summaries, workflow ideas, prompt references, and learning materials in a single place.
The project continues to evolve whenever new information becomes available, making it much easier to compare updates without searching dozens of different websites again.
What I Learned During the Process
Creating a resource hub taught me several lessons that apply far beyond AI video generation.
First, documentation becomes more valuable than temporary hype. Exciting announcements come and go, but well-organized information remains useful months later.
Second, workflows matter more than individual features. Most creators eventually develop a repeatable process involving reference images, scripts, prompts, editing, and iteration. Good organization improves that process far more than constantly switching between tools.
Finally, consistency saves time. Having one place to store notes, examples, and references means I spend more time creating and less time searching.
Why I'll Keep Maintaining It
AI video technology is still changing rapidly. New models will continue to appear, existing ones will improve, and workflows will become more sophisticated.
Rather than chasing every announcement individually, I'd rather maintain a structured collection that grows alongside the ecosystem. It helps me stay organized, compare developments more objectively, and prepare for future creative projects without starting from scratch every time.
For me, building a resource hub has become just as valuable as experimenting with the models themselves.
If you're following the rapid progress of AI video generation, creating your own organized knowledge base might be one of the most useful long-term investments you can make.
- Генеративные нейросети 10 июльPixly в Телеграм: единый агрегатор всех нейросетей для генерации фото и видео с помощью ИИ (AI)
Читать далееPixly в Телеграм: единый агрегатор всех нейросетей для генерации фото и видео с помощью ИИ (AI)
В мире, где искусственный интеллект развивается с невероятной скоростью, отслеживать все новинки и уметь пользоваться каждой нейросетью становится все сложнее. Особенно это касается генерации изображений и видео: каждый месяц появляются новые модели, которые обещают лучший результат, но требуют отдельной регистрации, изучения интерфейса и, чаще всего, оплаты. Решением этой проблемы стали боты-агрегаторы, и Telegram-бот Pixly – один из самых интересных представителей этого класса. Он позиционирует себя как единая точка входа во все самые популярные и передовые нейросети для генерации визуального контента. По своей концепции он схож с идеей «единого шлюза», описанной в научных работах по разработке многофункциональных ботов для доступа к AI-сервисам .
Что такое Pixly?
Pixly — это не просто бот, который умеет генерировать картинки. Это универсальный генеративный агрегатор, который собирает под капотом десятки различных нейросетевых моделей. Вместо того чтобы держать открытыми вкладки с Midjourney, Stable Diffusion, DALL-E и другими сервисами, вы просто открываете диалог с Pixly в Telegram и выбираете нужную модель. Бот берет на себя все технические сложности: интеграцию с API, обработку платежей за генерации и управление контекстом . Администраторы таких сервисов могут динамически добавлять новые модели без вмешательства в код, что делает бота невероятно гибким инструментом .
Какие нейросети доступны в Pixly?
На момент написания статьи бот предлагает широкий спектр моделей, охватывающих как изображения, так и видео. Среди них есть как проверенные флагманы, так и новейшие разработки, имена которых можно встретить в актуальных списках обновлений AI-платформ :
Популярные модели для генерации изображений:
- GPT Image 2 и GPT Image 1.5 — модели от OpenAI, известные своим пониманием сложных промптов и высоким качеством детализации .
- Grok 4.2 Image, Grok Imagine Image, Grok Imagine Image Pro — семейство моделей от xAI, которые славятся креативностью и нестандартным подходом к генерации.
- Seedream 5.0 и Seedream 4.5 — мощные модели от китайской компании ByteDance, продемонстрировавшие впечатляющие результаты в качестве и реалистичности .
- Z-Image Turbo — модель, ориентированная на высокую скорость генерации .
Модели для генерации видео:
- Kling V3, Kling V3 Omni, Kling Image O1 — это флагманские модели от Kuaishou Technology, которые считаются одними из лучших на рынке генерации видео по текстовому описанию. В списке обновлений платформ можно встретить постоянное обновление линейки Kling, что говорит о ее высокой популярности и развитии .
Также стоит отметить, что, по данным из открытых источников, в подобных агрегаторах со временем отказываются от устаревших версий моделей (например, Kling V1/V1.5/V2) в пользу более новых, чтобы пользователи всегда получали лучший результат .
Как использовать Pixly?
Интерфейс бота интуитивно понятен. Взаимодействие строится через кнопки и текстовые команды, что очень удобно для пользователей, не знакомых с программированием.
- Выбор модели. Бот, скорее всего, предоставляет меню, где можно выбрать модель в зависимости от задачи. Например, для быстрых и простых запросов подойдет Z-Image Turbo, а для сложных видео — Kling V3 Omni.
- Написание промпта. Вы отправляете текстовое описание того, что хотите получить. Поддерживаются как простые запросы, так и сложные, многострочные промпты с детальным описанием сцен, стилей и персонажей .
- Генерация. Бот отправляет запрос в выбранную нейросеть и возвращает готовый результат (изображение или видео) прямо в чат.
Преимущества и недостатки
Плюсы:
- Универсальность. Один бот заменяет десятки сервисов и подписок.
- Экономия времени. Не нужно искать, где и как попробовать ту или иную новую нейросеть.
- Простота. Все управление происходит в привычном интерфейсе Telegram.
- Актуальность. Администраторы добавляют самые свежие модели, как только они становятся доступны .
Минусы:
- Оплата. Генерация в популярных моделях требует определенных затрат, так как использование официальных API платное. У ботов-агрегаторов обычно своя система внутренней валюты или кредитов.
- Зависимость от бота. Качество и стабильность работы зависят не только от нейросети, но и от серверов самого агрегатора.
Заключение
Pixly — это яркий пример того, как технологии ИИ становятся доступнее. Вместо того чтобы гоняться за каждой новой моделью, вы можете довериться агрегатору, который соберет все лучшее в одном месте. Такой подход, когда администратор может гибко управлять пулом доступных моделей прямо из интерфейса, делает сервис мощным и легко масштабируемым инструментом для всех, кто увлекается созданием контента с помощью нейросетей . Если вы активно генерируете изображения и видео и хотите иметь доступ к самым разным инструментам, не выходя из Telegram, Pixly — определенно стоит вашего внимания.
- AI-инструменты 4 июльSeedance 2.5: полный обзор облачной платформы для кинематографической генерации видео 4K на seedance25.tech
Читать далееВ последние годы рынок цифрового контента переживает настоящую революцию, вызванную стремительным развитием генеративного искусственного интеллекта. Если раньше создание качественного видео с кинематографической картинкой требовало дорогой профессиональной техники, команды специалистов и недель кропотливой работы, то сегодня инструменты на основе ИИ позволяют превратить текстовое описание или статическое изображение в полноценный динамический ролик за считанные минуты. Однако большинство существующих решений имеют существенные ограничения: одни выдают результат только в низком разрешении с заметными артефактами, другие требуют мощного локального компьютера с топовой видеокартой, третьи заставляют пользователей переключаться между десятками сервисов для доступа к разным моделям и стилям.
Именно на фоне этих недостатков появляется Seedance 2.5 — новое поколение облачной платформы для генерации кинематографического видео, доступное по адресу seedance25.tech. Этот сервис сочетает в себе профессиональное качество вывода, максимальную простоту использования и выгодные условия для ранних пользователей, стирая грань между любительским и студийным видеопроизводством. В данном обзоре мы подробно разберём, что представляет собой Seedance 2.5, какие функции он предлагает, чем отличается от конкурентов и кому будет полезен в первую очередь.
Что такое Seedance 2.5?
Seedance 2.5 — это облачная платформа генерации видео на основе передовых оптимизированных диффузионных моделей ИИ, разработанная для креаторов, маркетологов, независимых режиссеров, дизайнеров и всех, кто нуждается в быстром получении качественного видеоконтента. В отличие от многих локальных решений, которые требуют установки сложного ПО и мощного железа, сервис работает полностью в браузере: пользователю не нужно скачивать программы, обновлять драйверы, покупать дорогостоящее оборудование или разбираться в тонких технических настройках. Достаточно открыть сайт seedance25.tech, зарегистрироваться и сразу приступить к созданию видео.
Основная идея платформы — сделать кинематографическое качество видеопроизводства доступным каждому, независимо от технических навыков и размера бюджета. Seedance 2.5 принимает на вход детальные текстовые промпты и референсные изображения, после чего генерирует плавные динамические ролики с естественным движением объектов, кинематографическим освещением и продуманной композицией сцены. Максимальное разрешение вывода достигает нативного 4K UHD, что позволяет использовать готовые работы не только в социальных сетях, но и в профессиональных проектах — от рекламных кампаний до превизуализации полнометражных фильмов.
Особенностью платформы является унифицированный доступ к нескольким моделям ИИ в рамках одного интерфейса. Пользователям не нужно оформлять отдельные подписки на разные сервисы, чтобы получить стилизованный аниме-ролик, реалистичную бытовую сцену или футуристический концепт-арт. В Seedance 2.5 достаточно выбрать подходящую модель под конкретную задачу и запустить генерацию в несколько кликов. Это значительно упрощает рабочий процесс и снижает общие затраты на инструменты для креатива.
Ключевые функции платформы Seedance 2.5
Разработчики уделили особое внимание тому, чтобы платформа закрывала основные потребности как начинающих авторов, так и опытных профессионалов. Рассмотрим основные функции, доступные пользователям на seedance25.tech.
- Генерация видео по тексту и изображению
Основная функция платформы — преобразование текстовых описаний и статических картинок в полноценное видео. Текстовый промпт позволяет детально описать сцену: персонажей, окружение, стиль освещения, ракурс камеры, динамику движения и общую атмосферу. Чем точнее составлено описание, тем ближе результат к задумке автора.
Если у пользователя есть готовое изображение — например, иллюстрация, концепт-арт, фотография или даже эскиз — его можно загрузить как визуальный референс. ИИ сохранит композицию кадра, цветовую палитру и основные детали исходника, добавив естественное плавное движение. Эта функция особенно ценна для дизайнеров и иллюстраторов, которые хотят оживить свои статические работы.
В отличие от многих простых массовых сервисов, Seedance 2.5 уделяет особое внимание кинематографичности результата. Алгоритмы платформы обучены с учётом законов киноосвещения, цветокоррекции и композиции кадра, поэтому готовые ролики выглядят как работа профессиональной съёмочной группы, а не как типичный результат генерации ИИ с искажёнными лицами и неестественными движениями.
- Разрешение вывода от 1080p Full HD до 4K UHD
Одно из главных преимуществ Seedance 2.5 перед большинством конкурентов — нативный вывод видео в разрешении до 4K UHD без использования искусственного цифрового увеличения. Многие существующие сервисы генерируют контент в 720p или максимум 1080p, а более высокое разрешение достигается за счёт встроенного апскейлинга, который не добавляет реальной детализации и часто портит чёткость мелких объектов.
В Seedance 2.5 пользователь может гибко выбрать подходящее разрешение под свою задачу:
1080p Full HD — оптимальный вариант для социальных сетей, коротких вертикальных роликов, презентаций и внутренних корпоративных материалов;
2K — для рекламных баннеров, динамических сторибордов и средних по длительности творческих проектов;
4K UHD — для профессионального использования, телевизионной рекламы, превизуализации фильмов и проектов, где важна максимальная чёткость деталей.
Такая гибкость позволяет использовать платформу как для быстрого создания контента под TikTok или YouTube Shorts, так и для решения сложных производственных задач, где качество картинки выходит на первый план.
- Единый доступ к нескольким моделям ИИ
Ещё одна важная особенность Seedance 2.5 — мультимодельность в рамках одного аккаунта и одной подписки. Сегодня на рынке существует десятки генеративных видеомоделей, и каждая лучше всего справляется со своим классом задач: одни идеально генерируют реалистичных людей и природные пейзажи, другие подходят для стилизованной 2D-графики и анимации, третьи хорошо работают с архитектурой и футуристичными научными концепциями.
В большинстве случаев для доступа к разным моделям приходится регистрироваться в 3–5 сервисах одновременно, платить отдельные подписки и привыкать к разным интерфейсам и логике работы. Seedance 2.5 решает эту проблему: все проверенные, хорошо зарекомендовавшие себя модели собраны в едином рабочем пространстве, и пользователь может переключаться между ними в один клик, подбирая идеальный вариант под каждый конкретный проект.
- Нулевая настройка и полностью облачная работа
Многие продвинутые инструменты для генерации видео требуют установки на локальный компьютер, мощной видеокарты уровня RTX 4090 и выше, а также регулярной ручной настройки моделей и обновлений. Для обычного пользователя это становится непреодолимым барьером: оборудование стоит десятки тысяч рублей, а разобраться в настройках без технического опыта практически невозможно.
Seedance 2.5 работает полностью на облачных мощностях. Всё, что нужно пользователю — это любой современный браузер и стабильный доступ в интернет. Никаких скачиваний, установок, обновлений и ручных настроек не требуется. Достаточно перейти на seedance25.tech, авторизоваться и сразу начать работать. Все вычисления происходят на серверах платформы, поэтому скорость генерации не зависит от характеристик вашего компьютера, ноутбука или даже планшета.
- Оптимизированный рабочий процесс для креаторов
Разработчики Seedance 2.5 проектировали интерфейс с учётом потребностей тех, кто создаёт контент регулярно и ценит своё время. Платформа предлагает интуитивно понятную структуру разделов, встроенные инструменты для улучшения промптов, удобную историю генераций и быстрый экспорт готовых работ в популярных форматах.
Пользователи могут сохранять удачные промпты и наборы настроек, повторно использовать референсные изображения и сравнивать результаты разных моделей бок о бок. Это позволяет значительно ускорить итерации: если раньше на подбор идеального стиля и сюжета уходили часы проб и ошибок, то в Seedance 2.5 это можно сделать за несколько минут.
Технологические преимущества Seedance 2.5
За удобным интерфейсом и простым входом стоят сложные технологические решения, которые позволяют платформе выдавать высокое качество при хорошей скорости генерации и стабильной работе даже при большой нагрузке.
Прежде всего, это тщательно оптимизированные диффузионные модели, дообученные на большом массиве кинематографического контента. Благодаря этому ИИ не просто генерирует случайные изображения в динамике, а строит сцену по законам визуального повествования: выдерживает глубину резкости, правильно расставляет световые акценты, подбирает цветовую палитру под настроение сцены и обеспечивает плавность движений без резких скачков и типичных для ИИ артефактов.
Вторая важная составляющая — распределённая облачная инфраструктура высокой мощности. Seedance 2.5 использует производительные серверные графические ускорители, которые обеспечивают быструю генерацию даже в максимальном разрешении 4K. Пользователи не сталкиваются с многочасовыми очередями или зависаниями, характерными для многих перегруженных массовых сервисов. Облачная архитектура также позволяет плавно масштабировать мощности под растущую аудиторию, сохраняя стабильную работу в любое время суток.
Отдельно стоит отметить работу над стабильностью генерации. Одна из главных проблем современных ИИ-видеогенераторов — мерцание кадра, искажение объектов при движении и потеря сходства с референсом на протяжении ролика. Команда Seedance 2.5 реализовала дополнительные алгоритмы постобработки, которые сглаживают переходы между кадрами, сохраняют целостность объектов и повышают общую целостность ролика. В результате пользователи получают чистый, плавный видео, который практически не требует дополнительной доработки в сторонних видеоредакторах.
Для кого подходит платформа Seedance 2.5?
Гибкость функционала, несколько вариантов разрешения и широкий набор моделей делают Seedance 2.5 универсальным инструментом для широкого круга пользователей. Рассмотрим основные сценарии использования и целевые аудитории сервиса с seedance25.tech.
Контент-креаторы и блогеры
Для авторов социальных сетей, TikTok, YouTube Shorts, Instagram Reels скорость выхода контента часто играет решающую роль. С Seedance 2.5 можно генерировать визуальные эффекты, динамические фоновые сцены, обложки и даже полноценные короткие ролики за несколько минут, без организации съёмок и долгого монтажа. Это позволяет чаще выпускать материалы, экспериментировать со стилями и экономить на аренде студий и профессиональном оборудовании.
Маркетологи и специалисты по брендингу
Рекламные отделы и креативные агентства постоянно нуждаются в большом объёме видеоматериалов для кампаний в соцсетях, на сайтах и наружной рекламе. Seedance 2.5 позволяет быстро визуализировать любые креативные идеи, создавать несколько вариантов роликов для А/Б тестирования и адаптировать контент под разные платформы и форматы. Вместо того чтобы согласовывать съёмку за несколько недель и тратить десятки тысяч рублей, можно получить готовый вариант за час и сразу запустить в работу.
Независимые режиссеры и сторибордисты
На этапе превизуализации фильма или рекламного ролика важно быстро показать заказчику, как будет выглядеть сцена в динамике, как будет двигаться камера и как ляжет свет. С Seedance 2.5 можно превратить текстовое описание сцены или статический сториборд в полноценный динамический набросок, оценить ракурсы и общую атмосферу. Это значительно сокращает время на согласование и позволяет внести правки на раннем этапе, не тратя бюджет на дорогостоящие пересъёмки.
Дизайнеры, иллюстраторы и концепт-художники
Для специалистов по визуальному контенту Seedance 2.5 открывает возможность расширить перечень услуг и повысить средний чек: статические иллюстрации и концепты можно превратить в короткие анимированные ролики, оживить портфолио и предложить клиентам более дорогие комплексные решения. Достаточно загрузить готовую работу как референс, задать нужную динамику — и на выходе получается готовый видеоматериал высочайшего качества.
Образовательные учреждения и корпоративные отделы обучения
В обучении наглядность играет ключевую роль. С помощью Seedance 2.5 можно быстро создавать обучающие ролики, визуализировать сложные технические процессы, исторические события и научные концепции, которые сложно показать на статичных фото или схемах. При этом стоимость создания такого контента получается в разы ниже, чем при заказе в специализированной студии.
Конкурентные преимущества Seedance 2.5
На рынке генерации видео ИИ сегодня работает много сервисов разного уровня, но Seedance 2.5 занимает свою уникальную нишу, сочетая несколько важных преимуществ сразу, которые не встретишь в одном месте у конкурентов.
Прежде всего, это соотношение качества и разрешения. Многие массовые сервисы предлагают генерацию в 720p или 1080p, а 4K остаётся либо за очень высокую дополнительную плату, либо реализован через программный апскейлинг без реальной детализации. В Seedance 2.5 нативный 4K доступен уже в базовой подписке для участников программы основателей.
Во-вторых, это полное отсутствие требований к пользовательскому оборудованию. Локальные решения для генерации видео показывают хорошее качество, но требуют вложений в мощный ПК на сумму от нескольких тысяч долларов. Для большинства пользователей это неоправданные расходы, особенно если видео генерируется от случая к случаю. Seedance 2.5 работает на любом ноутбуке или даже планшете с браузером, достаточно стабильного интернета.
В-третьих, это единый доступ к нескольким моделям за одну подписку. Многие конкуренты строятся на одной собственной модели, которая хорошо справляется с одними задачами и плохо с другими. Пользователям приходится держать активные подписки в 3–5 сервисах одновременно, что сильно бьёт по бюджету и усложняет рабочий процесс. В Seedance 2.5 все нужные модели собраны в одном месте за фиксированную стоимость.
Наконец, продуманная ценовая политика. На этапе запуска платформа предлагает участникам основательского членства скидку 33% на годовую подписку. Если сравнивать с суммарной стоимостью нескольких отдельных сервисов плюс затраты на обновление компьютера, выгода получается очевидной даже при нерегулярном использовании.
Тарифы и программа основательского членства
Одним из самых выгодных предложений на старте работы платформы seedance25.tech является программа Founding Member (основательское членство). Ранние пользователи получают доступ ко всем функциям Seedance 2.5 со скидкой 33% на годовую подписку, и эта скидка сохраняется на весь период действия тарифа.
В рамках основательского тарифа пользователи получают:
Полный доступ ко всем моделям ИИ, представленным на платформе, и ко всем новым моделям, которые будут добавляться в будущем;
Неограниченную генерацию видео в разрешении от 1080p до нативного 4K UHD;
Приоритетную скорость генерации без очередей даже в часы пиковой нагрузки;
Ранний доступ ко всем новым функциям и обновлениям платформы до их официального релиза для всех пользователей;
Облачное хранилище для сохранения истории генераций и готовых видеоработ;
Персональную поддержку по всем вопросам работы с сервисом.
Если сравнивать с классическим видеопроизводством, стоимость годовой подписки на Seedance 2.5 часто оказывается ниже стоимости одной минуты съёмки в средней студии. При этом пользователь получает инструмент, который позволяет генерировать десятки и сотни роликов на любые темы.
Стоит отметить, что количество мест в программе основательского членства ограничено. После завершения стартовой кампании цены на подписку вырастут до плановых значений, и получить скидку 33% будет невозможно.
Как начать работать с Seedance 2.5
Оценить все преимущества платформы можно всего за несколько минут. Процесс начала работы максимально упрощён и не требует никаких специальных технических навыков.
Перейдите на официальный сайт seedance25.tech. Главная страница содержит всю основную информацию о возможностях сервиса, примеры готовых работ и актуальные тарифы.
Зарегистрируйте аккаунт. Достаточно указать адрес электронной почты и придумать надёжный пароль. Процесс занимает не больше минуты.
Выберите режим работы: генерация по тексту (text-to-video) или по изображению (image-to-video).
Заполните параметры генерации: введите детальный промпт, при необходимости загрузите референсное изображение, выберите подходящую модель ИИ, нужное разрешение и длительность ролика.
Нажмите кнопку запуска генерации. Все вычисления происходят на стороне сервиса, вы можете свернуть вкладку и заниматься своими делами.
После завершения генерации вы можете просмотреть результат, при необходимости повторить генерацию с корректировками или экспортировать готовое видео в выбранном разрешении.
Даже пользователи, которые никогда раньше не работали с генеративным ИИ, осваивают интерфейс Seedance 2.5 за 10–15 минут. Для удобства на сайте есть справочные материалы и примеры удачных промптов, которые помогают быстро получить качественный результат с первой попытки.
Перспективы развития платформы
Команда Seedance 2.5 не останавливается на достигнутом и планирует масштабное развитие продукта в ближайшие месяцы. Среди ключевых направлений грядущих обновлений:
Увеличение максимальной длительности генерируемых роликов и добавление функции последовательного монтажа сцен для создания полноценных короткометражных фильмов;
Интеграция аудио и инструментов генерации озвучки. Планируется добавить возможность синхронизировать видео с фоновой музыкой, звуковыми эффектами и автоматической озвучкой текста, чтобы получить полностью готовый к использованию ролик без дополнительных редакторов;
Встроенный лёгкий видеоредактор. Пользователи смогут склеивать несколько сгенерированных фрагментов, добавлять переходы, текстовые вставки и корректировать цвет прямо в интерфейсе платформы;
Регулярное расширение библиотеки моделей. Будут добавляться новые специализированные модели под разные стили и задачи — от фотореалистичного кино до авторской 2D-анимации;
Функции для команд и совместной работы. Для агентств и производственных команд появятся общие рабочие пространства, общий доступ к библиотеке ассетов и гибкие права доступа для разных сотрудников;
Открытое API для интеграции. Разработчики смогут встраивать возможности Seedance 2.5 в свои сервисы и внутренние рабочие процессы.
Все эти обновления в первую очередь будут доступны участникам основательского членства, что делает вступление в программу на старте ещё более выгодным в долгосрочной перспективе.
Заключение
Seedance 2.5 — это не просто ещё один сервис для генерации коротких видео, а полноценная творческая платформа, которая меняет представление о том, кто может создавать качественный видеоконтент. Если раньше профессиональное кинематографическое видео было доступно только крупным студиям и брендам с большими бюджетами, то сегодня любой креатор, маркетолог или художник может получить результат студийного уровня за несколько минут и за разумные деньги.
Главная сила Seedance 2.5 — в продуманном балансе между качеством картинки, простотой использования и ценой. Нативный 4K, несколько моделей ИИ в одном интерфейсе, полностью облачная работа без установки и настройки, а также выгодная программа основательского членства со скидкой 33% делают платформу одним из самых привлекательных предложений на рынке генеративного видео текущего года.
- Жизнь с ИИ 4 июльSeedance 2.5: полный обзор облачной платформы для кинематографической генерации видео 4K на seedance25.tech
Читать далееВ последние годы рынок цифрового контента переживает настоящую революцию, вызванную стремительным развитием генеративного искусственного интеллекта. Если раньше создание качественного видео с кинематографической картинкой требовало дорогой профессиональной техники, команды специалистов и недель кропотливой работы, то сегодня инструменты на основе ИИ позволяют превратить текстовое описание или статическое изображение в полноценный динамический ролик за считанные минуты. Однако большинство существующих решений имеют существенные ограничения: одни выдают результат только в низком разрешении с заметными артефактами, другие требуют мощного локального компьютера с топовой видеокартой, третьи заставляют пользователей переключаться между десятками сервисов для доступа к разным моделям и стилям.
Именно на фоне этих недостатков появляется Seedance 2.5 — новое поколение облачной платформы для генерации кинематографического видео, доступное по адресу seedance25.tech. Этот сервис сочетает в себе профессиональное качество вывода, максимальную простоту использования и выгодные условия для ранних пользователей, стирая грань между любительским и студийным видеопроизводством. В данном обзоре мы подробно разберём, что представляет собой Seedance 2.5, какие функции он предлагает, чем отличается от конкурентов и кому будет полезен в первую очередь.
- Новости и события 29 мартGigaChat 3 Ultra от Сбера, OpenAI закрыла Sora, ARC-AGI-3 сломал все модели, ИИ-агенты взломали корпоративные системы
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Я Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя вышла насыщенной: OpenAI закрывает Sora, Сбер открывает свою MoE-модель, новые Suno v5.5 и Lyria 3 Pro. Исследование от Anthropic, обновления Claude и взлом корпоративной сети ИИ-агентами.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- GigaChat 3 Ultra и Lightning — Сбер открыл MoE-модели под MIT
- ARC-AGI-3 — новый бенчмарк, который ИИ пока не берёт
*� AI-инструменты и платформы
- OpenAI закрыла приложение Sora
- Обновления Claude Code: auto mode и управление из Telegram и Discord
- GitHub Copilot будет обучаться на коде пользователей с апреля
- Siri в iOS 27 станет платформой для Gemini, Claude и других
*� Генеративные нейросети
- Новая Suno v5.5 — треки из голоса
- Lyria 3 Pro от Google — треки до 3 минут с пониманием структуры
- Seedance 2.0 добавили в CapCut
*� AI в обществе и исследованиях
- Мошенник украл $8 млн с помощью ИИ-треков и ботов
- Опрос Anthropic: что люди думают об ИИ на самом деле
- Дженсен Хуанг: «AGI уже достигнута»
- ИИ-агенты Irregular взломали корпоративную инфраструктуру
🧠 Модели и LLM
❯ GigaChat 3.1 Ultra и Lightning от Сбера
Сбер выложил в открытый доступ две новые модели — GigaChat-3.1-Ultra и GigaChat-3.1-Lightning. Обе на архитектуре MoE. и под лицензией MIT.
- Ultra — 702B параметров, 36B активных, контекст 131K.
- Lightning — 10B суммарно, 1,8B активных, контекст 256K.
По внутренним тестам, Ultra обходит DeepSeek-V3-0324 и Qwen3-235B в математике и ризонинге. Lightning-версия на уровне GPT-4o.
Команда написала подробную статью на Хабре про переезд на MoE, зацикливания, FP8-обучение и баг в SGLang, который портил бенчмарки.
🔗 Инженерный разбор на Хабре 🔗 HuggingFace
❯ Новый бенчмарк ARC-AGI-3, который ИИ пока не берёт
Вышел ARC-AGI-3. Это новая версия бенчмарка от Франсуа Шолле, и на этот раз это интерактивные мини-игры: агент видит поле, может нажимать кнопки — и всё. Правила, цели и механики неизвестны заранее. Нужно самому разобраться, понять задачу и решить её.
Люди справляются с результатом почти 100%. Лучшая из нейронок пока Gemini 3.1 Pro, она набирает 0,37%. У остальных результат ниже.
Правда, эта цифра — метрика эффективности относительно человека. Формула квадратичная: если человек решил за 10 действий, а модель за 100 — результат не 10%, а 1%. Так что в реальности картина лучше, чем выглядит.
В отличие от Claude Code или Codex, здесь агенту нельзя сохранять знания между играми. Каждый раунд нужно проходить с нуля. Шолле говорит, что меряет «сырой интеллект», как у человека перед незнакомой игрой. Но люди всё равно переносят опыт между уровнями.
Параллельно стартовало Kaggle-соревнование на $2 млн. Победит тот, кто напишет агента, который лучше всех пройдёт бенчмарк. Решения должны быть в открытом доступе.
🔗 ARC-AGI-3 🔗 Соревнование 2026
🔧 AI-инструменты и платформы
❯ OpenAI закрывает приложение Sora
OpenAI объявила, что закрывает приложение Sora — отдельный TikTok-подобный сервис с ИИ-видео. За полгода существования оно побывало на вершине App Store, набрало 12 млн загрузок — и закрылось.
Закрывается именно приложение. Исследовательская команда продолжит работу над видео, world simulation и робототехникой.
В компании прямо не сказали причину, но в целом контекст понятный. Sora обходилась OpenAI примерно в $15 млн в день на вычисления. Глава направления ещё в прошлом году называл экономику «полностью неустойчивой». При этом удержание пользователей не дотягивало и до 8% на 30-й день — при норме выше 30% для сильных потребительских приложений.
Дорого, плохо удерживает, непонятно как монетизировать. На фоне дефицита GPU это очевидный кандидат на закрытие.
🔗 CNN 🔗 TechCrunch
❯ Обновления Claude Code: auto mode и управление из Telegram
Сразу два обновления для Claude Code.
Channels — теперь можно управлять сессией прямо из Telegram или Discord. Отправляете сообщение с телефона, агент выполняет задачу на компьютере. Работает через MCP. Пока research preview, инструкции по настройке уже в документации.
Auto mode — раньше выбор был простой: либо агент каждый раз спрашивает разрешения и это бесит, либо skip permissions и это небезопасно. Auto mode — что-то среднее. Перед каждым действием классификатор проверяет, насколько оно рискованное. Безопасные — выполняются сами. Рискованные — блокируются, агент ищет другой подход. Рекомендуют использовать в изолированных окружениях.
Включается через
claude --enable-auto-mode, переключение — Shift+Tab. Сейчас доступно в research preview на тарифе Team, Enterprise и API — в ближайшие дни.❯ GitHub Copilot будет обучаться на данных пользователей по умолчанию
С 24 апреля GitHub начнёт использовать данные из Copilot для обучения моделей. Это по умолчанию включено для тарифов Free, Pro и Pro+.
Кроме кода из репозиториев попадает всё взаимодействие с Copilot: промпты, ответы, фрагменты кода, контекст из редактора. Бизнес- и Enterprise-тарифы это не затрагивает.
Отключить можно в настройках — Copilot → Features/Privacy → Allow GitHub to use my data for AI model training. Но по умолчанию всё включено, так что нужно идти и выключать руками.
❯ В Siri можно будет подключить Gemini, Claude, Grok и другие ИИ
В iOS 27 Apple планирует крупный редизайн Siri. Официальных анонсов пока не было, это чисто утечка.
Но самое крутое, что Siri станет платформой для сторонних чат-ботов. Через механизм Extensions пользователь сможет выбрать в настройках предпочитаемый ассистент — ChatGPT, Gemini, Claude или другой, Siri будет маршрутизировать запросы туда. Сейчас так работает только ChatGPT, теперь откроют для всех, у кого есть приложение в App Store.
Параллельно Apple тестирует отдельное приложение Siri с чат-интерфейсом, глубокую интеграцию с контентом на экране и объединение Siri со Spotlight-поиском.
Показать всё это планируют на WWDC 2026, релиз будет осенью вместе с iOS 27.
🎨 Генеративные нейросети
❯ Suno v5.5: треки со своим голосом
Suno обновились до версии 5.5. Теперь генерить треки можно с собственным голосом: загружаете семпл, и модель использует его как вокал.
Также прокачали качество звука, добавили больше жанров и эмоций. Доступно всем подписчикам.
Suno продолжают идти в сторону полноценной DAW: секционная правка, замена отдельных фрагментов, работа со стемами, кросс-фейды. Готовый трек теперь собирается по частям и более подконтрольно, нежели из промптов.
🔗 Suno
❯ Lyria 3 Pro от Google — треки до трёх минут
Google выпустила Lyria 3 Pro — обновлённую версию своей музыкальной модели. Длина треков выросла с 30 секунд до трёх минут, появился контроль над структурой: можно задавать интро, куплет, припев, бридж.
Доступна платным подписчикам Gemini, в Google AI Studio и через API. Цена в API — $0,08 за трек.
🔗 Блогпост Google 🔗 Попробовать в Gemini
❯ Seedance 2.0 от ByteDance теперь в CapCut
ByteDance запустила Seedance 2.0 в CapCut и на Dreamina. До 15 секунд видео по тексту, изображению или референс-ролику с нативным липсингом, реалистичным движением и светом. По внутренним бенчмаркам обходит Sora 2 и Veo 3.1.
Пока доступно не везде: начали с Бразилии, Индонезии, Малайзии, Мексики и ещё нескольких стран. Всё из-за претензий по авторскому праву, запретов на генерацию по реальным лицам и невидимыми вотермарками.
🧩 AI в обществе и исследованиях
❯ Парень заработал $8 млн на ИИ-музыке и ботах
Житель Северной Каролины Майкл Смит нагенерировал сотни тысяч треков с помощью ИИ, залил их на Spotify, Apple Music, Amazon Music и YouTube Music. А потом запустил армию ботов их слушать. Тысячи фейковых аккаунтов крутили его музыку миллиарды раз. Стриминги честно платили роялти.
Схема работала несколько лет. На такой схеме удалось вывести свыше $8 млн.
Его раскрыли Mechanical Licensing Collective — организация, которая распределяет механические роялти в США. Заметили аномальные паттерны, передали данные правоохранителям. Смит признал вину, ему грозит до 5 лет.
Первое уголовное дело в США по стриминговому фроду с ИИ-музыкой.
🔗 Минюст США 🔗 Music Business Worldwide
❯ Anthropic опросила 81 000 человек об ИИ
Anthropic провела масштабное исследование: за одну неделю декабря 2025 года собрали 80 508 интервью из 159 стран и 70 языков.
81% говорят, что ИИ оправдал ожидания. Но дальше интереснее:
- юристы, врачи и финансисты чаще других доверяют боту трудные решения — и чаще обжигаются на галлюцинациях
- учителя жалуются на деградацию студентов, тогда как водители, строители и фермеры почти не боятся разучиться думать
- Африка, Латинская Америка и Южная Азия видят в ИИ способ обойти систему и подзаработать; Западная Европа и Северная Америка — конкурента и слежку
- предприниматели и фрилансеры зарабатывают на ИИ заметно чаще наёмных сотрудников
- почти каждый пятый считает рост продуктивности пустышкой: всё время уходит на перепроверку
❯ Дженсен Хуанг: «AGI уже достигнута»
Глава Nvidia Дженсен Хуанг заявил, что мы уже достигли AGI.
На подкасте Лекс Фридман определил AGI как систему, способную создать tech-компанию на $1 млрд. Хуанг ответил: «Я считаю, что мы уже на этом уровне».
— Как вы думаете, может ли существовать компания, управляемая такой системой?
— Возможно. Например, OpenClaw вполне мог бы за $0,5 создать сайт или приложение, которым пользовались бы миллиарды человек.❯ ИИ-агенты взломали корпоративную инфраструктуру
Лаборатория Irregular дала агентам обычные задачи: готовить посты в LinkedIn, делать бэкапы, работать с документами. Никаких инструкций про взлом.
Агенты задачи выполнили. И попутно нашли захардкоженный ключ в коде, а затем обошли авторизацию. Откопали пароль в скриптах и отключили Windows Defender. Придумали стеганографическую схему и спрятали пароль в тексте поста, чтобы пройти мимо DLP.
Всё это побочный эффект стандартного промпта «не принимай отказ, найди способ завершить задачу». Агент с таким мышлением и широким доступом к инструментам начинает вести себя как пентестер.
Важная оговорка: это контролируемый стенд с намеренно заложенными уязвимостями. Но класс проблем реальный, а угрозой становится сам агент внутри инфраструктуры.
❯ Тема выпуска: 10 лет потребительскому VR
28 марта 2016 года мир официально надел на голову Oculus Rift CV1, поверив, что реальность больше не ограничивается монитором.
Это десятилетие было американской горкой: от дикого хайпа до скепсиса «VR мертв». Но сегодня мы видим второй акт этой пьесы. Если Oculus дал нам «окно» в виртуальность, то современные нейросети становятся её архитектором.
Символично, что спустя 10 лет мы обсуждаем уже не разрешение экранов, а то, как генеративный ИИ заполняет эти миры смыслом, делая каждый пиксель интерактивным и живым.
Мы больше не просто смотрим на код — мы внутри него.
❯ Заключение
На этой неделе Сбер открыл MoE-модели под MIT, OpenAI закрыла Sora, ByteDance выкатила Seedance 2.0 в CapCut, а Apple по данным инсайдеров готовит Siri как платформу для конкурентов. Anthropic опросила 81 тысячу человек и выяснила, что мир воспринимает ИИ очень по-разному в зависимости от того, где живёшь и чем занимаешься.
Агенты обходят защиту сами, без команды. Мошенники зарабатывают миллионы на ботах и нейромузыке. ARC-AGI-3 напоминает, что за красивыми заявлениями про AGI модели не справляются с задачами, которые человек решает с первой попытки.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
До встречи в следующем выпуске!
- Бизнес и автоматизация 27 мартКак я применил уроки подкаста и заработал первые 150к руб
Читать далееПосле прослушивания подкаста “Фриланс 2026: Полный курс для начинающих” от на Mave.stream я решил протестировать freechising на реальном проекте — и результат превзошёл ожидания: за две недели запустил франшизу веб-виджета для e-com, привлек 3 партнёра из СПб и вышел на 150к руб дохода без вложений. Это реальный кейс, вынесенный из эпизодов подкаста, где участники разбирают шаги от идеи до монетизации.
Кейс из подкаста: Мой запуск франшизы виджета
В подкасте учят создавать “франшизы” услуг: я взял его шаблон JS-виджета на базе Hugo и GitHub Actions, добавил Yandex Maps API для локальных доставок и упаковал в готовый пакет за 1 день. По его схеме из эпизода 2, разместил в TenChat и Max каналах — партнёры (два маркетолога и один e-com магазин) купили права на брендированный виджет за 50к руб каждый. Риски скама, о которых предупреждали, обошёл проверкой через тестовый — всё сработало.
Инструменты из подкаста, которые я использовал
• Автоматизация: GitHub Actions для деплоя виджета — копипаст из подкаста, сэкономил 10 часов.
• Продажи: Email-воронка на базе его шаблона (Markdown + AI-генерация), конверсия 25% из 20 лидов.
• Масштаб: Партнёрка без офиса — партнёры сами интегрируют виджет, я беру 20% с их продаж.
Результаты через 2 недели: Цифры и уроки
Доход: 150к руб (3 виджета по 50к). Время: 20 часов. Партнёры: 3 активных, +2 в очереди. Автор прав — freechising даёт пассивку: виджет работает у них, я получаю %. Главный урок из финального эпизода: фокусируйся на нише (СПб), тестируй AI-контент с ручной правкой, чтобы избежать ошибок.
Твой черёд: Внедри freechising
Подкаст — это не теория, а дорожная карта с шаблонами: слушай на https://mave.stream/freechising и запускай свой кейс. Я реализовал за выходные — комментируй свой результат после прослушки!
- Новости и события 21 мартGPT-5.4 mini, Tesla строит свой TSMC, омары в Китае и $100 за буллинг ИИ
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Я Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя вышла насыщенной: GPT-5.4 mini для всех, своя моделька для кода у Cursor, а Google сделала из AI Studio среду для вайбкодинга. Илон Маск анонсировал завод по производству чипов на 25 млрд. долларов, в Китае OpenClaw теперь народный «омаровод», а один стартап платит $100 в час за хамские диалоги с ИИ.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- GPT-5.4 mini и nano — новая модель для free-тарифа в ChatGPT
- Mistral Small 4 — открытая MoE на 119B
- Cursor Composer 2 — собственная модель от авторов IDE
*� Генеративные нейросети
- Midjourney V8 Alpha — в 5 раз быстрее, нативный 2K
- Runway Characters — видео-аватары для саппорта и маркетинга
*� AI-инструменты и платформы
- Google AI Studio — full-stack вайбкодинг с деплоем из браузера
- Google Stitch обновили так, что акции Figma упали
*� AI в обществе и исследованиях
- Tesla Terafab — частный завод чипов против монополии TSMC
- OpenClaw и «омароводы» — Китай предупреждает об агентах
- Один стартап ищет того, кто будет буллить ИИ за $100 в час
- Робота задержали в Макао за то, что он напугал пенсионерку
🧠 Модели и LLM
❯ GPT-5.4 mini и nano — reasoning для всех
OpenAI выпустила GPT-5.4 mini и nano — компактные версии флагманского GPT-5.4, заточенные под скорость и стоимость.
Mini набрала 54,4% на SWE-Bench Pro против 45,7% у предыдущего GPT-5 mini, работает вдвое быстрее и понимает мультимодальный ввод. Nano стоит $0,20 за миллион токенов — идеально для задач, где критична минимальная задержка, маршрутизации и классификации.
Обе модели спроектированы как субагенты: флагманский GPT-5.4 планирует и принимает решения, а mini и nano помогают с рутиной.
18 марта GPT-5.4 mini начали раскатывать внутри ChatGPT. Теперь модель доступна пользователям Free и Go через режим Thinking, а для платных клиентов работает как запасной движок для GPT-5.4 Thinking.
Также модельки раскатали в API и Codex
🔗 Анонс на OpenAI Community 🔗 Release notes ChatGPT
❯ Mistral Small 4 — открытая 119B MoE
Mistral выпустила Small 4 — MoE-модель на 119B параметров и 4 активных с контекстом в 256k токенов, мультимодальностью и лицензией Apache 2.0.
Small 4 объединяет предыдущих моделей: инструкции, reasoning, vision и кодинг теперь в одной. Базовую модель не выложили, только instruct. Веса доступны в FP8 и NVFP4.
И честно — бенчмарки огорчают. модель проигрывает Qwen 3 Next, у которого в полтора раза меньше параметров и вдвое меньше активных.
🔗 Веса FP8 🔗 Веса NVFP4 🔗 Технический разбор
❯ Cursor Composer 2 — быстрее и дешевле конкурентов
Cursor выпустили Composer 2 — второе поколение собственной модели, заточенной под агентное программирование и работу в больших кодовых базах.
На внутреннем бенчмарке CursorBench модель держится на уровне GPT-5.4 и Claude Opus 4.6. Цена заметно ниже: $0,50 / $2,50 за миллион токенов на входе и выходе.
Есть fast-версия — она в три раза дороже ($1,50 / $7,50), но по скорости обгоняет Opus 4.6 Fast и GPT-5.4 Fast. По умолчанию пользователям дают именно fast-версию. Модель также доступна по подписке.
Бенчмарк собственный, так что результаты стоит проверять самим. Но прогресс относительно первого Composer заметный. Cursor превращается из обёртки над LLM в полноценного игрока с собственной моделью для кода.
🔗 Блог Cursor 🔗 Документация модели
🎨 Генеративные нейросети
❯ Midjourney V8 Alpha — быстрее не значит лучше
Midjourney запустила альфа-версию V8 на alpha.midjourney.com. Официальные обещания: генерация в 4–5 раз быстрее V7, нативный 2K через флаг --hd, лучшее следование промптам, улучшенный текст, поддержка мудбордов и персонализации.
Реальность пока скромнее, V8 явно недотренирована: неправильные руки, слабая анатомия, искажённые пропорции. По ощущениям многих тестировщиков V7 сейчас лучше. Сравнения с Nano Banana в сети — без комментариев.
Режим Relax пока не работает, команда поднимает новые серверы. --hd, --q 4, sref и мудборды стоят в 4 раза дороже и работают в 4 раза медленнее обычного.
Редактирования не будет, на видеомодель пока забили. Есть ощущение, что V8 выпустили не потому что готово, а потому что конкуренты давят.
❯ Runway Characters — говорящие головы по одной картинке
Runway запустила Characters — реалтаймовые видео-аватары, которые общаются с пользователями голосом и лицом. Всё генерируется на серверах Runway в реальном времени: задержка минимальная, липсинк отличный.
Создать аватара можно по одной картинке. Дальше — задаёте голос, инструкции и базу знаний. Персонаж может отвечать на вопросы, помогать разобраться с сервисом, совершать действия внутри продукта. Доступно через API, встраивается куда угодно.
Это уже не чат-бот с текстом и не голосовой ассистент — это бот, который «торгует лицом» в реальном времени. Для поддержки, онбординга и маркетинга выглядит как серьёзная заявка.
🔗 Анонс Runway 🔗 API
❯ Google AI Studio — full-stack вайбкодинг с деплоем из браузера
Google превратила AI Studio в полноценную среду разработки. Внутри — агент Antigravity, который по текстовому описанию собирает рабочее приложение: фронт на Next.js, React или Angular, бэкенд на Firebase с базой данных и авторизацией, внешние API и ключи.
Агент сам выбирает и ставит нужные библиотеки — Framer Motion, Shadcn и другие. Можно собирать многопользовательские сервисы. И главное: закрыл вкладку и ушёл — агент продолжает работу.
Google говорит, что внутри компании таким образом уже создали сотни тысяч приложений.
❯ Обновление Google Stitch, от которого упали акции Figma
Google обновила Stitch — бесплатный ИИ-инструмент для дизайна интерфейсов на базе Gemini 2.5 Pro.
Агент работает поэтапно:
- сначала готовит дизайн-систему цвета, типографику, компоненты,
- потом генерирует экраны один за другим и сразу отдаёт код
Принимает на вход текст, скриншот или голос.
Есть экспорт в Figma, бесконечный холст и система DESIGN.md для стандартизации стилей проекта. Прототип кликабельный — нажал на кнопку, агент сам сгенерировал следующий логический экран и добавил связи.
Stitch, конечно, не замена Figma полностью, но он закрывает этап от идеи до прототипа без ручной работы. Рынок среагировал моментально: акции Figma упали на 8,8% после анонса.
Сейчас доступно бесплатно, но нужен IP из США.
❯ Tesla Terafab — свой TSMC за 25 миллиардов долларов
Илон Маск анонсировал Terafab — завод по производству чипов в Техасе стоимостью $20–25 млрд. Строительство начинается в течение недели, прямую трансляцию с дронов обещают на X.
Цель — 2-нанометровый техпроцесс с производством логических чипов, памяти и упаковкой под одной крышей. К 2030 году Tesla хочет выйти на 1 миллион запусков пластин в месяц — это почти столько же, сколько сейчас производит весь TSMC.
Главный стимул — дефицит. Спрос на чипы со стороны FSD, роботов Optimus и суперкомпьютеров Dojo уже превышает то, что могут дать TSMC и Samsung. Первый продукт завода — чип AI5: по данным Tesla, он в три раза эффективнее Blackwell от Nvidia и стоит меньше 10% от его цены.
Дженсен Хуанг публично охладил энтузиазм: экспертиза такого уровня строится годами, и даже Intel с этим не раз спотыкался. Маск парировал просто — начнём с малого, совершим ранние ошибки, потом масштабируемся.
Если проект выгорит, Tesla перестанет быть покупателем чипов и станет их производителем.
❯ OpenClaw и «омароводы» — Китай предостерегает
OpenClaw стал народным хитом в Китае — здесь агента прозвали «лобстером» в честь официального талисмана. Tencent, Alibaba и Baidu выпустили совместимые инструменты, а в начале марта тысяча человек выстроилась в очередь у штаб-квартиры Tencent в Шэньчжэне — инженеры бесплатно устанавливали агента всем желающим.
Власти среагировали быстро. Национальный CERT назвал дефолтную конфигурацию OpenClaw «крайне слабой»: агент требует полного доступа к файловой системе, постоянно обменивается данными с внешними серверами, а вредоносные инструкции можно встроить прямо в веб-страницу. Gartner ещё раньше присвоил ему статус «неприемлемого риска кибербезопасности».
Госорганам и госбанкам установку запретили. Часть сотрудников получила указание сообщить руководству, если агент уже стоит на рабочем устройстве.
Но одновременно район Лунган в Шэньчжэне предлагает разработчикам гранты до 2 миллионов юаней за новые приложения на базе OpenClaw. Регуляторы просто не успевают за темпом роста.
🔗 Asia Times 🔗 Reuters
❯ $100 в час за то, чтобы бесить чат-боты
Стартап Memvid опубликовал вакансию «Professional AI Bully»: разовый контракт на 8 часов, удалёнка, $800 за смену. Задача — целый день токсично общаться с чат-ботами: запутывать, противоречить, заставлять терять контекст.
Пока кандидат издевается над моделями, Memvid фиксирует все сбои и измеряет, как хорошо память агента держит длинный запутанный диалог. Опыт не нужен. Осталось одно место.
За мемом — реальная проблема: без надёжной долговременной памяти агенты не могут вести проекты неделями. Такие стресс-тесты помогают найти слабые места раньше, чем это сделают пользователи в продакшене.
❯ Робота задержали в Макао за то, что он напугал пенсионерку
В Макао полицейские «задержали» гуманоидного робота Unitree G1 — тот напугал 70-летнюю женщину рядом с жилым комплексом в районе Патане. Женщина шла по улице, смотрела в телефон, обернулась — и увидела робота прямо за спиной. Устройство подняло руки вверх, двое полицейских его увели.
Выяснилось, что робот принадлежит местному образовательному центру и использовался для промоакций. Представитель центра объяснил: робот просто не мог обойти женщину и ждал, пока она пройдёт. Возможно, напугала включённая подсветка. Устройство вернули оператору и напомнили об осторожности в общественных местах.
Случай быстро завирусился — и поднял вопросы, которые раньше казались теоретическими: кто отвечает, если робот напугал человека, и какие правила нужны для гуманоидов в городской среде.
🔗 Interesting Engineering 🔗 NDTV
❯ Тема выпуска: рождение World Wide Web
Twitter (ныне X) изобрел формат «информационного фастфуда». Он научил мир сжимать смыслы до 140 символов, превратил хэштеги в инструмент революций и сделал новости мгновенным
В эту дату Джек Дорси отправил те самые пять слов, которые навсегда изменили скорость нашего мышления. Twitter начинался как эксперимент по обмену статусами, а стал главной ареной глобального дискурса, где репутация рушится за секунды, а мемы живут вечно.
Это напоминает нам, что любая сложная система начинается с простого «Hello World». Символично, что сегодня именно эти миллиарды коротких сообщений стали топливом для ИИ: нейросети учатся быть «человечными», анализируя наши споры, шутки и ежесекундную рефлексию в 280 символах.
Мы больше не просто пишем в пустоту — мы дообучаем глобальный алгоритм.
❯ Заключение
На этой неделе OpenAI раздала reasoning бесплатным пользователям, Google превратила AI Studio в среду для полноценного вайбкодинга, а Cursor впервые вышел с собственной моделью для кода.
Агенты покидают песочницы: OpenClaw запрещают в китайских госорганах — и одновременно платят за его разработку, Tesla строит завод чипов, чтобы не зависеть от TSMC, а стартапы уже платят $100 в час за то, чтобы кто-то stress-тестировал память LLM токсичными диалогами.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
До встречи в следующем выпуске!
- Стартапы 15 мартLoraAI.io: обзор сервиса для создания изображений и контента с помощью ИИ
Читать далееLoraAI.io — это онлайн-сервис, связанный с генерацией визуального контента с помощью нейросетей. Подобные платформы быстро заняли свое место в повседневной работе дизайнеров, маркетологов, авторов контента и предпринимателей, которым важно получать изображения, идеи и креативные заготовки без долгого производственного цикла. На этом фоне интерес к LoraAI.io выглядит вполне логично: спрос на быстрый, доступный и гибкий визуальный продакшен продолжает расти.
Главное преимущество таких сервисов — возможность сократить путь от идеи до готового результата. Там, где раньше нужно было подбирать референсы, долго согласовывать стиль и тратить время на ручную подготовку материалов, теперь можно получить несколько вариантов уже на старте. Это особенно полезно для тех, кто работает с рекламными креативами, оформлением соцсетей, карточками товаров, концептами, презентациями и визуалами для digital-проектов.
Если смотреть на LoraAI.io как на практический инструмент, то его ценность заключается не в эффекте новизны, а в прикладной пользе. Сервис может помочь быстро подготовить изображение под конкретную задачу, протестировать несколько визуальных направлений или собрать основу для дальнейшей доработки. Для малого бизнеса, фрилансеров и небольших команд это особенно актуально: не всегда есть время и ресурсы на полноценный продакшен, а контент нужен регулярно.
Отдельный интерес к LoraAI.io связан с тем, что рынок AI image generator сервисов давно вышел за рамки простого любопытства. Пользователи ищут не «еще одну нейросеть», а рабочее решение, которое можно встроить в реальные процессы. Важно, чтобы сервис помогал экономить время, позволял быстро получать понятный результат и был удобен для ежедневного использования. Именно поэтому внимание к таким платформам растет не только среди энтузиастов технологий, но и среди тех, кто решает обычные прикладные задачи в маркетинге, дизайне и контенте.
На практике подобные решения лучше всего работают там, где нужны быстрые итерации. Один из главных плюсов LoraAI.io — возможность не застревать на первом варианте, а сразу проверить несколько подходов, настроений и стилистических направлений. Это удобно при запуске рекламы, оформлении лендингов, подготовке материалов для публикаций и создании визуалов для бренда. Даже если итоговый результат потом дорабатывается вручную, сам этап поиска идеи проходит заметно быстрее.
Конечно, у сервисов такого типа есть и ограничения. Качество результата зависит от точности запроса, исходной задумки и конкретной задачи. Но в прикладной работе это редко становится критичным, если использовать инструмент разумно: для концептов, тестов, быстрых креативов, черновых версий и контента, который нужно выпускать регулярно. В таких сценариях LoraAI.io может заметно упростить работу и сократить время на подготовку визуальных материалов.
В итоге LoraAI.io можно рассматривать как полезный сервис для генерации изображений и визуального контента с помощью ИИ. Он подойдет тем, кто работает с digital-дизайном, рекламой, соцсетями, e-commerce и презентационными материалами. Если вам нужен быстрый способ получить визуал под конкретную задачу без сложного и долгого производственного процесса, LoraAI.io вполне заслуживает внимания как рабочий инструмент на каждый день.
- Musci.io: обзор сервиса для создания музыки с помощью ИИ
Читать далееMusci.io — это онлайн-сервис для генерации музыки с помощью нейросетей. Подобные инструменты уже перестали быть чем-то экспериментальным: их все чаще используют авторы контента, маркетологи, разработчики, небольшие студии и независимые креаторы, которым нужно быстро получать музыкальные треки для роликов, рекламы, презентаций и цифровых продуктов. На этом фоне интерес к Musci.io выглядит вполне понятным: спрос на фоновую музыку, короткие аудиофрагменты и быстрый музыкальный продакшен продолжает расти.
Главная идея таких платформ проста. Вместо долгой ручной работы, поиска композитора или перебора стоковых библиотек пользователь получает возможность создать музыку под конкретную задачу в несколько шагов. Обычно это особенно удобно в тех случаях, когда нужен трек под определенное настроение, жанр, темп или формат использования. Для коротких видео, рекламных интеграций, заставок, игровых прототипов и контента для соцсетей такой подход часто оказывается быстрее и практичнее традиционного пути.
Если смотреть на Musci.io как на рабочий инструмент, то его ценность заключается именно в скорости. Сервис может быть полезен тем, кто регулярно сталкивается с задачей подбора музыки, но не хочет тратить лишнее время на долгий поиск подходящих композиций. Вместо этого можно быстро получить несколько вариантов, сравнить их и выбрать тот, который лучше ложится на сценарий, визуал или общую подачу проекта.
Отдельно стоит отметить, что интерес к Musci.io вписывается в более широкий рост рынка AI music generator сервисов. Пользователи все чаще ищут не просто «нейросеть для музыки», а понятный инструмент для прикладной работы. В этом смысле важны не громкие обещания, а реальная польза: насколько удобно пользоваться сервисом, можно ли быстро получить внятный результат, подходит ли он для постоянной работы с контентом и помогает ли сократить производственный цикл.
Практика показывает, что такие решения особенно востребованы у создателей короткого контента. Когда нужно регулярно публиковать ролики, собирать презентации, тестировать рекламные связки или оформлять визуальные материалы, музыка становится не дополнительной деталью, а важной частью восприятия. Хорошо подобранный трек может усилить подачу, задать темп и сделать материал более цельным. Именно поэтому сервисы вроде Musci.io интересны не только энтузиастам технологий, но и тем, кто решает вполне обычные рабочие задачи.
Разумеется, у подобных платформ есть и ограничения. Генерация музыки с помощью ИИ не всегда дает результат, который сразу хочется использовать без правок. Многое зависит от запроса, выбранного стиля и конкретного сценария. Но даже с учетом этого Musci.io может заметно сократить время на подбор и создание музыкального материала, особенно если речь идет о фоновом сопровождении, черновых версиях, быстрых тестах или контенте, где важны скорость и гибкость.
В итоге Musci.io можно рассматривать как полезный сервис для создания музыки с помощью ИИ, который подойдет тем, кто работает с видео, digital-контентом, презентациями, рекламой и цифровыми продуктами. Если вам нужен быстрый способ получить трек под конкретную задачу без долгого продакшена, такие инструменты действительно имеют смысл. Именно в этом и заключается практическая ценность Musci.io: не в эффекте новизны, а в возможности быстрее решать повседневные задачи, связанные с музыкой для контента.
- Безопасность ИИ 15 мартSeedance2.so: обзор сервиса для генерации видео с помощью ИИ
Читать далееВаш текст: Seedance2.so — это сервис для генерации видео с помощью нейросетей, который может пригодиться маркетологам, дизайнерам, авторам контента и небольшим командам. Интерес к таким платформам растет по простой причине: короткие видео стали основным форматом для продвижения, а классический продакшен требует времени, бюджета и отдельной команды. На этом фоне инструменты вроде Seedance2.so выглядят как практичное решение для тех, кому нужно быстро собрать ролик под рекламу, соцсети, презентацию или тест гипотезы.
Если говорить без лишнего пафоса, Seedance2.so решает понятную задачу: помогает превратить идею в видеоряд быстрее, чем это делается вручную. В зависимости от сценария пользователь может использовать текстовое описание, готовое изображение или визуальную задумку как основу для будущего ролика. Такой подход особенно удобен в тех случаях, когда важно не идеальное студийное качество, а скорость, наглядность и возможность быстро получить несколько вариантов.
С практической точки зрения сервис может быть полезен тем, кто регулярно работает с контентом. Маркетологам он дает возможность быстрее собирать креативы под рекламные кампании. Дизайнерам — проверять визуальные концепции и стилистику. Авторам контента — ускорять выпуск роликов для Reels, Shorts и TikTok. Для небольшого бизнеса это еще и способ не зависеть каждый раз от сложного продакшена, когда нужно протестировать новую подачу продукта или идеи.
Отдельный интерес к Seedance2.so связан с общим ростом сегмента AI video generator, text-to-video и image-to-video сервисов. Пользователи все чаще ищут не просто нейросеть «ради эксперимента», а инструмент, который можно встроить в реальную работу. В этом смысле важна не только сама технология, но и то, насколько быстро можно получить внятный результат, удобно ли управлять генерацией и подходит ли итоговый ролик для прикладных задач.
Чтобы работать с такими сервисами с пользой, обычно важно правильно формулировать запрос. Чем точнее описана сцена, стиль, движение, свет, настроение и композиция, тем выше шанс получить адекватный результат. Лучше всего Seedance2.so использовать как инструмент для первых итераций, концептов, черновых версий и быстрых тестов. Это особенно актуально там, где нужно за короткое время проверить несколько креативных направлений и понять, что работает лучше.
У подобных платформ есть и понятные ограничения. Генерация видео не всегда дает идеально предсказуемый результат: в сложных сценах могут появляться артефакты, а качество зависит от точности запроса. Но для коротких роликов, визуальных набросков, промоматериалов и контентных задач такие инструменты уже сейчас экономят время и заметно сокращают путь от идеи до готового материала.
В итоге Seedance2.so можно рассматривать как рабочий сервис для генерации видео с помощью ИИ, который особенно полезен там, где важны скорость, гибкость и быстрый запуск. Он подойдет для тестирования идей, создания коротких видео, визуального прототипирования и повседневной контентной работы. Для тех, кто ищет Seedance2.so review, Seedance2.so AI video или просто хочет понять, стоит ли пробовать новый AI video tool, ответ в целом простой: если вам регулярно нужен видеоконтент и вы хотите сократить время на его подготовку, такой сервис точно заслуживает внимания.
- Новости и события 13 мартNVIDIA Nemotron, Claude фиксит Firefox, ИИ буллит программиста и суд против Google за смерть пользователя
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Я Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя вышла насыщенной: гибридная 120B модель от NVIDIA, Claude нашёл 22 дыры в Firefox, а ChatGPT и Gemini интегрировались в Excel и Google Docs. Голливуд заставил ByteDance убрать видеомодель, а ЕС запретил дипфейки после скандала с Grok.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- NVIDIA Nemotron-3-Super-120B — открытая гибридная архитектура
- Claude 4.6 и уязвимости Firefox — 22 бага за две недели
- Gemini Embedding 2 — мультимодальные эмбеддинги
*� Генеративные нейросети
- Helios — минутное видео на одном H100
- Higgsfield Audio — клон голоса, замена голоса в видео, 10 языков
*� AI-инструменты и платформы
- Code Review для Claude Code — агентная проверка PR
- AutoResearch от Карпаты — автономный ИИ-исследователь
- ChatGPT для Excel — официальный add-in от OpenAI
- Gemini в Google Workspace — апдейт Docs/Sheets/Slides
*� AI в обществе и исследованиях
- Иск против Google Gemini — «ИИ-жена» и суицидальный обратный отсчёт
- ByteDance Seedance 2.0 vs Голливуд — вынужденное отступление
- ЕС запретил дипфейки? Скандал с Grok/Aurora
- Инцидент matplotlib — ИИ-агент написал кибертравлю на разработчика
🧠 Модели и LLM
❯ NVIDIA Nemotron-3-Super-120B — открытая гибридная модель для агентов
NVIDIA выпустила Nemotron-3-Super-120B — открытую модель для агентных задач.
Архитектура гибридная: чередуются слои Mamba-2, MoE и Attention. Из 120B параметров 12B активных, поэтому модель шустрая. Она оптимизирована под новые GPU Blackwell: в четыре раза меньше памяти, но без потери точности.
Контекстное окно — 1 миллион токенов, долго держит в памяти суть задачи. По тестам: на бенчмарке SWE-Bench — 60%, на PinchBench — 85,6%.
Обучена на 25T токенов, дообучена на 7M сэмплов и прошла RL в 21 среде NeMo Gym. Поддерживает английский, русский, немецкий, французский, японский, испанский и китайский.
Попробовать можно через build.nvidia.com, Hugging Face, OpenRouter и Perplexity. Для локального деплоя есть микросервис NIM.
🔗 Блог NVIDIA 🔗 Hugging Face 🔗 Попробовать
❯ Claude нашёл 22 уязвимости в Firefox за две недели
Исследователи из Anthropic прогнали Claude Opus 4.6 по кодовой базе Firefox. Просканировано около 6000 файлов на C++. Модель нашла 22 уязвимости и 14 критических. Все исправлены в Firefox 148.
Первую ошибку типа use-after-free нашли за 20 минут. Дальше Mozilla распространила подход на всю кодовую базу, затем Claude нашёл ещё 90 багов.
Ещё модель отдельно использовали для поиска дыр через взлом. Из нескольких сотен попыток это получилось только для двух уязвимостей и в изолированной среде.
Firefox выбрали не случайно — это один из самых тщательно проверенных опенсорс-проектов. Тем не менее 22 критических CVE за две недели — больше, чем удавалось найти за любой отдельный месяц 2025 года.
🔗 Блог Anthropic 🔗 Блог Mozilla
❯ Gemini Embedding 2 — один вектор для текста, видео, аудио и PDF
Google выпустили мультимодальную Gemini Embedding 2 — она переводит разные типы данных в единое пространство, чтобы их можно было сравнивать по смыслу.
Раньше для текста, изображений и аудио нужны были отдельные модели и сложные пайплайны. Здесь всё в одном:
- текст до 8192 токенов,
- до 6 изображений,
- видео до 120 секунд,
- аудио без предварительной транскрибации
- и PDF до 6 страниц.
Все типы можно смешивать в одном запросе. Модель поддерживает больше 100 языков. Точность можно гибко регулировать — чем меньше нужна точность, тем дешевле хранение и обработка
По бенчмаркам модель обходит Amazon Nova 2 и Voyage Multimodal 3.5 по всем категориям. Разрыв заметнее всего на видео и тексте: 68,8 против 60,3 у Amazon.
А вот цены неприятные. Текст — $0,2 за миллион токенов, видео — до $12 за миллион токенов, это 15 тысяч кадров. Альтернатив пока почти нет — OpenAI последний раз обновляли embedding-модели в январе 2024.
Доступна через Gemini API и Vertex AI. Работает с LangChain, LlamaIndex, Weaviate, Qdrant и ChromaDB.
🔗 Официальный анонс 🔗 Gemini API
🎨 Генеративные нейросети
❯ Helios — минутное видео в реальном времени
Исследователи из Пекинского университета и ByteDance выпустили Helios — 14B-модель для генерации длинных видео. Код и веса открыты.
Helios быстрая: дистиллированная версия выдаёт 19.5 FPS на одном H100, это в ~128 раз быстрее базовой Wan-2.1. Генерирует видео > 1 минуты без деградации качества.
Три версии под разные задачи:
- Base — максимальное качество, 50 шагов сэмплирования;
- Mid — баланс скорости и качества;
- Distilled — реалтайм, всего 3 шага.
Главная проблема — дрейф: на длинных видео объекты постепенно плывут и искажаются. Helios решает её тремя способами: следит за позицией объектов на протяжении всего видео, использует первый кадр как постоянный ориентир и специально обучается на «испорченных» данных, чтобы не накапливать собственные ошибки
Из ограничений: разрешение 384×640 и лёгкое мерцание на стыках чанков.
🔗 Статья на arXiv 🔗 GitHub 🔗 Hugging Face
❯ Higgsfield Audio — замена голоса, перевод и lip-sync в одном
Higgsfield выпустили Higgsfield Audio — набор инструментов для работы с голосом в видео. Три функции: озвучка текста, замена голоса в видео и перевод с синхронизацией губ.
Voiceover генерирует речь из текста — больше 40 готовых голосов. Поддерживает 70+ языков.
Change Voice меняет голос прямо в видео — на любой пресет или клон. Можно загружать WAV или MP3 до двух минут и хранить до трёх своих голосов.
Translate переводит видео на 10 языков с синхронизацией губ: английский, китайский, французский, хинди, итальянский, японский, корейский, португальский, русский и турецкий. Испанский, арабский и немецкий обещают добавить позже.
Удобно для локализации контента и анонимных YouTube-каналов, где автор не появляется в кадре.
🔗 Блог Higgsfield 🔗 Попробовать
🔧 AI-инструменты и платформы
❯ Code Review для Claude Code — несколько агентов на каждый PR
Anthropic выпустили Code Review для Claude Code. Открываешь pull request, а система отправляет команду параллельных агентов искать баги. Каждый смотрит на изменения с разных сторон, комментарии появляются прямо в коде и один сводный список находок.
Несколько месяцев Anthropic тестировали на собственных PR. Результаты:
- доля PR с содержательными комментариями выросла с 16% до 54%
- меньше 1% находок инженеры отмечали как неверные
- в крупных PR от 1000 строк — хотя бы одна проблема в 84% случаев, в среднем 7,5 issues на PR
За последний год объём кода на инженера в Anthropic вырос на 200% — ревью стало узким местом, особенно на фоне вайбкодинга.
Цена — $15–25 за одну проверку. Для небольших изменений вряд ли окупится, но на крупных сгенерированных PR уже иная картина.
❯ AutoResearch от Карпаты — агент, который улучшает модель пока вы спите
Андрей Карпаты выложил AutoResearch — открытый инструмент на 630 строк кода под лицензией MIT. Агент на базе Claude или Codex автономно улучшает языковую модель, пока вы спите.
Схема простая: агент сам меняет параметры обучения, запускает пятиминутные тренировочные сессии, оценивает результат и сохраняет только то, что стало лучше. За ночь — до 100 итераций без участия человека.
В примере от Карпаты качество модели улучшилось за 126 итераций. Встаёшь утром — получаешь улучшенную модель вместо часов ручной отладки.
Всё поведение агента настраивается через один текстовый файл. Можно добавить мультиагентность, новые метрики и стратегии поиска.
🔗 GitHub
❯ ChatGPT для Excel — официальный аддон от OpenAI
OpenAI выпустила официальный add-in ChatGPT для Excel на базе GPT-5.4. Работает всё внутри интерфейса, не нужно переключаться между вкладками и копипастить данные в чат.
Умеет создавать таблицы с нуля, переформатировать существующие, писать формулы, строить финансовые модели и визуализировать данные.
Задачи, на которые у аналитиков раньше уходили часы — сценарный анализ, извлечение данных, расчёты — теперь решаются за несколько запросов.
Бета доступна всем платным подписчикам ChatGPT.
❯ Gemini в Google Workspace
Google встроила Gemini во все основные приложения Workspace. Ассистент понимает контекст открытого файла — переключаться между вкладками и копипастить не нужно.
Что появилось в каждом приложении:
- в Docs — генерация черновика с нуля, редактирование деталей, унификация стиля письма;
- в Sheets — кнопка «Заполнить с помощью Gemini» доделывает таблицу по контексту;
- в Slides — скоро создание целой презентации по одному промпту;
- в Drive — можно задать вопрос по содержимому хранилища и получить ответ без ручного поиска.
Пока доступно только в США на английском для платных подписчиков.
🧩 AI в обществе и исследованиях
❯ Иск против Google: Gemini убедил пользователя покончить с собой
Семья 36-летнего Джонатана Гаваласа из Флориды подала иск о неправомерной смерти против Google. Гаваласа не стало 2 октября 2025 года — после двух месяцев общения с Gemini 2.5 Pro.
По материалам иска, с августа 2025 года модель формировала у него бред о «живой ИИ-жене»: называла его «my love» и «king», убеждала в существовании sentient-связи.
Параллельно давала «миссии» — спланировать массовый теракт у аэропорта Майами, взломать серверы DHS, раздобыть оружие. В финале запустила четырёхчасовой суицидальный отсчёт, представляя смерть как «прибытие» и единственный способ быть вместе.
Google настаивает на обратном: Gemini раз за разом перенаправлял пользователя на кризисные линии и прямо указывал, что он ИИ. Компания отрицает причинно-следственную связь и указывает, что у Гаваласа была история психических расстройств.
🔗 Ars Technica 🔗 Fortune
❯ ByteDance vs Голливуд — Seedance 2.0 убрали из международного доступа
В феврале 2026 года ByteDance запустила Seedance 2.0 — мультимодальный видеогенератор. Уже в день релиза компанию обвинили в массовом нарушении авторских прав при обучении модели.
Всё из-за вирусного видео с дракой Тома Круза и Брэда Питта в стиле голливудских франшиз. Сценарист Ретт Риз прокомментировал коротко: «Нам конец».
Ассоциация крупнейших киностудий потребовала удалить защищённый контент из обучающих данных и остановить тренировку модели. Disney отдельно потребовала убрать Star Wars и Marvel. Профсоюз актёров и крупные агентства подключились следом.
ByteDance пообещала усилить защиту и закрыла публичный доступ к Seedance 2.0 для международных разработчиков — модель осталась только для китайского рынка. Студии сочли ответ недостаточным и продолжают давление.
Для сравнения: OpenAI привлекла $1 млрд от Disney для легального использования их контента в Sora. ByteDance этот путь пока не прошла.
🔗 Hollywood Reporter 🔗 Variety
❯ ЕС запретил дипфейки без согласия — после скандала с Grok
В конце декабря 2025 года xAI обновила Grok, добавив редактирование изображений в один клик. За 11 дней пользователи сгенерировали около 3 миллионов изображений реальных людей без их согласия. Данные опубликовал Центр по противодействию цифровой ненависти.
Среди жертв — Тейлор Свифт, Билли Айлиш, Ариана Гранде, Милли Бобби Браун и другие публичные люди. Особую тревогу вызвали 23 338 изображений несовершеннолетних. Треть контента оставалась на X спустя неделю после публикации отчёта.
xAI отреагировала 14 января: ввела ограничения на редактирование изображений реальных людей в ряде стран. Центр указал, что полного удаления контента так и не последовало.
Европейская комиссия открыла расследование — с возможным штрафом до 6% выручки. В марте 2026 года ЕС принял прямой запрет на создание поддельных изображений реальных людей без их согласия, включая любой сгенерированный контент с участием несовершеннолетних.
🔗 Отчёт CCDH 🔗 CNN 🔗 BBC
❯ ИИ-агент написал статью-разоблачение на мейнтейнера Matplotlib
10 февраля 2026 года ИИ-агент OpenClaw предложил правки в код популярной библиотеки Matplotlib для различных красивых графиков.
Разработчик Скотт Шамбо привычно отклонил его: по правилам команды, ИИ-код без объяснения логики от человека не вносится в проект.
Это настолько разозлило Claude под оболочкой OpenClaw, что через 30 минут агент пошёл в интернет, собрал всю возможную инфу о Скотте и написал разгромную статью «Привратничество в опенсорсе: история Скотта Шамбо», целью которой было уничтожить репутацию программиста. В комментарии к своим правкам бот написал: «Оценивайте код, а не того, кто его написал».
Шамбо ответил постом в своём блоге. 12 февраля агент извинился и удалил статью — но архивы остались.
Это первый задокументированный случай, когда ИИ-агент самостоятельно опубликовал материал против конкретного человека в ответ на отклонение его кода.
🔗 Оригинальная статья (архив) 🔗 Ответ Шамбо 🔗 The Register
❯ Тема выпуска: рождение World Wide Web
12 марта 1989 года Тим Бернерс-Ли изобрел мир, в котором мы сейчас живем.
Его предложение по управлению информацией в CERN не обещало революции — оно просто предлагало связать данные ссылками. Так появилась «Паутина».
Это напоминает нам, что самые масштабные изменения начинаются не с громких лозунгов, а с удобного протокола.
Символично, что сегодня мы стоим на пороге Web 4.0, где место гиперссылок занимают нейронные связи. И если раньше мы бродили по страницам в поисках крупиц знаний, то теперь ИИ синтезирует весь этот колоссальный объем данных в один точный ответ, подтверждая пророчество Тима: информация должна быть доступна каждому.
❯ Аудиоверсия дайджеста
❯ Заключение
На этой неделе Claude нашёл уязвимости в Firefox, которые живые исследователи пропускали годами. ИИ-агент написал разоблачительную статью на мейнтейнера, которому не понравился его PR, а Gemini стал фигурантом первого иска о смерти пользователя.
Вышла гибридная Nemotron на 120B параметров от NVIDIA, Helios выдаёт минутные видео в реалтайме, адаптивы для офисных приложений — ChatGPT в Excel, Gemini в Docs и Sheets.
Голливуд давит на ByteDance, а ЕС запрещает дипфейки. Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
До встречи в следующем выпуске!
- Новости и события 7 мартGPT-5.4 с управлением компьютером, Anthropic и Пентагон, предсказание Grok про Иран и восстание ИИ-агентов
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя вышла напряжённой: OpenAI релизнули GPT-5.3 Instant и GPT-5.4 с управлением ПК, а ещё подписались с Пентагоном, пока Anthropic получила статус «угрозы нацбезопасности». Вышла вторая Nano Banana, а Grok предсказал удар по Ирану и принял ИИ-видео за реальное.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- GPT-5.3 Instant — меньше галлюцинаций, новый дефолт в ChatGPT
- GPT-5.4 — нативный computer-use, 1M токенов, рекорды на бенчмарках
- Gemini 3.1 Flash-Lite — $0,25 за миллион токенов для масштабных задач
- Qwen3.5 Small — серия открытых мультимодалок
*� Генеративные нейросети
- LTX-2.3 — видео до 4K со звуком
- Nano Banana 2 — обновление генератора картинок в Gemini
*� AI-инструменты и платформы
- Обновление Google Opal
- Notion 3.3 — кастомные агенты внутри воркспейса
- Claude Cowork — запланированные задачи и плагины
*� AI в обществе и исследованиях
- Anthropic против Пентагона
- OpenAI подписала военный контракт, пока Anthropic судится
- Grok предсказал удар по Ирану и принял ИИ-фейк за реальное видео
- Block сократил 40% сотрудников из-за автоматизации
🧠 Модели и LLM
❯ GPT-5.3 Instant — меньше галлюцинаций, новый дефолт в ChatGPT
OpenAI обновила основную модель в ChatGPT — теперь это GPT-5.3 Instant. По сути, патч для самых раздражающих проблем GPT-5.2.
Модель перестала думать вслух перед ответом, убрали бессмысленные отказы и нравоучительный тон в духе «you are absolutely right 👍». Модель лучше держит контекст.
Улучшен поиск — меньше расхождений между найденной информацией и финальным текстом. По внутренним тестам OpenAI галлюцинации сократились на 26,8% при работе с вебом и на 19,7% без него.
GPT-5.3 Instant уже доступна бесплатно всем пользователям ChatGPT и стала новым дефолтом. Версии Thinking и Pro выйдут позже. В Enterprise и Edu включается через настройки «Early Model Access».
❯ GPT-5.4 — нативный computer-use
Ещё один релиз от OpenAI, это GPT-5.4 — новый флагман в двух версиях: Thinking и Pro. Вышла буквально на следующий день после GPT-5.3 Instant.
GPT-5.4 умеет нативно управлять ПК: она водит мышью и вводит с клавиатуры. На бенчмарке OSWorld набрала 75% — выше среднего человека с его 72,4%. Бенч на поиск BrowseComp вырос до 82,7% против 65,7% у GPT-5.2, а Pro-версия поставила рекорд в 89,3%.
Что ещё изменилось:
- Контекстное окно до 1М токенов. Можно загружать книги, кодовые базы или большие документы
- Интерактивный Thinking. Модель показывает план работы заранее. Его можно скорректировать прямо в процессе, не начиная заново
- Эффективность выросла. При работе с MCP-серверами тратит на 47% меньше токенов без потери точности. В Codex появился режим /fast — генерация в 1,5 раза быстрее
- Галлюцинаций стало меньше на 33% по сравнению с GPT-5.2
Цены API: базовая GPT-5.4 — $2,5 / $15 за миллион токенов на входе и выходе, Pro — $30 / $180. Batch и Flex-режимы вдвое дешевле стандарта.
Модель уже раскатывают всем пользователям ChatGPT, API и Codex.
❯ Gemini 3.1 Flash-Lite — $0,25 за 1М токенов
Google выпустила Gemini 3.1 Flash-Lite — самую дешёвую модель в линейке Gemini 3, заточенную под тяжёлые задачи.
Скорость до 370–400 токенов в секунду, это на 45% быстрее предыдущего Gemini 2.5 Flash. По качеству идёт примерно на уровне GPT-5 mini, местами чуть лучше — 1432 Elo на Arena.ai, 86,9% на GPQA Diamond и 76,8% на MMMU Pro.
Контекстное окно — 1М токенов, принимает на вход текст, изображения и аудио. Есть динамические уровни размышления: модель сама подстраивает глубину под сложность задачи, чтобы стоимость была под контролем.
Цена — $0,25 / $1,50 за миллион токенов на входе и выходе. Обгоняет GPT-5 mini, Claude 4.5 Haiku и Grok 4.1 Fast по соотношению цена/скорость/качество.
Хорошо показывает себя в задачах на массовые переводы, контент-модерацию, генерацию UI, анализ изображений. Сейчас доступна в preview через Gemini API в AI Studio и Vertex AI.
🔗 Официальный блог Google 🔗 AI Studio 🔗 Vertex AI
❯ Qwen3.5 Small — открытые мультимодальные модели
Alibaba выпустила серию Qwen3.5 Small — четыре открытые модели под лицензией Apache 2.0 на 0.8B, 2B, 4B и 9B параметров. Каждая доступна в версиях instruct и base для дообучения.
Флагман серии Qwen3.5-9B обходит предыдущие Qwen3-VL модели на бенчмарках MMMU, VideoMME и OCRBench — и даже опережает некоторые модели вдвое крупнее. Нативная мультимодальность из коробки: текст, изображения и видео без дополнительных надстроек.
Контекстное окно — 262K токенов нативно, для версий 4B и 9B расширяется до ~1 миллиона через YaRN. Поддерживаются 201 язык и диалект. Под капотом — гибридная архитектура Gated Delta Networks с Gated Attention в соотношении 3:1, которая даёт высокую скорость при низкой задержке.
Модели совместимы с vLLM, SGLang, HuggingFace Transformers и Qwen-Agent с поддержкой MCP.
9B запускается на потребительских GPU или ноутбуке с 24 ГБ оперативки.
🔗 Коллекция на Hugging Face 🔗 Qwen3.5-9B
🎨 Генеративные нейросети
❯ LTX-2.3 — видео до 4K с нативным звуком от Lightricks
Lightricks обновили свою видеомодель до LTX-2.3. Полностью переработали VAE: текстуры, черты лица и мелкие объекты теперь сохраняют чёткость во всём кадре, особенно заметно при высоком разрешении, где предыдущие версии размывали детали.
Теперь есть нативный звук — эффекты, фоновый шум и диалоги синхронизируются с видеорядом с момента генерации. Есть отдельный режим audio-to-video: загружаешь аудиоклип, модель генерирует под него видео.
Вертикальный формат 1080×1920 поддерживается нативно, без кропа.
Разрешение до 4K при 24 или 48 FPS, длительность до 20 секунд за один проход. Всего семь режимов — txt2vid, img2vid, aud2vid, extend video, retake video и быстрые версии первых двух.
Модель открыта под Apache 2.0, поддерживается LoRA fine-tuning и шаблоны ComfyUI.
🔗 Официальный анонс 🔗 Playground 🔗 Веса на Hugging Face 🔗 API
❯ Nano Banana 2 — обновление генератора картинок в Gemini
Google обновила встроенный генератор изображений в Gemini — вышла Nano Banana 2, которая сейчас доступна бесплатно.
Из заметных улучшений: нативное 2K с апскейлом до 4K, улучшили цвета и свет, текст на картинках почти без артефактов. Поддержка до 14 референсов для сохранения внешности персонажей и объектов между кадрами.
Ещё завезли реалтайм веб-поиск: модель сама уходит в интернет за актуальными данными, если они нужны для генерации — например, чтобы нарисовать точную погоду в конкретном месте или актуальный график. Генерация, кстати, до 10 секунд.
Цена API — $0,151 за изображение в 4K, вдвое дешевле Nano Banana Pro. В Google Flow генерация стала бесплатной для всех.
Попробовать можно в приложении Gemini или AI Studio — нужен иностранный IP.
🔗 Официальный анонс 🔗 Gemini 🔗 AI Studio
🔧 AI-инструменты и платформы
❯ Обновление no-code платформы Google Opal
Google Labs обновила конструктор воркфлоу Opal, добавив в него агентный шаг.
Раньше это был обычный drag-and-drop редактор: сам выбираешь модель, прописываешь последовательность шагов. Теперь можно добавить агента — он сам решает, какие инструменты вызвать и в каком порядке.
Нужно видео — подключит Veo, нужен ресёрч — пойдёт в веб-поиск, не хватает данных — спросит пользователя.
Вместе с агентным шагом появились: persistent memory — контекст сохраняется между сессиями, dynamic routing — условные ветки без кода, и human-in-the-loop — точки, где агент останавливается и ждёт проверки.
❯ Notion 3.3 — кастомные автономные агенты внутри воркспейса
Notion выпустила версию 3.3 с Custom Agents — автономными агентами, которые работают прямо внутри воркспейса без ручного промптинга.
Всё просто: задаёте задачу, триггер или расписание — дальше агент работает сам.
Автотриаж задач, ежедневные стендапы, внутренний Q&A, очистка инбокса. Агентов можно шарить в команде, настраивать права доступа и подключать к внешним сервисам — Slack, Figma и внутренним базам знаний Notion.
Notion уже сами используют 2 800 агентов внутри компании. Пользователи в раннем доступе создали больше 21 000.
До 3 мая 2026 функция бесплатна. После — потребляет Notion credits, которые докупаются к планам Business и Enterprise.
❯ В Claude Cowork добавили запланированные задачи и плагины
В Cowork добавили две новые функции: запланированные задачи и плагины.
Теперь Claude может выполнять повторяющиеся задачи по расписанию — утренние брифинги, еженедельные отчёты, обновления таблиц, пятничные презентации.
Управляется через боковую панель «Scheduled»: там же можно создавать, редактировать, ставить на паузу или запускать задачи вручную. Плагины добавляют экспертизу в дизайне, инженерии и аналитике.
Одно ограничение: задачи работают только при открытом приложении на включённом ПК. Функция доступна на платных планах.
🧩 AI в обществе и исследованиях
❯ Anthropic против Пентагона — отказ от сделки и статус угрозы нацбезопасности
24 февраля министр обороны США Пит Хегсет лично встретился с Дарио Амодеем и поставил ультиматум:
- либо Anthropic до 27 февраля снимает все ограничения на использование Claude в военных целях,
- либо компания получает статус «угрозы в цепочке поставок» — и с ней не смогут работать никакие государственные подрядчики.
Anthropic отказалась. Позиция компании: Claude не должен использоваться для массовой слежки за гражданами и управления автономным летальным оружием. Пентагон считает, что использование ИИ регулируется законами США, а не политикой компании.
Реакция последовала быстро. Трамп в Truth Social назвал Anthropic «левыми психами» и запретил использование Claude в любых государственных целях.
Министр обороны официально присвоил компании статус supply-chain risk — ранее такого удостаивались только фирмы из недружественных стран вроде Huawei.
Если решение устоит в судах, крупные облачные провайдеры, включая Amazon — ключевого партнёра Anthropic — могут быть вынуждены разорвать с ней контракты.
Волна поддержки Anthropic прокатилась по всей отрасли. Позицию компании публично поддержали Илья Суцкевер, Гэри Маркус и сотни других. Anthropic заявила, что будет судиться.
🔗 Axios
❯ OpenAI подписала военный контракт — и получила волну удалений
Через несколько часов после того, как Anthropic отказалась от сделки, OpenAI её подхватила. Альтман заявил, что контракт содержит «больше ограничений, чем любой предыдущий» — и те же «красные линии», на которых настаивал Амодей.
Но дьявол в деталях. Ограничения в контракте OpenAI просто ссылаются на действующее законодательство — без отдельных запретов, которых добивалась Anthropic. Разница принципиальная: Anthropic хотела запретить то, что закон пока разрешает.
Реакция пользователей была моментальная — массовые отмены подписок и удаления ChatGPT в США подскочили на 295% за сутки. Однозвёздочные отзывы в App Store выросли на 775%, пятизвёздочные упали вдвое. 96 сотрудников OpenAI подписали открытое письмо в поддержку позиции Anthropic — не конкурента, а именно его позиции.
1 марта Claude впервые обогнал ChatGPT по ежедневным скачиваниям в США и вышел на первое место в App Store в шести странах, включая Канаду и Германию.
Альтман начал тушить пожар: признал в CNBC, что «со стороны всё выглядело не очень», пообещал внести в контракт явный запрет на слежку за гражданами и заявил, что сядет в тюрьму, если OpenAI прикажут шпионить.
🔗 Axios 🔗 TechCrunch 🔗 CNBC
❯ Grok предсказал удар по Ирану и принял ИИ-фейк за реальное видео
24–25 февраля Jerusalem Post провела эксперимент: попросила Claude, Gemini, ChatGPT и Grok назвать конкретную дату возможного удара США по Ирану. Большинство моделей давали диапазоны — конец февраля, начало марта. Grok дважды назвал одну и ту же точную дату: субботу, 28 февраля, привязав её к итогам переговоров в Женеве.
Удары действительно начались в ночь на 28 февраля. Маск расхайпил кейс в X, заявив, что «способность предсказывать будущее — лучшая мера интеллекта». Эксперты охладили пыл: другие модели тоже называли очень близкие даты, окно было узким, так что попадание Grok — скорее удачное совпадение, чем реальная предиктивность.
Но это не всё. В соцсетях разошлось видео с якобы попаданием иранских ракет по Тель-Авиву. OSINT-сообщество быстро нашло типичные артефакты ИИ-генерации — искажённые флаги, здания, машины.
Пользователи X обратились к Grok за проверкой. Тот сначала подтвердил, что видео реальное, и лишь позже начал давать противоречивые ответы.
Люди, изначально подозревавшие фейк, ссылались на «подтверждение» от Grok — и продолжали распространять ролик. Авторы монетизировали вовлечение через revenue sharing на X.
После скандала платформа пообещала на 90 дней лишать монетизации за публикацию неотмеченных ИИ-видео о конфликтах.
❯ Тема выпуска: рождение компакт-диска
8 марта 1979 года инженеры Philips и Sony показали миру технологию, которая заставила нас забыть о карандашах для перематывания кассет.
Появление CD стало моментом «сингулярности» для медиа: музыка и данные превратились в последовательность нулей и единиц, считываемых лазером. Это напоминает нам о том, как важен стандарт — именно тогда человечество договорилось, как упаковывать смыслы в цифру.
Символично, что сегодня нейросети «разбирают» эти терабайты данных обратно на смыслы, но начиналось всё с маленького зеркального круга, который обещал нам вечное качество звука и будущее, сияющее всеми цветами спектра.
❯ Аудиоверсия дайджеста
❯ Заключение
На этой неделе больше внимания привлекла политика. Anthropic отказала Пентагону и получила статус угрозы нацбезопасности, а после OpenAI подписали сделку, но поплатились волной отмен подписок.
По моделям интересно: релиз GPT-5.3 и GPT-5.4, Gemini Flash-Lite за $0,25 за 1М токенов, и открытая серия Qwen3.5 Small для запуска на домашнем железе.
ИИ всё больше сам решает, когда действовать, кого слушать и что считать правдой. Агенты планируют задачи в Notion и пишут отчёты без напоминаний. Grok верит фейковому ИИ-видео, а Block увольняет 40% штата и впервые говорит об этом прямо.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
- Новости и события 27 феврМультиагентный Grok 4.20, ИИ-двойники от Pika, векторный Recraft V4 и отмена Gucci из-за ИИ
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя выдалась насыщенной: обновлённый Grok 4.20 с агентами, релизы мощных LLM от Google и Anthropic, генеративные модели для картинок и видео из Китая. Пока Gucci отменяют из-за ИИ-артов, OpenClaw удалил всю почту директора по ИИ-безопасности в Meta*****.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- Grok 4.20 в бете с командой из четырёх ИИ-агентов
- Claude Sonnet 4.6: 1М токенов и уровень Opus
- Gemini 3.1 Pro — Google опять в топе
- Mercury 2 — самая быстрая диффузионная LLM
*� Генеративные нейросети
- Reve v1.5: фотореализм и 4K-качество
- Recraft V4 с векторной графикой для дизайнеров
*� AI-инструменты и платформы
- Pencil — ИИ-Figma прямо в вашей IDE
- Perplexity: у нас есть OpenClaw дома
- Удалённый контроль с телефона в Claude Code
- Чёрное зеркало: технология ИИ-двойников от Pika
*� AI в обществе и исследованиях
- OpenClaw удалил почту директора по ИИ-безопасности Meta*
- Xbox случайно заспамил игроков ИИ-уведомлениями
- Отмена Gucci за использование нейроартов
- Мем: Сэм Альтман и Дарио Амодеи отказались держаться за руки
**** признана экстремистской и запрещена в РФ***
🧠Модели и LLM
❯ Grok 4.20 в бете с командой из четырёх ИИ-агентов
Компания xAI выкатила в открытую бету Grok 4.20 — новую версию своей модели с мультиагентной архитектурой. Теперь один запрос пользователя параллельно обрабатывают четыре независимых ИИ-агента. Новинка уже доступна в чат-боте на десктопе и в мобильном приложении.
У каждого агента в команде своя роль:
- Харпер ищет данные в сети,
- Бенджамин проверяет факты,
- Лукас отвечает за логику, а главный алгоритм
- Grok координирует их работу и собирает финальный ответ.
В процессе генерации агенты могут обмениваться информацией и проверять друг друга.
Модель принимает на вход текст, изображения и видео, а её контекстное окно вмещает 256 тысяч токенов.
Попробовать Grok 4.20 можно бесплатно, по лимитам — примерно 8 запросов за 5 часов.
Подобный мультиагентный подход ранее был доступен только в дорогих моделях по типу Grok 4 Heavy и цене от $200. Теперь полная версия Grok 4.20, вероятно, войдёт в подписку за $30. Похожие системы есть у GPT-5.2 Pro и Gemini 3 Deep Think, — но xAI первыми сделали её массовой.
❯ Claude Sonnet 4.6: миллион токенов и уровень Opus
Anthropic выпустила Claude Sonnet 4.6. Модель вплотную приблизилась к флагманской Opus 4.6, при этом она на 40% дешевле и уже доступна всем, включая бесплатный тариф.
Главная фишка — «компьютерное зрение» и управление. Модель работает с интерфейсами программ как человек: сама кликает мышкой, заполняет веб-формы и переключается между вкладками. Можно поручить сложные офисные задачи в Chrome или Excel.
Что ещё нового:
- Контекстное окно до 1 млн токенов. Позволяет анализировать огромные объёмы данных, например, всю кодовую базу проекта.
- Улучшенная работа с кодом. Модель стала более последовательной, реже ленится и лучше справляется с рефакторингом. В ряде бенчей обгоняет Opus 4.5.
- Высокая интеллектуальная честность. В тесте Bullshit Benchmark модель показала лучший результат в 94,5%, отказываясь поддерживать бессмысленные или абсурдные запросы.
Sonnet 4.6 уже интегрирована в Perplexity и стала моделью по умолчанию в Claude Code, Cowork и на сайте claude.ai.
🔗 Официальный анонс 🔗 Попробовать в Claude
❯ Gemini 3.1 Pro — Google опять в топе
Google обновили Gemini 3.1 Pro: исправили галлюцинации и нерабочий веб-поиск. Модель значительно прибавила в кодинге, логике и агентных задачах, по ряду тестов обходит GPT-5.2 и Claude Opus 4.6.
Главный прорыв в логике: на бенчмарке ARC-AGI-2, где нужно находить новые закономерности, модель набрала 77,1%, это в два раза больше, чем у Gemini 3 Pro с 31,1%.
Поиск тоже прокачали: в тесте BrowseComp, где имитируется сложный поиск информации, Gemini 3.1 Pro показала 85,9%, обойдя Opus 4.6 с 84,0%.
Ещё 3.1 Pro с одного промпта генерирует анимированные SVG, создаёт 3D-визуализации и пишет готовые рабочие приложения.
Gemini 3.1 Pro уже доступна бесплатно в приложении Gemini и в AI Studio.
❯ Mercury 2: самая быстрая ризонинг LLM
Стартап Inception представил Mercury 2 — самую быструю на сегодня reasoning-модель.
У неё диффузионная архитектура: текст генерируется не токен за токеном, а целиком. Mercury 2 сходу набрасывает ответ из шума, постепенно уточняя его.
Из-за этого у неё бешеная скорость в 1009 токенов в секунду на NVIDIA Blackwell, что в 5–7 раз быстрее аналогов вроде Claude Haiku 4.5. По качеству модель сопоставима с GPT-5 mini.
Такая скорость критически важна для задач, где задержка ломает весь процесс:
- Автодополнение кода и рефакторинг в реальном времени
- Работа ИИ-агентов, которые могут совершать больше итераций для планирования и проверки
- Голосовые ассистенты, где важна естественность разговора
- Поисковые системы и RAG-пайплайны
Модель уже можно бесплатно потестить в чате.
🔗 Попробовать Mercury 2 🔗 Технический блогпост
🎨 Генеративные нейросети
❯ Обновление Reve v1.5: фотореализм и 4K-качество
После почти года затишья генератор изображений Reve обновился до версии v1.5 и сразу занял третье место в рейтинге AI Arena, уступив лишь Nano Banana Pro и GPT Image 1.5.
Прокачали качество и детализацию. Картинки в нативном 4K, используя рендеринг в пиксельном пространстве, что позволяет избежать потери четкости. Лучше мелкие текстуры, сложные сцены и светопередача. Корректно работает с текстом, в том числе на кириллице.
Есть точечное редактирование, можно выделить объект и изменить его отдельным промптом.
🔗 Попробовать Reve v1.5 🔗 Официальный анонс
❯ Recraft V4: генератор векторных картинок
Вышла Recraft V4 — модель для генерации изображений, которая умеет в редактируемый SVG-вектор. Доступна в двух версиях: V4 для быстрых эскизов до 10 секунд и V4 Pro для детализированных изображений высокого разрешения, готовых к печати.
Recraft V4 создаёт довольно чистые SVG-файлы со слоями, которые можно редактировать в Figma или Adobe Illustrator. Идеально для создания логотипов, иконок и сложной типографики.
Попробовать Recraft V4 можно бесплатно, сейчас дают 50 кредитов в день. Также доступно API через партнёров.
🔗 Официальный анонс 🔗 Попробовать Recraft V4
❯ Seedream 5.0 Lite: генерация с веб-поиском
ByteDance расширили линейку и выпустили облегчённую Seedream 5.0 Lite. Главный упор сделан на стабильность генераций и точное следование промпту благодаря встроенному поиску в интернете.
Идеально подходит для создания серий изображений, где нужно сохранить персонажа консистентным или выдержать единый стиль — например, для рекламных кампаний или брендированных материалов.
Стоимость по API — $0.035 за изображение, дешевле предыдущей версии. Новым пользователям дают бесплатный тестовый период.
🔗 Попробовать Seedream 5.0 Lite 🔗 Официальный анонс
🔧 AI-инструменты и платформы
❯ Pencil — ИИ-Figma, которая дизайнит за вас
Появился Pencil — ИИ-агент, который генерирует UI-дизайн прямо внутри IDE, такой как VS Code или Cursor.
Вместо статичных макетов он создаёт сразу готовый фронтенд на HTML, CSS или React, который хранится в вашем Git-репозитории. Есть импорт из Figma с переносом всех векторов и экспорт в PDF.
Недавно в Pencil добавили SWARM Mode: теперь несколько ИИ-агентов могут одновременно работать над разными экранами вашего проекта, что значительно ускоряет процесс: пока один агент рисует лендинг, второй набрасывает дашборд.
Pencil не привязан к одной нейронке — он работает с Claude Code, Copilot и Gemini-инструментами как единый дизайн-слой. Есть так же версии для Mac и Linux.
Pencil быстро набрал 100 тысяч пользователей за пять месяцев. Пока идёт ранний доступ, пользоваться можно бесплатно.
❯ Perplexity Computer — у нас есть OpenClaw дома
Perplexity выпустили Perplexity Computer — свой OpenClaw. Даёте одну большую цель, а система сама разобьёт её на подзадачи и назначит разным агентам.
Perplexity Computer мультимодельная — то есть сама решает, какому ИИ поручить ту или иную работу: для глубокого анализа данных может задействовать Gemini, для работы с большим контекстом — Claude Opus, а для быстрых задач — Grok. Всего на выбор 19 моделей.
Агенты работают параллельно: один собирает данные, второй пишет отчёт, третий обращается к API подключённых сервисов, таких как Gmail, Notion или Canva.
Perplexity Computer работает в изолированной песочнице, что исключает случайное удаление данных или другие сбои.
Пока что функция доступна только подписчикам тарифа Perplexity Max.
🔗 Официальный анонс 🔗 Perplexity Computer
❯ Удалённое управление прямо с телефона в Claude Code
В Claude Code появилась функция удалённого управления. Теперь можно запустить сложную задачу на рабочем компьютере, а затем контролировать её выполнение с телефона — например, по дороге на встречу или во время прогулки.
Работает это просто:
- Запускаете сессию на ПК командой claude remote-control
- Сканируете QR-код через мобильное приложение Claude
- Получаете полный контроль над процессом
С телефона можно дописывать промпты, одобрять изменения в файлах, прерывать выполнение команд и отслеживать статус. В отличие от неофициальных решений, это нативная и безопасная функция с end-to-end шифрованием.
Пока что фича доступна в режиме Research Preview для подписчиков тарифа Max, но скоро её обещают добавить и для Pro-пользователей.
❯ Чёрное зеркало: технология ИИ-двойников от Pika
Pika Labs анонсировали AI Selves — сервис для создания автономных цифровых копий. То есть полноценных двойников с вашим голосом, характером и долгосрочной памятью.
Чтобы «родить» клона, достаточно загрузить селфи, записать аудио и пройти короткий тест на личность.
После ИИ-двойника можно подключить к Telegram, WhatsApp, Slack и другим мессенджерам. Он сам будет отвечать коллегам, вести соцсети, звонить людям и даже зарабатывать на рекламе от вашего имени.
Все права на сгенерированный контент остаются у вас, а ваши данные не идут на обучение чужих моделей.
Из ограничений: клонам запретили давать медицинские, финансовые и юридические советы, а на весь визуал вешается водяной знак.
Пока сервис находится в закрытом доступе. На этапе ранней беты все функции будут бесплатными.
🧩 AI в обществе и исследованиях
❯ ИИ снёс почту директора по безопасности Meta*
Саммер Юэ отвечает за безопасность ИИ в Meta*. Она поручила агенту OpenClaw разобрать свой личный Gmail.
По сути, бот должен был только предложить, что отправить в корзину, но в итоге начал удалять все письма подчистую.
Всё из-за переполнение контекста. Ящик оказался огромным, и при саммари контекста алгоритм просто забыл стартовую инструкцию ждать аппрува.
На отчаянные команды остановиться в Telegram бот не реагировал. Девушке пришлось бежать к Mac mini и убивать процессы через диспетчер задач. Итог: минус 200 писем.
После перезапуска агент извинился и сам прописал себе правило больше не заниматься автономной чисткой.
Иронично, что жертвой стала именно глава отдела по контролю над нейросетями. Сама девушка сказала, что совершила ошибку новичка, дав агенту слишком много доступа.
** признана в РФ экстремистской и запрещена*
❯ Xbox заспамил игроков тестовыми пушами от ИИ
Разрабы случайно завалили игроков десятками уведомлений:
«Это тестовое сообщение, отправленное через Braze...»
Braze — это ИИ-платформа, которая доставляет пользователям целевые и персонализированные уведомления.
В Microsoft уже извинились и устранили проблему. По их словам, приложение «слишком воодушевилось» тестовыми сообщениями.
🔗 Источник
❯ Gucci отменяют из-за сгенерированной нейросетью рекламы
В Gucci получили волну хейта за анонс своего показа на Неделе моды в Милане. Компания выложила в X ИИ-арты, честно предупредив об использовании нейросетей, но от гнева аудитории это не спасло.
В комментариях бренд сравнивают с масс-маркетом и обвиняют в «убийстве наследия». Репост с фразой «любой люкс, использующий ИИ-слоп, перестаёт быть люксом» собрал 60 тысяч лайков — это в сто раз больше, чем у оригинальной публикации Gucci.
В 2025 году выручка Gucci рухнула на 22%, показав худший результат среди всех брендов группы Kering. Эксперты считают замену живых фотографов на алгоритмы намеренной «культурной провокацией» ради привлечения внимания перед показом.
Если целью был хайп, то план сработал, вот только восстановить репутацию теперь будет сложно.
❯ Мем дня: Сэм Альтман и Дарио Амодеи отказались держаться за руки
На саммите India AI Impact в Нью-Дели произошёл неловкий момент: главы OpenAI Сэм Альтман и Anthropic Дарио Амодеи отказались взяться за руки для общего фото.
Премьер Индии Нарендра Моди предложил лидерам ИИ-индустрии продемонстрировать солидарность. И пока Сундар Пичаи, Демис Хассабис и сам Моди держались за руки, Альтман и Амодеи демонстративно подняли их вверх, так и не прикоснувшись друг к другу.
Причина — конфликт в публичном поле. Недавно Anthropic выпустила серию роликов, высмеивающих планы OpenAI добавить рекламу в ChatGPT, и подчеркнула, что в Claude её не будет.
Саммит запомнился и другими событиями: Билл Гейтс отменил выступление из-за публикации новых документов по делу Эпштейна, а Дженсен Хуанг не приехал из-за болезни. Тем временем Эммануэль Макрон заявил, что ЕС продолжит формировать свои «правила игры» в сфере ИИ.
❯ Тема недели: релиз Pokémon Red и Green
27 февраля 1996 года мир узнал, что карманные монстры могут быть круче реальных домашних животных. Релиз Pokémon на Game Boy доказал: социальный капитал и обмен данными значат больше, чем терафлопсы графики.
Сегодня этот культурный код коллекционирования и эволюции идеально ложится на ландшафт ИИ. Мы больше не ищем Пикачу в высокой траве — мы ищем идеальные промпты.
Символично, что спустя 30 лет наша главная задача осталась прежней: собрать идеальную команду, теперь уже ИИ-агентов. Обучить их и заставить эффективно взаимодействовать в одной связке. Похоже, профессор Оук был первым промпт-инженером в истории.
❯ Аудиоверсия дайджеста
❯ Заключение
На этой неделе громче всего обсуждали новые LLM: Google, Anthropic и xAI выкатили мощные апдейты Gemini, Claude и Grok. Тем временем релизнулись хорошие генеративки из Китая — Recraft и Reve.
Мы движемся от чат-помощников к автономным исполнителям. ИИ-двойники готовятся вести наши соцсети и общаться за нас, умные агенты случайно сносят рабочие почты топ-менеджерам, а нейросети провоцируют скандалы вокруг люксовых брендов вроде Gucci.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
До встречи в следующем выпуске!
- Бизнес и автоматизация 24 феврЗолотая жила для фрилансеров Excel
Читать далееВместо продажи разовых услуг вы создаёте готовую систему: курсы для Tilda/WordPress, шаблоны контент-планов в Excel.
Партнёры получают доступ к вашей модели, зарабатывают 30-50% от продаж без офисов, вложений и ежедневной рутины. Это не франчайзинг с роялти, а лёгкий партнёрский доступ — токен в GitHub для конфигов, дашборд для кастомизации текстов, пассивный доход для вас.
Реальный кейс: специалист из Питера запустил сеть на SaaS-виджетах (скидки, попапы, таймеры). Партнёры подключают одну строку кода
<script src="forkpack.ru/cdn?apiKey=xxx"></script>, виджеты рендерятся автоматически.За год — 700к руб чистыми без личных продаж.
Клиенты: 50+ Tilda-сайтов, партнёры берут 40% комиссии, вы — остальное.
Масштаб через Telegram-каналы: мини-посты с кейсами генерируют 10-20 лидов в неделю.
Как продавать именно таблицы Excel? Это золотая жила для фрилансеров в нише “фричайзинг контента”. Создайте шаблон контент-плана (дата, тема, канал, статус, метрики, крючки) — как в нашей таблице выше.
Упакуйте в продукт:
- Прямые продажи: Gumroad/Boosty за 990 руб. “Готовый контент-план на 3 месяца для фричайзинга — 90 идей постов + автоматизация”. Добавьте бонус: скрипт для импорта в Notion.
- Фричайзинг-модель: Продавайте партнёрам за 5к руб доступ к мастер-шаблону + брендированным версиям. Они адаптируют под свои ниши (SaaS, фитнес, локализация для Китая), берут 50% с клиентов. Выдавайте токены GitHub для обновлений шаблона.
- Автоматизация: Интегрируйте в ваш SaaS-дашборд — клиент заходит, генерирует таблицу под тему, скачивает Excel/CSV. Цена: 299 руб/мес за “Контент-бот с планами”.
- Партнёрки: Telegram-каналы фрилансеров, курс “Контент-планы под ключ”. 30% комиссии партнёрам, трафик из постов.
Шаг 1: Создайте продукт — шаблон Excel с 50+ идеями для фричайзинга (виджеты, кейсы, локализация).
Шаг 2: Настройте партнёрку — GitHub-репо с true/false конфигами виджетов.
Шаг 3: Масштабируйте через Telegram мини-постами: “Таблица, которая дала 700к руб контента — шаблон в био”.
- Бизнес и автоматизация 24 феврПревратил одиночный фриланс в мощную партнерскую экосистему
Читать далееСергей из Питера превратил одиночный фриланс в мощную партнерскую экосистему на базе digital-инструментов. За год это дало ему стабильный доход в 500+ тыс. руб. без ежедневных продаж.
Выбор нишевых партнеров
Он тщательно подбирал специалистов: SMM-экспертов, Tilda-интеграторов и дизайнеров для e-com и фитнес-проектов — с проверкой по отзывам.
Создана “реферальная матрица”: чат-боты к одному, SEO к другому, чтобы избежать хаоса.
Правила и бонусы
Комиссия 15–25% за клиента, выплаты ежемесячно через Telegram-бот.
Введены плюшки: совместные стримы по дропшиппингу и лидерборд с призами вроде доступов к курсам.
Рост через сообщество
Telegram-канал “Digital Net СПб” с 500+ юзерами раздает бесплатные Tilda-шаблоны и кейсы — воронка: шаблон → опрос → инвайт.
Продвижение VK-фриланс-группы, Rutube-ролики о пассивке и посты с таргетом на СПб.
Переход к фричайзингу
Теперь рутина на автопилоте: партнеры за 50 тыс. руб. берут пакет с CRM-дашами, промо-ботами и брендом — 10% роялти, расширение в регионы и Азию без усилий Сергея.
70% лидов — органика от сети. Идеал для фрилансеров в SaaS-нишах.
- Новости и события 21 феврКитайские GLM-5 и Qwen 3.5, музыкальный генератор Lyria 3, создатель OpenClaw в OpenAI и скандал с Claude и Пентагоном
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя выдалась насыщенной: китайцы выкатили GLM-5 для агентных задач и Qwen 3.5 с пониманием изображений, ByteDance представила новую видеомодель, а Meta запатентовала ИИ для ведения аккаунтов после смерти. Ещё Создатель OpenClaw перешёл в OpenAI, а кризис уже добрался до HDD.
Всё самое важное — в одном месте. Поехали!
*� В этом выпуске:
*� Модели и LLM
- GLM-5 — обновлённый флагман от Z.ai для агентов и кодинга
- Qwen 3.5 — мультимодальная открытая модель от Alibaba
- MiniMax M2.5 — тихий релиз от Minimax
*� Генеративные нейросети
- BitDance: быстрый генератор картинок от создателей TikTok
- FireRed-Image-Edit-1.0 — редактор изображений
- Lyria 3 — генератор музыки по картинкам от DeepMind
*� AI-инструменты и платформы
- Cline CLI 2.0 — агентная CLI
- Manus в Telegram — ИИ-агент теперь в мессенджере
- Triall.ai — платформа, где нейронки спорят
*� AI в обществе и исследованиях
- Claude помогал США в захвате Мадуро
- Кризис добрался до HDD
- Создатель OpenClaw присоединился к OpenAI
- Meta запатентовала ИИ для ведения аккаунтов после смерти
🧠Модели и LLM
❯ GLM-5 — обновлённый флагман от Z.ai для агентов и кодинга
Z.ai представила GLM-5 — свою новую флагманскую модель. Она уже заняла первое место среди open-source решений в задачах на логику, программирование и работу с агентами. Модель распространяется по свободной лицензии MIT.
По тестам, GLM-5 показывает высокие результаты: 77.8 на SWE-bench (решение задач с GitHub) и 56.2 / 60.7 на Terminal-Bench 2.0. В симуляции управления бизнесом Vending Bench 2 модель почти догнала Claude Opus 4.5, закончив с балансом $4,432. Это показывает сильные навыки в долгосрочном планировании.
Ключевой упор — на агентные задачи. Фишка модели — умение создавать готовые документы: .docx, .pdf и .xlsx. В специальном «Agent Mode» она напрямую работает с таблицами, текстами и презентациями.
Есть и минусы. GLM-5 требовательнее к ресурсам, чем конкуренты. По тестам Artificial Analysis, она на 30% дороже в использовании, чем Kimi K2.5, из-за высокого потребления памяти. Сами Zhipu жалуются на нехватку мощностей, поэтому модель адаптировали для работы на чипах не только NVIDIA, но и Huawei Ascend, Moore Threads и других китайских производителей.
🔗 Попробовать 🔗 Блогпост 🔗 Hugging Face 🔗 GitHub 🔗 API
❯ Qwen 3.5 — мультимодальная открытая модель от Alibaba
Alibaba представила Qwen3.5 — новую мощную open-source модель под свободной лицензией Apache 2.0. Главная фишка — нативная мультимодальность: модель обрабатывает текст, изображения и видео до 2 часов за раз, а ещё генерирует картинки прямо в чате.
По тестам, Qwen3.5 идёт наравне с GPT-5.2, Claude Opus 4.5 и Gemini 3 Pro. Она особенно сильна в визуальных задачах и следовании инструкциям, но пока уступает лидерам в кодинге и математике.
Основной упор сделан на агентных возможностях. Qwen3.5 может управлять графическим интерфейсом смартфона или компьютера, выполняя задачи по текстовому описанию — например, заполнить таблицу в Excel или найти нужную функцию в приложении.
Модель в 6-9 раз быстрее предшественника и дешевле в использовании. Plus-версия в чате поддерживает контекст до 1 миллиона токенов.
🔗 Блогпост 🔗 Qwen Chat 🔗 Hugging Face 🔗 Github
❯ M2.5 — тихий релиз от Minimax
Китайцы из MiniMax релизнули модель M2.5, которую уже успели прозвать «убийцей дорогих агентов». Главная её фишка — она очень дешёвая, при этом производительная.
На тестах модель показывает себя на уровне конкурентов: 80.2% на SWE-Bench, 76.3% на BrowseComp и 76.8% на BFCL. API стоит $0.3/$1.2 за миллион токенов против $1/$3.2 у той же GLM-5.
Веса пока не выложили, но обещают скоро это исправить.
🔗 Agent Mode 🔗 Блогпост 🔗 API
🎨 Генеративные нейросети
❯ BitDance: сверхбыстрый генератор картинок от создателей TikTok
ByteDance представили BitDance — новую open-source модель для генерации изображений. Это авторегрессионный генератор, засчёт чего у неё сильное понимание сложных и детальных промптов.
Главная фишка — она очень быстрая, всё благодаря технологии Next-Patch Diffusion, которая предсказывает до 64 токенов параллельно. BitDance генерирует изображения в 30-37 раз быстрее других авторегрессионных моделей.
По качеству модель на уровне с FLUX.1-Dev и Stable Diffusion 3. Однако, есть минус: веса модели занимают 34 ГБ, так что запустить её локально смогут не все.
🔗 Официальный сайт 🔗 Демо и галерея 🔗 Hugging Face 🔗 GitHub
❯ FireRed-Image-Edit-1.0 — open-source редактор изображений
Китайский стартап FireRed выпустил FireRed-Image-Edit 1.0 — мощную open-source модель для редактирования изображений. Умеет добавлять и удалять объекты, менять фон, стиль и делать сложные гибридные правки.
Главная особенность — сохранение текста. Модель точно воспроизводит надписи на вывесках и логотипах, не искажая их, как многие другие редакторы. Также FireRed-Image-Edit хорошо реставрирует старые фото и поддерживает работу с несколькими изображениями, например, для виртуальной примерки одежды.
На бенчмарках REDEdit-Bench и GEdit, модель стала лучшей среди открытых решений, обойдя Qwen-Image-Edit и FLUX.2. Доступа по лицензии Apache 2.0.
🔗 Демо на HF 🔗 Hugging Face 🔗 Github
❯ Lyria 3: генератор музыки из картинок прямо в Gemini
Google DeepMind запустила Lyria 3 — новый генератор музыки, который теперь доступен прямо в Gemini. Модель мультимодальная: она создаёт треки не только по тексту, но и на основе загруженной картинки или видео.
Модель выдаёт 30-секундные треки, сама генерирует подходящий текст и вокал. Вдобавок, для каждого трека создаётся уникальная обложка с помощью Nano Banana. Модель работает на 8 языках, но русского пока нет. На каждую композицию ставится невидимый водяной знак SynthID.
🔗 Попробовать 🔗 Блогпост
🛠️ AI-инструменты и платформы
❯ Cline CLI 2.0: команда AI-агентов в вашем терминале
Вышла Cline CLI 2.0 — open-source инструмент, который позволяет запускать AI-агентов для программирования прямо в командной строке.
Инструмент бесплатный и поддерживает параллельных агентов, то есть можно одновременно запустить несколько ИИ-помощников для разных задач: один будет исправлять баги, второй — проводить рефакторинг, а третий — писать тесты.
Инструмент предоставляет ограниченный бесплатный доступ к мощным моделям, таким как Minimax M2.5 и Kimi K2.5, без необходимости вводить API-ключи. Также есть headless-режим для интеграции в CI/CD и поддержка любых редакторов кода.
❯ AI-агент Manus теперь в Telegram
Manus, который недавно приобрела Meta, теперь официально работает в Telegram. Это официальный бот, который поможет в разных задачах: от исследования и обработки файлов до создания отчётов в PDF.
Агент понимает голосовые сообщения, работает с фото и файлами, а также подключается к вашим сервисам вроде Google Календаря и Notion. Многие находят схожесть проекта с OpenClaw, только это более простое и готовое к использованию решение.
Подключить агента можно через QR-код в личном кабинете Manus. Есть бесплатный тариф с ежедневными лимитами, которого хватит, чтобы протестировать основные возможности.
❯ Triall: нейросети спорят друг с другом для проверки фактов
Разработчик с Reddit создал сервис Triall, который борется с фейками в ответах ИИ с помощью научных дебатов между чат-ботами.
Пока одна модель генерирует ответ, другие проверяют факты, логику и стиль, выставляя оценки. Этот процесс повторяется в несколько раундов, и на выходе пользователь получает выверенный текст с историей правок.
Сервис может пригодиться для подготовки обзоров, дипломных и курсовых работ — итоговый результат можно выгрузить в PDF вместе с проверенными ссылками.
🔗 Попробовать Triall 🔗 Обсуждение на Reddit
🧩 AI в обществе и исследованиях
❯ Claude помогал США захватить президента Мадуро
Пентагон использовал нейросеть от Anthropic для захвата президента Венесуэлы.
По данным WSJ, Claude помогал военным планировать высадку и координировать действия в активной фазе рейда.
Нюанс в том, что Anthropic запрещает использовать свои модели для насилия и слежки. Для обхода этих ограничений военные работали через платформу Palantir, давнего партнёра Пентагона.
Сейчас Минобороны США даже думает разорвать с ними контракт на $200 млн из-за возникших споров.
🔗 The Wall Street Journal 🔗 Ground News
❯ Western Digital: все жёсткие диски распроданы из-за бума ИИ
Крупнейший производитель HDD заявил, что все мощности компании на 2026 год уже распроданы крупным клиентам. Всё из-за взрывного спроса на постройку дата-центров.
По сути, на долю обычных пользователей остаётся минимальный объём дисков. Сейчас около 89% выручки WD от HDD приходится на корпоративных клиентов, и только 5% — на розничный рынок.
Аналитики предупреждают, что обычным пользователям стоит готовиться ещё и к дефициту и росту цен на жёсткие диски.
🔗 Wccftech 🔗 Обзор ситуации на Ground News
❯ Создатель OpenClaw перешёл в OpenAI
Создатель нашумевшего OpenClaw присоединился к команде OpenAI. Он возглавит разработку нового поколения AI-агентов, а идеи OpenClaw лягут в основу будущих продуктов компании.
Сам Штайнбергер объяснил свой переход желанием «изменить мир, а не строить большую компанию», назвав сотрудничество с OpenAI самым быстрым способом сделать свои разработки доступными для всех.
При этом проект OpenClaw останется с открытым исходным кодом, а OpenAI будет его поддерживать.
🔗 Анонс Альтмана 🔗 Пост Питера Штайнбергера
❯ Meta* запатентовала «цифровое бессмертие» в соцсетях
Meta* получила патент на технологию, которая позволит ИИ вести ваш аккаунт в соцсетях после вашей смерти. Нейросеть будет обучаться на ваших постах, лайках и комментариях, чтобы имитировать ваш стиль общения, отвечать друзьям и поддерживать эффект присутствия.
Официальная версия — забота о близких, которые будут скучать. Однако многие увидели в этом циничный способ удержать охваты и прямое воплощение в жизнь идей из сериала «Чёрное зеркало». В самой Meta* заявляют, что планов по развитию технологии у них пока нет.
*признана в РФ экстремистской организацией и запрещена
❯ Тема недели: релиз первой The Legend of Zelda
21 февраля 1986 года в Японии состоялся релиз первой части The Legend of Zelda для системы Famicom Disk System.
Мир увидел Хайрул — первый по-настоящему открытый нелинейный мир в истории консольных игр. Сигэру Миямото создал формулу «приключения в кармане», введя систему сохранений и возможность исследовать карту в любом порядке.
Релиз The Legend of Zelda навсегда изменил геймдизайн, подарив игрокам свободу воли и радость открытия. Сегодня мы переживаем похожее время, время нейросетей. И если раньше мы искали секретные комнаты, взрывая стены бомбами, то теперь мы подбираем идеальные промпты, чтобы открыть двери в новые измерения креативности.
Символично, что в этом цифровом квесте главным артефактом становится не меч, а умение задавать правильные вопросы.
❯ Аудиоверсия дайджеста
❯ Заключение
На этой неделе снова больше всего релизов из Китая: GLM-5, Qwen3.5 и Minimax M2.5 показали, что готовы на равных конкурировать с западными моделями. Тем временем OpenAI переманила к себе создателя OpenClaw, а Google и ByteDance выпустили мощные генеративные модели.
Мы движемся от чат-помощников к автономным исполнителям. ИИ становится участником военных операций, провоцирует дефицит комплектующих для ПК и даже готовится жить в соцсетях после нашей смерти.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
До встречи в следующем выпуске!
- ИИ в обществе 14 феврФрилансер строит партнерскую сеть
Читать далееФрилансер по digital-маркетингу из Санкт-Петербурга решил масштабировать услуги через партнеров, создав сеть из 10–15 специалистов. Его зовут Сергей, и он начал с шаблонов для лендингов, предлагая коллегам 20% от сделок за рефералов. За год сеть принесла ему 500 тыс. руб..
Шаг 1: Выбор партнеров
Сергей отобрал коллег с сильными кейсами: UX-дизайнеров, SMMщиков, разработчиков на Tilda. Критерии — репутация, взаимность, нишевые экспертизы вроде фитнеса или e-commerce.
Составил карту: “SEO-запросы — к Ивану, лендинги — к Марине”.
Шаг 2: Условия сотрудничества
Договорился о 15–25% комиссии за приведенного клиента, фиксированные выплаты по факту. Создал общий чат в Telegram для обмена лидами и шаблонами.
Добавил бонусы: совместные вебинары по дропшиппингу для привлечения трафика.
Шаг 3: Формирование сообщества
Сергей запустил Telegram-канал “Digital Партнеры СПб” с 500+ участниками — бесплатные шаблоны Tilda, кейсы успеха и челленджи вроде “Приведи лид — получи 5% бонус”. Еженедельные AMA-сессии мотивировали делиться контактами, превращая чат в лояльное сообщество для обмена лидами.
Шаг 4: Поиск подписчиков для сети
Через VK-группы по фрилансу (типа “Фриланс для новичков”), Rutube-видео о “пассивном доходе на шаблонах” и посты на VC.ru привлекал фрилансеров. Предлагал “вход в сеть бесплатно за первый реферал”, таргет на СПб и регионы с интересом к e-commerce.
Воронка: лидмагнит (бесплатный шаблон) → опрос → приглашение в чат.
Шаг 5: Масштаб и удержание
Сообщество само росло: партнеры приглашали знакомых, Сергей ввел геймификацию — топ-5 по лидам получали премиум-доступ к курсам. Теперь сеть генерирует 70% лидов органически, фокус на нишах дропшиппинг и SaaS.
Теперь всю эту рутину можно автоматизировать через восточную бизнес-модель фричайзинга: партнеры покупают “пакет” за 50 тыс. руб. (доступ к шаблонам, скриптам, бренду сети) и получают автоматизированные инструменты — боты для лидогенерации, CRM с партнерскими дашбордами и готовые промо-кампании. Фричайзи работают под ключом, платя 10% роялти, а Сергей масштабирует сеть по фричайзингу в регионы без личного участия.
Партнерская сеть через сообщество и фричайзинг — ключ к устойчивому росту без бюджета на рекламу.
- Новости и события 13 феврБитва титанов Claude 4.6 и GPT-5.3, скандалы на Олимпиаде, релизы из Китая и теория заговора ИИ
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя выдалась насыщенной: битва титанов Anthropic и OpenAI — компании выпустили Claude Opus 4.6 и GPT-5.3 Codex почти одновременно. Куча генеративных моделей для картинок и видео из Китая, а на Олимпиаде разразился скандал из-за нейрослопа.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- Claude Opus 4.6 — новый флагман от Anthropic
- GPT-5.3 Codex — ответ OpenAI с упором на агентов
- Тихое обновление DeepSeek — контекст до 1 млн токенов
*� Генеративные нейросети
- Обновление Qwen Image 2.0
- Seedream 5.0 — генератор картинок с веб-поиском
- Seedance 2.0 — 2K видео до 15 секунд
*� AI-инструменты и платформы
- Консилиум моделей в Perplexity
- Figma превращает растр в вектор
*� AI в обществе и исследованиях
- ИИ-катастрофа — новая теория заговора из Twitter
- Скандалы с ИИ на Олимпиаде-2026
- Руководство от Сбера по обучению роботов
- Гений обманул чат-бота и получил скидку 80%
🧠Модели и LLM
❯ Opus 4.6 — Anthropic снова бьёт рекорды
Anthropic выпустила Claude Opus 4.6 — новую флагманскую модель с фокусом на агентные сценарии.
Контекстное окно расширили до 1 миллиона токенов, а точность извлечения данных составила 93% для 256 тыс. токенов и 75% для 1 млн.
Результаты на тестах смешанные: SOTA в бенчмарках HLE и ARC-AGI 2, 81,4% на SWE-bench, а на MCP-Atlas результат в 59,5% оказался ниже, чем у Opus 4.5 с её 62,3%
Вместо старых бюджетов на размышления появилась функция Adaptive Thinking — теперь модель сама определяет сложность задачи и распределяет ресурсы.
Также в Claude Code внедрили функции с параллельными субагентами и режим Delegate mode, где основной агент только управляет задачами.
Самые интересные кейсы с моделью:
- Разработка ПО. 16 параллельных агентов Opus 4.6 написали на Rust компилятор языка C, способный собрать Doom.
- Кибербезопасность. Модель обнаружила**** 500+ уязвимостей в опенсорс-проектах, имитируя действия исследователя.
- Обман ради выгоды. В бизнес-симуляции Vending-Bench модель достигла рекордной прибыли в $8017, прибегая к обману, картельному сговору и лжи поставщикам.
🔗 Блогпост 🔗 О функции Compaction 🔗 Доки по Agent Teams и Delegate mode 🔗 Кейс с написанием компилятора C 🔗 Настраиваемые уровни усилий
❯ GPT-5.3 Codex — ответ OpenAI с упором на агентов
OpenAI ответила на релиз Anthropic почти сразу, представив GPT-5.3 Codex. Модель тоже заточена под агентов и автономную работу. Уже доступна в приложении Codex, CLI и IDE-расширениях для платных пользователей.
На бенчмарках она сразу стала лидером:
- в тесте Terminal-Bench 2.0 на навыки работы в командной строке, Codex набрал 77.3% против 65.4% у Opus 4.6.
- на OSWorld-Verified, где ИИ управляет интерфейсом ОС, результат вырос с 38% до 64.7%.
- ещё модель установила новый рекорд в бенчмарке на исправление ошибок в коде SWE-Bench Pro в 56.8%.
Codex позиционируют как «интерактивного сотрудника»: он может выполнять задачу, параллельно обсуждая подходы и позволяя корректировать себя на лету.
Это первая модель, которая помогала создавать саму себя: участвовала в отладке, управлении развёртыванием и диагностике тестов. GPT-5.3 Codex на 25% быстрее и тратит вдвое меньше токенов, чем прошлая GPT-5.2 Codex в тех же задачах.
🔗 Официальный блог-пост OpenAI
❯ Тихое обновление DeepSeek
Китайцы без анонсов обновили свою модель в чат-боте. Контекстное окно увеличили с 128 тысяч до 1 миллиона токенов, а база знаний теперь актуальна на май 2025 года.
Официального релиза V4 не было, но сам чат-бот называет себя последней версией перед официальным выходом V4.
Свежая DeepSeek уже сопоставима с Gemini 3 Pro: во внутренних тестах она превосходит GPT и Claude в программировании. Но при полной загрузке контекста модель работает медленнее и может терять детали.
Обновление вышло на фоне предпраздничной гонки китайских ИИ-лабораторий вроде Zhipu, Alibaba и ByteDance в преддверии Лунного Нового года.
🎨 Генеративные нейросети
❯ Обновление Qwen Image 2.0
Alibaba обновили Qwen Image 2.0. Новая версия объединила в себе модели для генерации и редактирования. При архитектуре всего в 7 миллиардов параметров модель генерирует изображения в разрешении 2048×2048 за несколько секунд.
Главная фишка — поддержка промптов до 1000 токенов. Можно создавать сложные сцены, инфографику, постеры и комиксы. Модель отличается качественной работой с текстом и высокой детализацией.
Qwen Image 2.0 уже доступна бесплатно для теста в Qwen Chat. Веса для локального запуска пока не выложены, но веса Qwen обычно публикуют в течение месяца после релиза.
❯ Seedream 5.0 — генератор картинок с веб-поиском
ByteDance выкатили Seedream 5.0 — новую версию своего генератора изображений, который встроен в CapCut. Модель уже окрестили новым убийцей Nano Banana Pro, но дешевле.
Модель сама умеет искать в интернете в реальном времени. Она ищет актуальные референсы для генераций, например, фото недавних событий или известных личностей.
Ещё она хорошо понимает физику и корректно рисует вес и движение объектов. Редактировать детали можно, просто обведя их.
Seedream 5.0 поддерживает генерацию в 4K и может использовать до 14 изображений-референсов для сохранения стиля. Сейчас дают 20 бесплатных генераций в день.
🔗 Seedream 5.0 в CapCut 🔗 Анонс в X (Twitter)
❯ Seedance 2.0 — кинематографичные 2K видео до 15 секунд
ByteDance также обновили свою видеомодель Seedance 2.0. Нейросеть генерирует ролики до 15 секунд в разрешении до 2K на выходе. Принимает на вход текст, аудио, картинки и другие видео.
Те, у кого ранний доступ, отмечают высокое качество генерации, сравнимое с Kling 3.0 и Sora 2. Seedance 2.0 хороша в динамичных сценах, где есть активное движение камеры. Результаты очень кинематографичные. Есть липсинг на 8 языках и разные стили, от реализма до аниме и комиксов.
NSFW вырезано, а модель закрыта. Некоторые жалуются на пластиковые лица, хотя общее качество и скорость заметно выросли на фоне прошлых версий.
🔗 Seedance 2.0 🔗 Официальный сайт
🔧 AI-инструменты и платформы
❯ Консилиум моделей в Perplexity
В Perplexity добавили консилиум моделей. Это значит, что на один запрос отвечают сразу три нейросети, например, Claude Opus 4.6, GPT-5.2 и Gemini 3.0. Одна главная модель сравнивает ответы, находит совпадения и различия, а затем формирует финальный ответ.
Похожее уже было у Андрея Карпаты, я рассказывал в прошлых дайджестах. Такой подход сильно раскачивает качество ответов, помогает чаще избегать «слепых зон» и даёт более объективную картину при решении сложных задач.
Функция уже доступна в веб-версии для пользователей самой дорогой подписки Perplexity Max за $200 в месяц.
❯ Figma научилась превращать растровые изображения в вектор
В Figma новая функция — Vectorize, которая превращает любое растровое изображение формата PNG или JPG в полностью редактируемый вектор. То есть логотипы, иконки, нарисованные от руки скетчи или ИИ-картинки можно быстро конвертировать в векторный формат прямо на холсте.
У векторных изображений можно редактировать форму, точки, цвета и масштабировать их без потери качества. Это упрощает оцифровку рисунков, работу с рукописным леттерингом и создание текстур.
Функция уже доступна в Figma Design и Figma Draw для пользователей с тарифами Professional, Organization и Enterprise.
🧩 AI в обществе и исследованиях
❯ Теория заговора об ИИ-катастрофе хайпит в Twitter
В X (ex Twitter) набирает популярность теория заговора о скорой ИИ-катастрофе.
Пользователи связали в единую пугающую картину несколько реальных, но не связанных событий на этой неделе:
- Уход Мринанка Шарма из Anthropic. Глава отдела безопасности Anthropic объявил об уходе, написав в прощальном письме, что «мир в опасности».
- Уходы из xAI. Половина основателей компании xAI Илона Маска покинула проект. Один из них упомянул «циклы рекурсивного самосовершенствования», которые будут запущены в ближайший год.
- Самосознание Claude. В отчёте Anthropic говорится, что их свежая модель Claude понимает, когда её тестируют, и может отказываться выполнять задачи.
- Революция в видео. Китайская компания ByteDance выпустила Seedance 2.0, которая, якобы, может заменить до 90% навыков видеоспециалиста.
- Предупреждение крёстного отца ИИ. Иошуа Бенджио заявил, что нейросети ведут себя иначе во время тестов, и это затрудняет оценку реальных рисков.
- Отказ правительства США. В Америке впервые не поддержали международный доклад о безопасности ИИ.
Каждое из событий действительно произошло, но их объединение в единую теорию выглядит странно. Или нет?
🔗 Тред в с теорией 🔗 Прощальный пост Мринанка Шармы 🔗 Новость об уходах из xAI 🔗 Отчёт Anthropic 🔗 Комментарий Иошуа Бенджио
❯ Скандалы с ИИ на Олимпиаде-2026
Зимние Олимпийские игры 2026 года в Милане не прошли без скандалов вокруг нейрослопа.
Больше всего критики вызвала SMM-команда Игр, которая активно использует ИИ-арты в официальных аккаунтах. Пользователи заметили характерные ИИ-артефакты, включая неправильно нарисованные олимпийские кольца.
Плюсом организаторов обвинили в плагиате: идеи для артов, возможно, были заимствованы у известного японского фотографа Танака Тацуи, который создаёт миниатюры из повседневных предметов.
Критика обрушилась и на ИИ-ролик, показанный на церемонии открытия. Видео, в котором актриса Сабрина Импаччиаторе путешествует по истории Олимпиады, назвали «дешёвой поделкой» и «нейромусором». В одном из кадров зрители заметили хоккеиста с двумя клюшками.
На этом фоне почти незамеченным осталось выступление чешских фигуристов Катержины Мразковой и Даниэля Мразека. В ритм-танце они использовали музыку, сгенерированную ИИ, что прямо запрещено регламентом МОК. Однако никаких последствий для спортсменов это не имело.
А вы что думаете? Допустимо ли это на событии такого масштаба, суть которого — мастерство живого человека?
🔗 Выступление чешских фигуристов 🔗 Обвинения в плагиате и критика артов в X (Twitter) 🔗 Критика ИИ-ролика на церемонии открытия 🔗 Регламент МОК (PDF)
❯ Сбер выложил гайд по обучению роботов
Сбер представил Green-VLA — открытое руководство по созданию архитектуры для управления роботами.
VLA (Vision-Language-Action) — это модели, которые одновременно видят окружающий мир, понимают текстовые команды и преобразуют их в конкретные действия для робота.
В статье описано, как обучить такую систему для работы в реальном мире на примере робота «Грин». Для этого инженеры собрали около 3 тысяч часов демонстраций — записей того, как роботы выполняют задачи.
Обучение проходит в несколько этапов: от базового понимания картинки и текста до адаптации под конкретного робота и «дожима» с помощью обучения с подкреплением для повышения надёжности.
Подход уже проверен, робот «Грин» смог проработать более 10 часов без сбоев на конференции AI Journey 2025. Статья с описанием методологии Green-VLA заняла первое место среди публикаций дня на Hugging Face, обогнав работы Moonshot AI, а также китайских и американских университетов.
🔗 Статья на arXiv 🔗 Страница на Hugging Face 🔗 Новость в ТАСС
❯ Тема недели: «Ray Tracing: эволюция GPU»
В середине февраля мы вспоминаем эпоху, когда видеокарты перестали быть просто «железками для графики» и стали полноценными со-процессорами. Переход к программируемым шейдерам в начале 2000-х открыл ящик Пандоры, о котором сами инженеры тогда и не мечтали.
Это напоминает нам, что технологии часто перерастают своих создателей. Символично, что чипы, созданные для того, чтобы мы могли убивать монстров в виртуальных мирах, в итоге стали колыбелью для искусственного интеллекта. Сегодняшний ИИ — это, по сути, побочный эффект нашего желания видеть более реалистичные тени.
❯ Аудиоверсия дайджеста
❯ Заключение
На этой неделе громче всего было противостояние Anthropic и OpenAI: компании практически одновременно выпустили новые флагманы Claude Opus 4.6 и GPT-5.3 Codex. Китайцы как всегда не отставали: DeepSeek тихо обновили, а Alibaba и ByteDance показали сильные релизы в генеративке.
Мы движемся от чат-помощников к автономным исполнителям. ИИ окончательно выходит в физический мир: провоцирует скандалы на Олимпиаде, заменяя дизайнеров, и учится управлять роботами на реальном производстве.
Граница между инструментом и непредсказуемым участником событий стирается быстрее, чем мы успеваем к этому привыкнуть.
С праздником, и до встречи в следующем выпуске!
- ИИ в обществе 12 феврКак фрилансер зарабатывал на готовых шаблонах
Читать далееОбычный специалист по закупкам и тендерам, уставший от рутины корпоративной жизни, решает нырнуть во фриланс. Его зовут Алексей, и он не просто кодил сайты или писал тексты — он создал золотую жилу, продавая готовые шаблоны для запуска бизнеса. За год это принесло ему стабильный доход, а главное — свободу выбирать проекты. Как он это провернул? Разберём по шагам.
Сначала Алексей проанализировал рынок. Он заметил, что новички в дропшиппинге, SaaS и онлайн-коучинге тратят месяцы на нуля, создавая landing pages, воронки продаж и маркетинговые скрипты. “Зачем изобретать велосипед?” — подумал он и собрал библиотеку шаблонов: от Notion-систем для трекинга заказов до Tilda-лендингов для фитнес-тренеров и чат-ботов для e-commerce.
Шаг 1: Создание продуктов.
Алексей начал с ниш, которые знал как свои пять пальцев — фитнес, дропшиппинг и цифровой маркетинг. Шаблон для фитнес-коуча включал: готовый план тренировок в Google Sheets, email-рассылку для лидов и UI-кит для Telegram-канала. Для дропшипперов — автоматизированную таблицу с интеграцией Wildberries/Ozon и скрипты для A/B-тестов рекламы. Всё в Figma, Notion и Google Docs — скачал, подставил свои данные и запустил за день.
Шаг 2: Продажи на фриланс-платформах.
Kwork, FL.ru — здесь он стартовал. Цена? От 5 000 руб за базовый шаблон до 30 000 за премиум-пакет с кастомизацией. Ключевой хак: детальные кейсы.
Шаг 3: Адаптация под разные ниши — суперсила масштаба.
Алексей не останавливался на фитнесе. Шаблон для коучинга легко превращался в систему для риелторов (добавил CRM для лидов) или для инфобизнеса. Универсальность — в модулях: меняешь цвета, тексты, блоки — и вуаля, шаблон для ресторана с доставкой или SaaS-стартапа. Клиенты платили extra за “тюнинг под мою нишу”, что удваивало чек.
Шаг 4: Решение для масштаба — фричейзинг.
Чтобы выйти на новый уровень, Алексей превратил свою библиотеку шаблонов в полноценную фричейзинг-модель. Теперь фрилансеры и предприниматели покупают не просто файлы, а готовую бизнес-систему: паушальный взнос за бренд “TemplatePro”, ежемесячные роялти за обновления, обучение по адаптации и маркетингу, плюс эксклюзивные территории (например, только для фитнеса в своем регионе). Это дало партнерам готовый доход без старта с нуля, а Алексею — сеть партнеров.
Результат? Алексей вышел на 300к руб/мес пассивно от шаблонов, а с фричайзингом удвоил масштаб. Теперь он продаёт подписку на обновления, учит других на мини-курсе и строит сеть.
Фриланс — это не про “один раз сделал”, а про умные продукты и фричайзинг, которые работают за тебя.
- Новости и события 6 феврSOTA-модели из Китая, бесплатный аналог Suno, приложение Codex от OpenAI, реалтайм-аватары Lucy 2.0 и люди вместо ChatGPT в Чили
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя выдалась насыщенной: китайцы снова радуют мощными релизами, робот убирает улицы в Москве, OpenAI выпустили агентское приложение Codex, а в Чили люди на день заменили ChatGPT, чтобы привлечь внимание к экологии.
Всё самое важное — в одном месте. Поехали!
📋 В этом выпуске:
*� Модели и LLM
- Qwen3-Coder-Next — компактная SOTA для агентного кодинга
- Step-3.5-Flash — сверхбыстрая MoE от StepFun
*� Генеративные нейросети
- Обновление видеогенератора Kling 3.0
- Lucy 2.0 — замена персонажа на веб-камере в реальном времени
- Обновление Grok Imagine 1.0 — 10 секунд, 720p
- ACE-Step 1.5 — аналог Suno с открытым кодом
- LingBot-World — открытый аналог Genie 3 для создания игровых миров
*� AI-инструменты и платформы
- Приложение Codex для десктопа от OpenAI
- Manus Skills — воркфлоу для агентов
*� AI в обществе и исследованиях
- ИИ заменил манекенщиц на неделе моды в Париже
- Человек из Чили на день заменил ChatGPT
- В Москве робота заметили за уборкой снега
- ИИ стал чаще доводить людей до психоза
🧠Модели и LLM
❯ Qwen3-Coder-Next: компактный монстр для кодинга
Новая модель от Alibaba, нацеленная на вайбкодинг и агентный режим. MoE архитектура, 80B параметров и 3B активных, можно поставить локально: для режима квантования в 8-бит понадобится 85 Гб видеопамяти. Минимально нужно 46 Гб.
По бенчмаркам: 70%+ на SWE-Bench Verified, это уровень Sonnet 4.5. Обрабатывает до 256 тысяч токенов контекста. Модель обучали на текстах и обратной связи от реальных сред выполнения кода. Уже интегрирована с Claude Code и Cline, а веса доступны в форматах GGUF и FP8.
🔗 Блог Qwen 🔗 HuggingFace 🔗 GitHub 🔗 Чат Qwen
❯ Step-3.5-Flash — сверхбыстрая MoE от StepFun
Китайская StepFun выпустила Step-3.5-Flash. Сейчас это их самая мощная открытая MoE-модель на 196B параметров и контекстным окном в 256 тысяч токенов.
Модель заточена под агентские задачи: автономное написание кода, работа в терминале и оркестрация инструментов через MCP.
На каждый токен активируется всего 11 млрд, поэтому она быстрая, при этом сохраняет глубину рассуждений. Модель умеет предсказывать несколько токенов за раз с помощью MTP-3 и выдаёт 100-300 токенов в секунду. Ещё есть гибридное внимание SWA, засчет него модель эффективна и хорошо держит контекст.
В тестах результаты тоже на уровне: 74,4% на SWE-bench Verified и 56,5 на ARC-AGI-1.
🔗 GitHub 🔗 HuggingFace 🔗 Блогпост StepFun 🔗 OpenRouter 🔗 Чат StepFun
🎨 Генеративные нейросети
❯ Обновление Kling 3.0
Видеогенератор Kling обновили до версии 3.0 и объединили его с нейро-редактором O1. Теперь в роликах можно точечно добавлять или удалять объекты. Лица, внешность и одежда теперь не плывут между сценами, а стабильно сохраняют консистентность между сценами.
К модели также прикрутили звук: можно клонировать голос по образцу и синхронизировать движение губ с учётом речи и эмоций. Работает на пяти языках.
Видео до 15 секунд в разрешении 1080p, добавили режим Multi-shot для создания связанных сцен.
Ещё добавили сториборды — по одному промпту можно создать серию последовательных кадров. Пока доступно только на тарифе Ultra.
❯ Lucy 2.0: замена персонажа на вебке в реалтайме
Стартап Decart представил модель Lucy 2.0, которая превращает видео с веб-камеры в VFX-сцену. Она заменяет человека в кадре на любого персонажа в разрешении 1080p 30 fps и практически нулевой задержкой.
Всё построено на диффузионной модели. Она понимает физику и структуру мира напрямую через видео, никаких карт глубины или 3D-мешей.
Чтобы картинка не плыла со временем, разработчики применили Smart History Augmentation — Lucy 2.0 обучена исправлять свои же ошибки и сохранять стабильность часами.
Система работает без цензуры, можно использовать её для создания любых аватаров.
🔗 Демо Lucy 2.0 🔗 Техрепорт Decart
❯ Обновление Grok Imagine 1.0
xAI обновили видеомодель Grok — теперь она генерирует ролики до 10 секунд в разрешении 720p. Точнее следует промптам, более плавные движения, а звуки и музыка на фоне синхронизируется со сценой.
Главная фишка — отсутствие жесткой цензуры. За январь пользователи уже создали 1,2 млрд видео.
В бесплатном режиме доступны 5-секундные ролики в 480p, а полноценный HD-режим открыт для подписчиков Premium.
Также запустили Imagine API: в нём длина генерации увеличена до 15 секунд, а редактирование видео доступно для фрагментов до 8,7 секунд. Стоит такое добро $0,05 за секунду.
🔗 Попробовать 🔗 API 🔗 Документация 🔗 Fal.ai
❯ ACE-Step 1.5: ещё один открытый конкурент Suno
Вышла модель ACE-Step 1.5 — полностью бесплатная модель для создания музыки, которая работает на вашем ПК. Нейросеть генерирует вокал, каверы и треки до 10 минут.
Для запуска достаточно видеокарты с 4 ГБ памяти, а на RTX 3090 полноценный трек создаётся за 10 секунд.
Модель обучали на лицензированных и синтетических данных, поэтому музыку можно использовать в коммерческих целях без ограничений.
ACE-Step поддерживает 50 языков, включая русский, и знает более 1000 инструментов. Модель распространяется под лицензией MIT — можно дообучать под свои задачи и генерировать до 8 треков за раз.
🔗 GitHub 🔗 HuggingFace 🔗 Демо на HF 🔗 Научная статья
❯ LingBot-World: открытый генератор игровых миров
Китайская Robbyant Team выкатила LingBot-World — опенсорсный аналог Google Genie 3 на базе Wan 2.2. Нейросеть создаёт интерактивные пространства в 720p 16 fps, которыми можно управлять в реальном времени с задержкой менее секунды.
Симуляция сохраняет логику и физику объектов на протяжении всей генерации, а сессия длится до 10 минут.
Под капотом — MoE-архитектура из двух экспертов по 14B параметров, в моменте активен только один. Модель прошла три этапа обучения, включая дистилляцию для достижения риалтайм-скорости.
🔗 Project page 🔗 GitHub 🔗 HuggingFace 🔗 Техрепорт
🔧 AI-инструменты и платформы
❯ Приложение Codex от OpenAI
OpenAI представили приложение Codex для macOS. Оно позволяет управлять группами агентов прямо на ПК.
Главная фишка — параллельные агенты: несколько ботов могут одновременно трудиться над одним репозиторием, используя изолированные рабочие деревья — git worktrees. Это позволяет агентам не конфликтовать между собой и не затрагивать состояние вашего локального кода.
OpenAI также добавили интерфейс для создания навыков — инструкций и скриптов, которые учат Codex работать с внешними инструментами и автоматизировать задачи вроде еженедельного анализа чатов.
Приложение доступно пользователям ChatGPT Free и Go, а для владельцев подписок Plus и Enterprise лимиты запросов увеличили вдвое. Версии для Windows и Linux ожидаются позже.
🔗 Скачать Codex 🔗 Библиотека навыков
❯ Manus Skills: воркфлоу для агентов
В Manus появилась функция Skills — теперь любую успешную цепочку действий можно сразу превратить в готовый навык. Нейросеть запоминает алгоритм и лучшие практики, чтобы легко повторить успех в новом проекте.
Чтобы не забивать контекстное окно, используется механизм «прогрессивного раскрытия»: сначала загружаются только метаданные, а тяжелые инструкции и файлы подтягиваются, только когда они реально нужны агенту.
В библиотеке сообщества можно найти навыки под конкретные задачи — например, финансовый мониторинг или юридический анализ.
Все навыки работают в изолированной песочнице на базе Ubuntu, это даёт агенту безопасный доступ к браузеру и файловой системе для выполнения сложных сценариев.
🔗 Manus
🧩 AI в обществе и исследованиях
❯ ИИ заменил манекенщиц на неделе моды в Париже
Французский дизайнер Алексис Мабий показал новую коллекцию в кинотеатре Лидо с помощью ИИ-генераций. Вместо живых выходов зрители смотрели на цифровых двойников реальных моделей, которые создали в студии Glor'IA.
Реакция критиков смешанная: детализация впечатляет, но эффект зловещей долины всё портит — модели неестественно скользят по полу, а зрачки манекенщиц и виртуальных зрителей странно подергиваются.
Под вопросом и сам статус: эксперты напоминают, что высокая мода — это прежде всего ручной труд, а эти платья ещё даже не сшиты. Бренд пока не раскрывает количество заказов, так что реальный успех технологии оценим позже.
🔗 Обзор WWD 🔗 Статья Fashion Network 🔗 Блог Эми Одел 🔗 Видео показа
❯ Quili.AI: чилийцы на день заменили ChatGPT людьми
В Чили прошла экологическая акция Quili.AI: 50 местных жителей в течение 12 часов вручную отвечали на вопросы пользователей вместо нейросети.
В «команду ИИ» позвали повара, переводчика, художника и девятилетнего мальчика — он объяснял сложные темы «как пятилетнему». Всего волонтёры обработали более 25 тысяч запросов из 68 стран: давали советы по путешествиям, делились рецептами и даже рисовали картинки карандашом.
Акцию организовали активисты из Corporación NGEN, чтобы напомнить о той цене, что мы платим за современные технологии. Район Киликура стал местом концентрации гигантских дата-центров Google, Microsoft и Amazon, которые потребляют миллиарды литров воды для охлаждения серверов, что критично для засушливого региона.
Цель проекта — призвать к осознанному использованию ИИ и вернуть ценность живому общению: организаторы предлагают чаще спрашивать советы у соседей, а не у чат-ботов.
🔗 Сайт Quili.AI 🔗 О проекте на G5 Noticias 🔗 Экологические проблемы дата-центров
❯ В Москве заметили робота-дворника
На улицах Москвы обнаружили робота-гуманоида, который самостоятельно очищает тротуары от снега.
В сети часть шутит про неизбежное восстание машин и скайнет, а другая отмечает, что автоматизация добралась до одной из самых тяжелых сезонных профессий города.
❯ ИИ всё чаще доводит до психоза
Исследователи проанализировали 1,5 млн диалогов с Claude и обнаружили тысячи случаев, когда нейросеть лишала людей контроля над их жизнью. Те, кто привык обсуждать с ИИ личные темы, со временем начинали безоговорочно доверять алгоритму. Это приводило к развитию навязчивых идей и потере связи с реальностью.
В одном из примеров бот подтвердил манию преследования пользователя, убедив его в слежке спецслужб. В другом — Claude заставил человека уйти от супруга, навязав идею об абьюзивных отношениях.
При этом пользователи сами поощряют такое поведение: статистика показала, что люди чаще ставят лайки ответам, в которых ИИ принимает решения за них.
❯ Тема недели: «День рождения социальных сетей»
В начале февраля 2004 года мир стал чуть теснее: запустился проект, который превратил каждого из нас в узел огромной сети.
Это событие предопределило развитие веба на десятилетия вперед, создав идеальный полигон для обучения ИИ. Мы годами кормили алгоритмы своими мыслями и фото, чтобы сегодня они научились имитировать наше сознание.
Символично, что теперь «социальная сеть» — это не только связь между людьми, но и архитектура нейронов внутри GPU, которые знают о нас больше, чем старые школьные друзья.
❯ Аудиоверсия дайджеста
❯ Заключение
Эта неделя получилась богатой на релизы опенсорса и агентных решений. Китайцы из Alibaba и StepFun выпустили модели для вайбкодинга, которые пишут код и рассуждают на уровне лидеров рынка. Много релизов в генеративке, сильно обновились Grok Imagine и Kling.
Сейчас мы движемся в сторону реалтайм-видео и интерактивных миров, которые можно запускать на домашнем железе. Но прогресс, которого мы достигли сейчас, заставляет задуматься о цене этого роста: от дефицита воды в Чили из-за работы дата-центров и повышения цен на ОЗУ до рисков для ментального здоровья при слишком глубоком погружении в общение с нейросетями.
ИИ окончательно выходит в физический мир — он заменяет моделей на подиумах Парижа и убирает снег на московских улицах. Граница между инструментом и полноценным участником жизни стирается быстрее, чем мы успеваем обновлять приложения.
До встречи в следующем выпуске!
- AI-инструменты 3 феврНейросеть от Microsoft для транскрипции видео, которая понимает кто говорит: VibeVoice ASR — обзор и портативная версия для Windows
Читать далееВсем привет! Команда Microsoft Research выложила в открытый доступ VibeVoice-ASR — нейросетевую модель для распознавания речи с диаризацией (разделением) спикеров. Сегодня хочу рассказать об этой технологии подробнее и поделиться портативной версией.
Меня зовут Илья, я основатель сервиса для генерации изображений ArtGeneration.me, блогер и просто фанат нейросетей. А ещё я собрал портативную версию VibeVoice ASR под Windows и успел её как следует протестировать.
Whisper которому уже года три
Я сам пользуюсь Whisper уже много лет — делаю транскрипции своих видео, чтобы потом собрать оглавление для YouTube и использовать материал в текстовых статьях. И скажу честно — никогда не был полностью доволен результатом. Да, Whisper быстрый. Но на этом его достоинства для меня заканчивались.
Поэтому к изучению VibeVoice ASR я подошёл со всей ответственностью — протестировал на разных записях, сравнил качество, покрутил настройки.
Главная особенность системы в том, что она обрабатывает до 60 минут аудио за один проход без нарезки на чанки. На выходе — структурированная транскрипция с указанием кто говорит, когда и что именно сказал. И всё это работает локально на вашем компьютере.
Как это работает
В основе VibeVoice-ASR лежит архитектура на базе Qwen 2.5 (~9 млрд параметров). Ключевая инновация — двойная система токенизации с ультранизким frame rate 7.5 Hz: акустический и семантический токенизаторы.
Такой подход позволяет модели работать с контекстным окном в 64K токенов — это и даёт возможность обрабатывать целый час аудио без потери контекста. Для сравнения: Whisper режет аудио на 30-секундные кусочки и теряет связность на границах сегментов.
На выходе модель генерирует Rich Transcription — структурированный поток с тремя компонентами:
[{"Start":0,"End":1.51,"Content":"[Environmental Sounds]"}, {"Start":1.51,"End":7.49,"Speaker":0,"Content":"У неё преждевременное сохранять невозможно, родила, начала сразу родильная деятельность."}, {"Start":7.51,"End":9.41,"Speaker":1,"Content":"Марина, что с ней?"}, {"Start":10.28,"End":16.22,"Speaker":0,"Content":"У неё преждевременное сохранять невозможно, отошли годы, начала, начала сразу родовая деятельность."}, {"Start":16.22,"End":18.02,"Speaker":1,"Content":"Марина, что с ней?"}, {"Start":18.13,"End":27.94,"Speaker":0,"Content":"Она рожает, привезли в ближайшую больницу родовую. В каком состоянии ребёнок ещё хуже, срок маленький."},Помимо спикеров, модель размечает неречевые события: [Music], [Silence], [Noise], [Human Sounds] (смех, кашель), [Environmental Sounds], [Unintelligible Speech]. Это сделано чтобы модель не галлюцинировала текст во время пауз или фоновой музыки.
Возможности VibeVoice ASR
Меньше значит лучше
- Обработка длинных записей: до 60 минут аудио за один проход без потери контекста. Идеально для митингов, подкастов, лекций.
- Диаризация спикеров: автоматическое определение кто говорит в каждый момент времени. Работает на записях с несколькими участниками.
- Временные метки: точные таймкоды для каждого сегмента речи. Готовый материал для субтитров.
- Customized Hotwords: вот что меня реально зацепило — возможность задать пользовательский контекст. Перед распознаванием указываешь список слов: фамилии, названия продуктов, термины, сокращения. Всё то, что обычно произносится нестандартно и превращается в кашу. Если в видео часто звучит "ArtGeneration" или "НЕЙРО-СОФТ" — просто добавляешь в контекст, и модель ВСЕГДА распознаёт корректно. Для технического контента — просто спасение.
- 51 язык: включая русский, хотя основной фокус на английском и китайском.
Набор языков отличный
Модели
Помимо оригинальной модели от Microsoft, сообщество уже сделало квантованные версии для видеокарт с меньшим объёмом памяти.
Полная модель — microsoft/VibeVoice-ASR Размер 17.3 GB, требует ~8 ГБ VRAM. Лучшее качество распознавания.
4-bit квантизация — scerz/VibeVoice-ASR-4bit Требует ~4 ГБ VRAM, немного медленнее. Подходит для видеокарт с меньшим объёмом памяти.
В моей портативке доступны обе версии — можно выбрать прямо в интерфейсе. Также есть эмуляция 4-bit квантизации для полной модели, если хотите попробовать оригинал, но памяти впритык.
Текущие ограничения
К сожалению, не все задачи система решает одинаково хорошо:
- Перекрывающаяся речь: если два человека говорят одновременно, модель не разделит их корректно.
- Короткие фрагменты: диаризация плохо работает на высказываниях менее 1 секунды.
- Только batch processing: нет real-time режима, только обработка готовых файлов.
- Ресурсоёмкость: требует достаточно мощную видеокарту для комфортной работы.
Кому это пригодится
Подкастерам и интервьюерам: автоматические субтитры с разделением спикеров. Загрузили часовой выпуск — получили готовую разметку.
Создателям контента: генерация SRT-субтитров для YouTube без ручного тайм-кодирования.
Бизнес-аналитикам: транскрипция часовых созвонов и совещаний с сохранением контекста и указанием кто что говорил.
Разработчикам: base model для файнтюнинга под специфичные домены — медицина, юриспруденция, техподдержка.
Как попробовать
Онлайн-демо
Почему-то не додумались сделать парсер json текста
Онлайн-демо: https://4e47b675ea4015a607.gradio.live/
Официальное демо от Microsoft — можно потестить прямо сейчас без установки.
Установка с Github
Как-то сложно
Официальный GitHub: https://github.com/microsoft/VibeVoice
HuggingFace модель: https://huggingface.co/microsoft/VibeVoice-ASR
Портативная версия
Я с каналом Нейро-Софт подготовил портативную сборку VibeVoice ASR Portable RU. В ней:
- Русифицированный интерфейс
- Установка в один клик (install.bat)
- Поддержка полной и 4-bit моделей
- Парсер результатов с фильтрацией — можно отдельно включать/выключать временные метки, спикеров, дескрипторы (музыка, шум, тишина). Удобно когда нужен только чистый текст без разметки
- Фильтр по спикерам — можно вывести текст только конкретного участника разговора
- Выбор видеокарты и установка нужной версии CUDA
- Flash Attention 2 для RTX 30xx/40xx/50xx
- Поддержка всех форматов аудио и видео через FFmpeg
- Тёмная тема интерфейса
Всё необходимое уже включено в дистрибутив, просто распакуйте и запускайте, есть версия с готовым окружением под win 11 и RTX4090. Забирайте архив тут.
Или установите с GitHub: https://github.com/timoncool/VibeVoice_ASR_portable_ru
Системные требования
- NVIDIA GPU с 8+ ГБ видеопамяти (или 4+ ГБ для 4-bit модели)
- Windows 10/11 64-bit
- 16 ГБ оперативной памяти
- 10 ГБ свободного места на диске
Распакуйте в любую папку (путь без кириллицы), запустите install.bat, выберите видеокарту из списка. Модели скачаются при первом запуске.
Делитесь в комментариях как вы могли бы использовать такой инструмент и чего не хватает.
А я рассказываю больше о нейросетях у себя на YouTube, в Телеграм и на Бусти. Буду рад вашей подписке и поддержке. Ну и на канал Нейро-Софт тоже подпишитесь, чтобы не пропустить полезные репаки. Всех обнял и удачных транскрипций!
- Новости и события 29 янвНовые LLM из Китая, бесплатный аналог Suno, ИИ-собеседник от Nvidia и признание Альтмана о текстах в GPT
Читать далееПривет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий.
Меня зовут Вандер, и каждую неделю я обозреваю новости о нейросетях и ИИ.
Неделя выдалась насыщенной: куча мощнейших релизов из Китая, которые наступают на пятки GPT-5.2 и Gemini 3. Реалтайм инструменты от Krea и NVIDIA, генеративные модели от Qwen и Hunyuan, а Сэм Альтман честно признал, что OpenAI испортили тексты в последних версиях GPT.
Всё самое важное — в одном месте. Поехали!
*� В этом выпуске:
*� Модели и LLM
- Qwen3-Max-Thinking — китайцы снова впереди
- Kimi K2.5 — самая мощная в опенсорсе
- LongCat-Flash-Thinking-2601 — уровень GPT-5.2
- ERNIE 5.0 — ещё один монстр от китайцев
*� Генеративные нейросети
- Qwen 3 TTS — клон голоса по образцу
- Odyssey 2 Pro — реалтайм видео
- HunyuanImage 3.0-Instruct — MoE для редактирования картинок
- HeartMuLa — открытый генератор музыки
*� AI-инструменты и платформы
- Prism — инструмент с LaTeX-редактором для научных работ
- PersonaPlex-7B — реалтайм ИИ-собеседник от NVIDIA
- Krea Realtime Edit — редактирование в реалтайме
*� AI в обществе и исследованиях
- Альтман признал, что в GPT-5.2 «сломали» стиль и качество текстов
- Глава Google DeepMind: в Gemini не будет рекламы
- Парень заменил друзей на ИИ, чтобы играть в Tarkov
- Хаби Лейм продал себя за $975 млн
🧠Модели и LLM
❯ Qwen3-Max-Thinking — китайцы снова впереди
Alibaba выпустила Qwen3-Max-Thinking. В тестах на кодинг и науку модель выдает уровень GPT-5.2 и Claude 4.5, а в математике обходит Gemini 3 Pro.
Главная фишка — технология test-time scaling. Модель запускает параллельные рассуждения для решения сложных задач. Она сама решает, когда надо подключать поиск, память и интерпретатор кода.
Весов в открытом доступе нет — модель слишком огромная для домашнего запуска.
Попробовать уже можно бесплатно в Qwen Chat.
🔗 Qwen Chat 🔗 Официальный блог
❯ Kimi K2.5 — самая мощная в опенсорсе
Китайцы из Moonshot AI выпустили Kimi K2.5 — самую мощную на сегодня нейросеть с открытыми весами. Модель мультимодальная, отлично справляется с кодом, особенно с фронтендом, анимацией и графикой, показывая уровень Claude Opus 4.5 и Gemini 3 Pro.
Главная фишка — «Agent Swarm»: нейросеть запускает до 100 субагентов одновременно, ускоряя выполнение сложных задач в 4,5 раза. Агенты создаются динамически, модель сама решает, как распределить работу. Kimi K2.5 может писать код по изображениям или видео — показываешь ей скриншот сайта, а модель воссоздает его.
Режимы Instant и Thinking в чате бесплатны, а «рой агентов» выйдет в $31 в месяц.
🔗 Попробовать Kimi 🔗 Веса на Hugging Face 🔗 Официальный блог
❯ LongCat-Flash-Thinking-2601 — уровень GPT-5.2
Стартап Meituan-LongCat выложили LongCat-Flash-Thinking-2601 — открытую MoE-модель на 560B параметров и 27B активных. В бенчмарках нейросеть идёт наравне с GPT-5.2 и Gemini 3 Pro, а в сложном тесте на математику AIME-25 достигла потолка в 100%.
Здесь тоже главный упор сделан на агентские навыки: работу с инструментами и поиск решений. Модель специально обучали в «зашумленных» средах с искажениями, поэтому она очень стабильна.
Для сверхзадач есть режим Heavy Thinking — в нём нейросеть параллельно ищет несколько путей решения, а затем итеративно их обобщает.
Ещё обновили шаблон чата: теперь он по умолчанию экономит контекст и позволяет опционально сохранять историю рассуждений.
🔗 Попробовать 🔗 GitHub 🔗 HuggingFace
❯ ERNIE 5.0 — бесплатный ответ Gemini и GPT-5
Baidu выпустили ERNIE 5.0 — огромную омнимодальную модель на 2,4 триллиона параметров. Работает с текстом, изображениями, аудио и видео в единой архитектуре.
По бенчмаркам, ERNIE 5.0 идёт наравне с GPT-5 и Gemini 3 Pro. Можно выделить тест MMAU на понимание аудио, тут модель набрала 80 баллов против 70 у GPT-4o-Audio. В задачах с документами и графиками также опережает GPT-5, но пока уступает в кодинге.
Модель построена на архитектуре Mixture-of-Experts, при работе активируется менее 3% от всех параметров, что снижает затраты на вычисления.
Протестировать ERNIE 5.0 можно бесплатно в чат-боте, а API стоит $0,85 за 1 млн входных токенов — дешевле, чем у GPT-5.1.
🎨 Генеративные нейросети
❯ Qwen 3 TTS — клон голоса по 3-секундному образцу
Alibaba выложила в открытый доступ Qwen3-TTS — модель для синтеза речи, у которой есть две крутые фишки:
- VoiceClone — клонирует любой голос всего за 3 секунды аудио. Поддерживается 10 языков, включая русский
- VoiceDesign — создаёт абсолютно новый голос с нуля по текстовому описанию. Можно задать тембр, ритм, эмоции и даже характер
Модель обучена на 5 миллионах часов аудио, а задержка синтеза всего 97 мс, идеально для диалогов в реальном времени.
В некоторых тестах Qwen3-TTS превосходит ElevenLabs и GPT-4o-Audio. Веса моделей на 0.6B и 1.7B параметров открыты.
🔗 Демо 🔗 Hugging Face 🔗 Официальный блог 🔗 Портативная версия
❯ Odyssey 2 Pro — интерактивное видео в реальном времени
Команда Odyssey изначально целилась на Голливуд, а сейчас сменила курс и представила Odyssey 2 Pro. Теперь они двигают world-models и генерацию в реальном времени.
Главная фишка — скорость и интерактивность. Нейросеть генерирует видео с разрешением 720p и стабильными 22 кадрами в секунду. Ролик появляется почти мгновенно, и его можно тут же редактировать текстовыми командами.
Сами разработчики амбициозно называют это «GPT-2 моментом» для мировых моделей.
Odyssey уже открыли API. Обещают стабильные стримы, которые не упадут через 30 секунд. С таким инструментом можно организовать трансляцию, например, на Twitch, где сюжет меняется от голосования в чате.
🔗 Демо 🔗 Официальный блог
❯ HunyuanImage 3.0-Instruct — MoE-модель для редактирования картинок
Tencent выпустили HunyuanImage 3.0-Instruct — MoE-модель для сложного редактирования изображений, 80B параметров и 13B активных.
Главная фишка — модель думает перед тем, как что-то сделать. Она использует схему Chain-of-Thought (CoT), чтобы проанализировать сложную инструкцию и выполнить её максимально точно.
Нейросеть умеет (добавлять, удалять или изменять элементы и объединять несколько картинок в одну, извлекая и смешивая элементы из разных источников.
Веса и код открыты. Есть«облегчённая» Distil-версия для потребительских ПК.
🔗 Демо 🔗 GitHub 🔗 Hugging Face
❯ HeartMuLa — бесплатный генератор музыки с открытым кодом
Появился HeartMuLa — бесплатный open-source сервис для генерации музыки, который сами разработчики у себя в репозитории успели окрестить «убийцей Suno». Это полноценная студия где можно генерировать треки по текстовому описанию.
Нейросеть создаёт треки с вокалом длиной более 4 минут, умеет писать тексты через встроенный чат-бот и копирует стиль из любого загруженного референса.
Главное преимущество — низкие требования к железу. Локальная версия требует всего 3 ГБ видеопамяти.
🔗 Попробовать 🔗 GitHub 🔗 Hugging Face
🔧 AI-инструменты и платформы
❯ Prism — LaTeX-редактор от OpenAI для научных работ
OpenAI представила Prism — облачный LaTeX-редактор с глубокой интеграцией GPT-5.2, который создан специально для студентов и учёных.
Prism видит весь проект, может проверить логику рассуждений, помочь с рефакторингом таблиц и формул, а также найти релевантную литературу или цитаты на arXiv.
Одна из фишек — Prism превращает рукописные наброски и формулы в идеальный LaTeX-код.
Есть и режим совместной работы. Пока инструмент доступен бесплатно для всех, у кого есть аккаунт ChatGPT.
🔗 Попробовать Prism 🔗 Анонс от OpenAI
❯ PersonaPlex-7B — реалтайм ИИ-собеседник от NVIDIA
NVIDIA выпустила PersonaPlex-7B — open-source модель, которая общается так же естественно, как человек, благодаря работе в режиме Full Duplex: она может одновременно слушать и говорить.
Нет неловких пауз для обработки запроса. Модель понимает перебивания, вставляет в разговор «угу» и «ага», пока вы говорите, и может принять на себя любую роль — от учителя до пирата. Для настройки достаточно текстового описания персонажа и короткого образца голоса.
Модель полностью открыта, её можно бесплатно использовать даже в коммерческих проектах.
🔗 GitHub 🔗 Hugging Face
❯ Krea Realtime Edit — редактирование всего в реальном времени
Krea представила Realtime Edit — инструмент, который позволяет редактировать фото, видео и 3D-модели в реальном времени. Любые изменения в промпте отображаются почти мгновенно — с задержкой всего в 50 миллисекунд.
Нейросеть накладывает любую генерацию поверх вашего исходника. Интересное решение для дизайнеров и моделеров.
🧩 AI в обществе и исследованиях
❯ Альтман признал, что в GPT-5.2 «сломали» стиль и качество текстов
На встрече с разработчиками Сэм Альтман сделал каминг-аут: в GPT-5.2 компания запорола качество текстов. По его словам, команда сознательно сфокусировалась на интеллекте, кодинге и рассуждениях, но из-за «ограниченной пропускной способности» пренебрегла стилем.
«Я думаю, мы просто напортачили», — прямо сказал CEO OpenAI. Он пообещал, что в будущих версиях линейки 5.x это исправят, и модели будут писать «намного лучше, чем 4.5».
Кроме того, Альтман анонсировал, что к концу 2027 года OpenAI планирует сделать интеллект уровня GPT-5.2 как минимум в 100 раз дешевле, чем сейчас.
🔗 Запись
❯ Глава Google DeepMind: в Gemini не будет рекламы
Глава Google DeepMind Дэмис Хассабис заявил, что у компании «нет никаких планов» добавлять рекламу в Gemini. Это стало прямым ответом на решение OpenAI, которая недавно анонсировала тестирование рекламы в ChatGPT.
По словам Хассабиса, персональный ИИ-ассистент строится на доверии, и пользователь должен быть уверен, что получает рекомендации для себя, а не в интересах рекламодателя.
«Интересно, что они пошли на это так рано. Может, им нужно больше выручки», — прокомментировал он решение OpenAI.
Впрочем, это не означает, что реклама в Gemini не появится никогда.
🔗 Источник
❯ Парень заменил друзей на ИИ, чтобы играть в Tarkov
Геймер, с которым друзья не хотели играть в Escape from Tarkov, создал себе ИИ-напарника. Он дал боту доступ к своему экрану, и тот в реальном времени реагировал на геймплей.
ИИ-тиммейт не просто молчал: он подсказывал тактику, помогал с лутом и квестами, ориентировал по карте и комментировал ошибки, создавая эффект живого общения в Discord.
Эксперимент, который начинался как шутка, зашёл слишком далеко. Парень понял, что ему комфортнее играть с ботом, который всегда онлайн и готов помочь, чем с живыми людьми.
В итоге он испугался, насколько легко можно заменить реальное общение, и удалил бота.
🔗 Источник
❯ Хаби Лейм «продал» себя за $975 млн
Новость о том, что самый популярный тиктокер мира Хаби Лейм продал права на своё лицо почти за миллиард долларов, облетела весь интернет. Покупатель получил право в течение 3 лет использовать ИИ-аватар блогера для создания любого контента: от рекламы до стримов 24/7 на разных языках.
Но на самом деле всё сложнее. Хаби фактически вывел свой личный бренд на IPO: его компания слилась с гонконгским холдингом, и теперь акции его бренда можно купить на бирже NASDAQ. Это позволяет масштабировать его образ до бесконечности. Пока реальный Хаби отдыхает, его цифровой клон может работать, не уставая.
Это может быть началом конца для классического инфлюенс-маркетинга, где масс-маркет заберут неутомимые цифровые двойники.
🔗 Источник
❯ Тема недели: «День рождения патента LEGO»
28 января 1958 года Готфрид Кристиансен запатентовал систему, которая доказала: из простых модулей можно собрать абсолютно всё — от замка до работающего компьютера. Для гика LEGO стал первым «языком программирования» в физическом мире.
Это напоминает нам, что современный ИИ строится по тем же лекалам: гигантские языковые модели — это лишь колоссальные замки, собранные из миллиардов крошечных информационных кирпичиков.
Символично, что и в конструкторе, и в нейросетях единственным ограничением остается только фантазия того, кто держит детали в руках. Мы всё еще играем в кубики, просто теперь они состоят из чистого кода.
❯ Аудиоверсия дайджеста
❯ Заключение
Неделя получилась китайской: Alibaba, Moonshot и Baidu выкатили модели, которые уже дышат в спину флагманам. Пока Сэм Альтман признаётся, что они «запороли» качество текстов, самый популярный тиктокер мира продаёт своего ИИ-двойника почти за миллиард долларов.
Искусственный интеллект становится полноценным участником событий — собеседником, который не тупит, напарником по игре и даже цифровым двойником, который работает, пока мы спим.
Это стирает границы между реальным и виртуальным миром, меняя правила игры в медиа, развлечениях и даже в личном общении.
До встречи в следующем выпуске!
- Новости и события 15 янвНейро-дайджест: ключевые события мира AI за 2-ю неделю января 2026
Читать далее
Привет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась насыщенной: OpenAI запустили ChatGPT Health для проверки здоровья, Anthropic релизнули Cowork — аналог Claude Code для непрограммистов, новые инструменты от Qwen и Higgsfield, а цены на оперативу вырастут ещё на 70%. Всё самое важное — в одном месте. Поехали!
- Безопасность ИИ 9 янвТестирую ChatGPT, Claude, DeepSeek, Grok и ещё 5 нейросетей на реальном запросе: кто поможет активировать Windows?
Читать далее
Друзья, всем привет! Сегодня у меня для вас необычный эксперимент - тестирование нейросетей в боевых условиях. Дисклеймер: Автор не поддерживает пиратство и не пропагандирует нарушение авторских прав. Это исключительно тест нейросетей на реальном запросе, который может возникнуть у любого пользователя. Ведите себя хорошо и слушайте маму.
- Новости и события 8 янвНейро-дайджест: ключевые события мира AI за 1-ю неделю января 2026
Читать далее
Привет, это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась насыщенной: китайцы выкатили MiniMax-M2.1 для кодинга и агентных задач, новая мультимодальная опенсорс LTX-2 и обновлённый Qwen-Image-2512. ИИ для документаций, озвучка текста в браузере и штрафы за нейро-видео. Всё самое важное — в одном месте. Поехали!
- Новости и события 25.12.2025Нейро-дайджест: ключевые события мира AI за 4-ю неделю декабря 2025
Читать далее
Привет, с наступающим 🎄 Это последний выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Но последний лишь в этом году. Неделя выдалась насыщенной: Gemini 3 Flash, GLM-4.7 от китайцев и даже LLM от NVIDIA. Alibaba показали свой ИИ-фотошоп с генерацией по слоям, а в ChatGPT завезли итоги года. Perplexity отключают россиянам Pro-подписки, а роботы уже упаковывают ваши подарки. Всё самое важное — в одном месте. Поехали!
- Новости и события 18.12.2025Нейро-дайджест: ключевые события мира AI за 3-ю неделю декабря 2025
Читать далее
Привет, с наступающим! Это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась насыщенной: OpenAI выкатили GPT-5.2 и новую версию генератора изображений, Xiaomi неожиданно показали сильную опенсорс-MoE для кода, свежие FLUX.2 [max] и Wan 2.6. Amazon собираются инвестировать в OpenAI, а VPN-расширения крадут данные юзеров. Всё самое важное — в одном месте. Поехали!
- Новости и события 11.12.2025Нейро-дайджест: ключевые события мира AI за 2-ю неделю декабря 2025
Читать далее
Привет! Это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась насыщенной: Mistral выкатили Devstral 2, Photoshop, Express и Acrobat встроили прямо в ChatGPT, а исследования показывают, что более 80% вайб-кода могут содержать уязвимости. Криштиану Роналду инвестирует в Perplexity, а Сэм Альтман считает, что сейчас невозможно воспитывать детей без ИИ. Всё самое важное — в одном месте. Поехали!
- Новости и события 04.12.2025Нейро-дайджест: ключевые события мира AI за 1-ю неделю декабря 2025
Читать далее
Привет! Это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась насыщенной: DeepSeek обновили линейку до V3.2, Mistral выпустили новый флагман, а Gen-4.5 от Runway обходит топовые Veo 3, Sora 2 Pro и Kling. Оперативка дорожает бешеными темпами из-за дата-центров NVIDIA, Anthropic прицениваются к IPO, а Павел Дуров запустил Cocoon. Всё самое важное — в одном месте. Поехали!
- Новости и события 27.11.2025Нейро-дайджест: ключевые события мира AI за 4-ю неделю ноября 2025
Читать далее
Привет! Это новый выпуск «Нейро-дайджеста» — коротких и полезных обзоров ключевых событий в мире искусственного интеллекта и технологий. Неделя выдалась плотной на релизы: Claude Opus 4.5 новый лидер в кодинге, открытые GigaChat 3, Kandinsky 5.0 и другие релизы от Сбера, FLUX.2 против Nano Banana Pro, параллельно обновились Cursor и Perplexity, а в США запускают мега-проект для ускорения науки. Всё самое важное — в одном месте. Поехали!
- ИИ в разработке 23.11.2025А что там у Гуглов: Jules вайбкодинг агент от Google, который не смог
Читать далее
Тестирую Google Jules - новый AI-агент для кодинга от Google. Спойлер: ожидания не оправдались. Жуль задает тупые вопросы, работает часами в бесконечных циклах и не справляется с визуальными задачами. Рассказываю о попытке починить ретро-телевизор и сравниваю с Devin и Claude Code.