Llama Nemotron: семейство открытых моделей от Nvidia обходит DeepSeek R1 в рассуждении и математике
19 марта 2025
Llama Nemotron: семейство открытых моделей от Nvidia обходит DeepSeek R1 в рассуждении и математике
NVIDIA анонсировала семейство открытых моделей Llama Nemotron с продвинутыми возможностями в задачах рассуждения. Дообучение моделей Llama 3.3 и 3.1 позволило Nvidia улучшить их точность на 20% при достижении в 5…
Метод Chain-of-Experts повышает эффективность MoE моделей, снижая потребление памяти до 42%
11 марта 2025
Метод Chain-of-Experts повышает эффективность MoE моделей, снижая потребление памяти до 42%
Chain-of-Experts (CoE) — новый подход, фундаментально изменяющий обработку информации в разреженных языковых моделях (sparse language models), увеличивающий производительность модели при значительно меньшем потреблении памяти. Метод решает ключевые ограничения Mixture-of-Experts моделей,…
R1-Onevision: открытая мультимодальная 7B модель обходит GPT4o в рассуждениях и математике
27 февраля 2025
R1-Onevision: открытая мультимодальная 7B модель обходит GPT4o в рассуждениях и математике
Исследователи из Чжэцзянского университета представили R1-Onevision, открытую мультимодальную модель рассуждений с 7 миллиардами параметров. R1-Onevision решает сложные математические, научные и инженерные задачи с показателями производительности, превосходящими GPT-4o в математике и…
Step-Video-T2V: генератор видео из текста с коэффициентом сжатия 16x
20 февраля 2025
Step-Video-T2V: генератор видео из текста с коэффициентом сжатия 16x
Исследователи из Stepfun AI представили Step-Video-T2V, text-to-video модель с 30 миллиардами параметров, способную генерировать видео длиной до 204 кадров, с разрешением 544×992. Модель принимает промпты на китайском и английском языках.…
Adobe Firefly: первое коммерчески безопасная модель для генерации видео
13 февраля 2025
Adobe Firefly: первое коммерчески безопасная модель для генерации видео
Adobe выпустила модель генерации видео Firefly в открытый доступ. Firefly Video была разработана специально для коммерческого использования. Firefly решает ключевые проблемы бизнеса, связанные с авторскими правами и юридической безопасностью сгенерированного…
На каком языке «мыслят» большие языковые модели
30 января 2025
На каком языке «мыслят» большие языковые модели
Новое исследование EPFL проливает свет на внутренние механизмы обработки многоязычных данных в LLM, что критично для понимания принципов работы современных языковых моделей и их оптимизации. Исследователи применили метод Logit lens…
Токенизатор TA-TiTok от Bydedance обновил бенчмарки в генерации изображений при обучении на открытых данных
19 января 2025
Токенизатор TA-TiTok от Bydedance обновил бенчмарки в генерации изображений при обучении на открытых данных
ByteDance и POSTECH представили токенизатор TA-TiTok (Text-Aware Transformer-based 1-Dimensional Tokenizer), новый подход к созданию доступных и эффективных text-to-image моделей. Маскированная генеративная модель MaskGen с токенизотором TA-TiTok достигла SOTA для text-to-image…
MiniMax-01: открытая языковая модель с Lightning Attention лидирует на бенчмарках с контекстом 4M
15 января 2025
MiniMax-01: открытая языковая модель с Lightning Attention лидирует на бенчмарках с контекстом 4M
MiniMax выложил в open source модели MiniMax-01 с 456 миллиардами параметров: MiniMax-Text-01 для текстовых и MiniMax-VL-01 для визуально-языковых задач. MiniMax-01 стабильно обходит GPT-4o и Gemini-2 на бенчмарках с длинным контекстом,…
На CES 2025 Nvidia представила серию GPU RTX 50 и микросервисы NIM для локального запуска ИИ-пайплайнов
7 января 2025
На CES 2025 Nvidia представила серию GPU RTX 50 и микросервисы NIM для локального запуска ИИ-пайплайнов
Nvidia анонсировала крупное обновление на выставке CES 2025, включающее новые графические процессоры RTX 50 и микросервисами NIM для локального развертывания крупных моделей от таких провайдеров, как Black Forest Labs, Meta…
ArtAug: мультиагентный открытый фреймворк для улучшения генерации изображений
18 декабря 2024
ArtAug: мультиагентный открытый фреймворк для улучшения генерации изображений
Исследователи Alibaba Group представили фреймворк ArtAug для улучшения качества генерации изображений из текста без дополнительных вычислительных затрат на этапе инференса, используя взаимодействие между генеративными и понимающими (understanding) моделями. Архитектура ArtAug…
Sora Turbo: состоялся публичный релиз новой модели OpenAI для создания видео
10 декабря 2024
Sora Turbo: состоялся публичный релиз новой модели OpenAI для создания видео
OpenAI объявила о публичном релизе Sora Turbo, значительно улучшенной версии своей гиперреалистичной text-to-video, image-to-video и video-to-video модели. Презентация прошла на конференции «12 дней OpenAI», спустя почти 10 месяцев после первой…
Vinteo AI — нейросеть, которая создает реалистичные визуализации товаров за 2 минуты
7 декабря 2024
Vinteo AI — нейросеть, которая создает реалистичные визуализации товаров за 2 минуты
Vinteo AI — SAAS на основе ИИ специализирующуюся на разработке решений в области искусственного интеллекта для визуальной презентации товаров. Нейросеть обеспечивает оперативное и экономически рациональное создание фотореалистичных изображений товаров в…
Создание игр на основе искусственного интеллекта: новый бесплатный курс от DeepLearning.AI
2 декабря 2024
Создание игр на основе искусственного интеллекта: новый бесплатный курс от DeepLearning.AI
DeepLearning.AI представил образовательный курс Building an AI-Powered Game. Программа курса фокусируется на практическом применении языковых моделей в разработке игр и предназначена для разработчиков разного уровня подготовки. Длительность курса — 1…
X-MeshGraphNet: фреймворк от NVIDIA для физического моделирования на основе графовых нейросетей
27 ноября 2024
X-MeshGraphNet: фреймворк от NVIDIA для физического моделирования на основе графовых нейросетей
Исследователи NVIDIA представили X-MeshGraphNet, новое расширение для MeshGraphNet, которое значительно упрощает создание физических моделей и решает проблемы масштабируемости. Этот фреймворк позволяет создавать сложные физические модели, устраняя зависимость от предварительно сгенерированных…
FinRobot: открытый мультиагентный фреймворк для анализа рынка акций
16 ноября 2024
FinRobot: открытый мультиагентный фреймворк для анализа рынка акций
Исследователи AI4Finance Foundation представили открытую модель FinRobot — фреймворк AI-агентов, специально разработанный для анализа рынка акций. FinRobot объединяет количественный и качественный анализ через трехуровневый подход Chain of Thought (CoT). Модель…
SmolLM2: открытая компактная LLM от Hugging Face превосходит Llama-1B и Qwen2.5-1.5B
6 ноября 2024
SmolLM2: открытая компактная LLM от Hugging Face превосходит Llama-1B и Qwen2.5-1.5B
Компания Hugging Face представила SmolLM2 — новое семейство компактных языковых моделей, которое преводсходит существующие state-of-the-art модели. Так версия с 1.7B параметров опережает Llama-1B и Qwen2.5-1.5B на нескольких ключевых бенчмарках: 68.7%…
SynthID от DeepMind: открытое решение для маркировки текста, генерируемого ИИ
31 октября 2024
SynthID от DeepMind: открытое решение для маркировки текста, генерируемого ИИ
Компания DeepMind представила SynthID Text — новое открытое решение для маркировки генерируемого нейросетями текста, расширив тем самым свою экосистему идентификации ИИ-контента. Решение уже доступно в библиотеке Hugging Face Transformers v4.46.0+.…
Mochi 1: открытая модель генерации видео от Genmo
23 октября 2024
Mochi 1: открытая модель генерации видео от Genmo
Mochi 1 — открытая модель генерации видео с архитектурой Asymmetric Diffusion Transformer (AsymmDiT) от Genmo AI. Mochi 1 содержит 10 миллиардов параметров, сокращая имеющийся разрыв в качестве между закрытыми и открытыми…
В Hailuo AI появилась возможность генерировать видео на основе изображения
9 октября 2024
В Hailuo AI появилась возможность генерировать видео на основе изображения
Платформа для генерации видео Hailuo AI запустила новую функцию Image-to-Video, позволяющую преобразовывать статичные изображения в динамичные видеоролики. После своего релиза в сентябре 2024 года Hailuo AI, созданная китайским стартапом MiniMax,…
MinerU — open-source модель для извлечения данных из документов с точностью 93,5%
30 сентября 2024
MinerU — open-source модель для извлечения данных из документов с точностью 93,5%
MinerU — open-source модель для извлечения и структурирования контента из документов, представленная исследователями из Лаборатории Искусственного Интеллекта Шанхая. MinerU автоматизирует извлечение текста, формул, таблиц и изображений из документов, таких как…
Molmo: семейство открытых мультимодальных моделей обходит Claude 3.5 и Gemini 1.5 тестах
26 сентября 2024
Molmo: семейство открытых мультимодальных моделей обходит Claude 3.5 и Gemini 1.5 тестах
Molmo — семейство мультимодальных моделей Vision-Language (VLM), разработанных исследователями из Allen Institute for AI и Университета Вашингтона. Семейство моделей Molmo превосходит многие проприетарные и открытые state-of-the-art модели по результатам академических…