LoRA эффективно осуществляет финнастройку крупных моделей, но испытывает трудности с обработкой сложных фактических знаний. RS-LoRA обеспечивает стабильность обучения при более высоких рангах с помощью простой настройки масштабирования.
Рефакторинг псевдообратной матрицы с помощью нормальных уравнений упрощает код для машинного обучения. Разложение Холески снижает сложность обработки матриц обучающих данных в задачах машинного обучения.
Конечные точки Amazon SageMaker AI позволяют организациям управлять вычислительными ресурсами и размещением инфраструктуры, одновременно используя преимущества управляемого операционного уровня AWS. SDK Strands Agents упрощает создание ИИ-агентов, интеграцию с моделями SageMaker AI и проведение A/B-тестирования для постоянного совершенствования.
MOSS-Audio, разработанная OpenMOSS, MOSI. AI и Шанхайским институтом инноваций, представляет собой модель с открытым исходным кодом, объединяющую в себе функции распознавания речи, звуков, музыки и многое другое. Она состоит из четырёх вариантов, оптимизированных для различных задач, и основана на модульной архитектуре, включающей аудиокодер, адаптер модальности и крупную языковую модель.
Развитие искусственного интеллекта приведет к росту энергопотребления в дата-центрах США; Массачусетский технологический институт (MIT) и IBM разрабатывают инструмент для оперативного прогнозирования энергопотребления с целью обеспечения устойчивой эффективности ИИ. Этот инструмент позволяет быстро оценивать энергопотребление, что помогает операторам дата-центров и разработчикам алгоритмов.
PageIndex революционизирует процесс поиска документов благодаря использованию деревовидного индекса и моделей большого языкового обучения (LLM) для логического вывода, превосходя по эффективности векторные системы, такие как RAG. Проиндексировав статью о Transformer без использования векторов, PageIndex демонстрирует свою точность и способность к глубокому пониманию, что делает его настоящим п...
Индийский студент-программист создал GitNexus для оптимизации работы агентов по написанию кода на базе ИИ. GitNexus заранее вычисляет всю структуру зависимостей для точного анализа кода.
В новой статье Google представлена модель Vision Banana — универсальная модель, которая демонстрирует высокую эффективность при решении различных задач компьютерного зрения, сохраняя при этом способность генерировать изображения. Этот прорыв ставит под сомнение традиционное разделение на генеративные и дискриминативные модели в области компьютерного зрения.
MathNet, созданный исследователями из MIT, KAUST и HUMAIN, представляет собой крупнейший набор данных, содержащий математические задачи с доказательствами, охватывающий 47 стран и 17 языков. Он представляет собой централизованную коллекцию высококачественных задач и решений из международных математических олимпиад, предлагая моделям искусственного интеллекта и учащимся богатый ресурс для изуче...
Google DeepMind представляет Decoupled DiLoCo — архитектуру распределенного обучения, которая устраняет узкие места, связанные с синхронизацией, и позволяет проводить предварительное обучение крупных языковых моделей в географически удаленных дата-центрах. Decoupled DiLoCo снижает требования к пропускной способности межцентровой сети с 198 Гбит/с до всего 0,84 Гбит/с, что делает обучение в гло...
DeepSeek-AI представляет серию DeepSeek-V4 с инновационными моделями MoE, поддерживающими контекстные окна объемом в миллион токенов. Гибридная архитектура внимания и гиперсвязи с ограничением многообразия (Manifold-Constrained Hyper-Connections) кардинально меняют подход к решению задач с длинным контекстом.
Исследователи из Google Cloud AI, Университета Иллинойса в Урбана-Шампейне и Йельского университета представляют ReasoningBank — систему памяти, которая выделяет причины успеха или неудачи задач, выполняемых агентами искусственного интеллекта. Существующие системы памяти агентов имеют серьезные «слепые зоны», однако ReasoningBank извлекает релевантные воспоминания для повышения эффективности р...
Достижения в области искусственного интеллекта в здравоохранении позволяют объединять разрозненные потоки данных, что способствует принятию более обоснованных решений в сфере персонализированной медицины. Мультимодальные системы BioFM, такие как Latent-X1 и Evo 2, кардинально меняют подход к открытию новых лекарственных препаратов и клиническим испытаниям благодаря моделям искусственного интел...
Команда Qwen компании Alibaba представила модель Qwen3.6-27B, инновационную плотную модель для создания программных агентов, обладающую передовыми функциями агентного программирования и сохранения логики работы. Эта модель превосходит предыдущие версии по ключевым показателям и делает акцент на практической применимости, а не только на оптимизации для тестов.
Исследователи из Массачусетского технологического института (MIT) разработали метод RLCR для повышения точности оценок уверенности моделей искусственного интеллекта, что позволяет сократить количество ошибок на 90 % без ущерба для общей точности. Данная методика обучает модели выдавать откалиброванные оценки уверенности, решая проблему завышенной уверенности в моделях искусственного интеллекта...