Исследователи из компании Mem0 разработали две архитектуры памяти — Mem0 и Mem0g, — которые повышают способность больших языковых моделей (LLM) запоминать и использовать информацию в длительных диалогах. Это решение устраняет ключевое ограничение современных LLM: неспособность эффективно работать с данными за пределами их контекстного окна, даже если оно расширено до миллионов токенов. По словам Таранджит Сингха, […]
языковые модели
Корпорация Xiaomi анонсировала MiMo, свою первую крупную языковую модель с открытым исходным кодом, ориентированную на выполнение задач, требующих логического и математического анализа. Разработка сочетает стратегии предварительного и посттренинга для улучшения способностей к рассуждению. Несмотря на скромные для индустрии 7 млрд параметров, MiMo демонстрирует результаты выше, чем у более крупных моделей, в публичных тестах. По данным Xiaomi, […]
Исследователи из Университета Буффало совершили прорыв в области медицинского искусственного интеллекта: их метод Semantic Clinical Artificial Intelligence (SCAI) позволил языковым моделям значительно улучшить результаты на экзамене USMLE — тесте для получения медицинской лицензии в США. Ключевой компонент технологии, механизм RAG, обогащает модель структурированными клиническими данными, что особенно помогло компактным версиям ИИ. Например, модель с 13 […]
Компания Anthropic, известная своим ИИ-ассистентом Claude, провела крупнейшее исследование моральных принципов искусственного интеллекта в реальных условиях. Учёные проанализировали 700 000 анонимных диалогов пользователей с системой, чтобы понять, насколько её поведение соответствует заявленным ценностям «полезности, честности и безвредности». Это первый случай, когда разработчики ИИ публично изучили, как их технология проявляет этику в живом общении — от […]
OpenAI, известная своими разработками в области искусственного интеллекта, включая ChatGPT, рассматривала возможность приобретения стартапа Anyspree и его продукта Cursor — платформы для написания кода с помощью ИИ — ещё до начала переговоров о покупке Windsurf. Об этом сообщили CNBC два анонимных источника. По их данным, первое обращение OpenAI к Anysphere произошло в прошлом году, а […]
Стартап Deep Cogito представил семейство открытых языковых моделей Cogito v1. Проект, основанный на архитектуре Llama 3.2 от Meta*, сочетает мгновенные ответы с функцией «саморефлексии» — способностью перепроверять и улучшать собственные выводы, аналогично моделям OpenAI «o»-серии и DeepSeek R1. Все модели компании доступны под открытой лицензией Llama, разрешающей коммерческое использование до 700 млн пользователей в месяц. Основатель и […]
Стартап Deep Cogito представил семейство открытых языковых моделей Cogito v1. Проект, основанный на архитектуре Llama 3.2 от Meta*, сочетает мгновенные ответы с функцией «саморефлексии» — способностью перепроверять и улучшать собственные выводы, аналогично моделям OpenAI «o»-серии и DeepSeek R1. Все модели компании доступны под открытой лицензией Llama, разрешающей коммерческое использование до 700 млн пользователей в месяц. Основатель и […]
Несмотря на популярность крупных языковых моделей, компании всё чаще обращаются к компактным решениям, чтобы сократить энергозатраты и расходы на вычисления. В ответ на этот тренд Google выпустила третью версию своей малой языковой модели Gemma 3, сохранившей производительность «старших» моделей Gemini 2.0, но оптимизированной для работы на устройствах с ограниченными ресурсами — смартфонах, ноутбуках и серверах […]










