Темпы развития ИИ удвоились, но доверие к бенчмаркам падает: отчет Epoch AI В обзоре за 2025 год Epoch AI зафиксировала

Темпы развития ИИ удвоились, но доверие к бенчмаркам падает: отчет Epoch AI В обзоре за 2025 год Epoch AI зафиксировала...

26 декабря в 05:37•

@ai_machinelearning_big_data•технологии

Темпы развития ИИ удвоились, но доверие к бенчмаркам падает: отчет Epoch AI В обзоре за 2025 год Epoch AI зафиксировала резкое ускорение прогресса развития ИИ. По данным аналитиков, индустрия прошла «переломную точку»: скорость улучшения показателей SOTA-моделей выросла почти в 2 раза — с 8 до 15 пунктов индекса производительности за год. Драйверами роста называют массовый переход к ризонинг-моделям и фокус на RL. Однако, отчет указывает на серьезную проблему: результаты тестов становятся всё менее репрезентативными. Даже при использовании одинаковых бенчмарков прямое сравнение моделей затруднено из-за различий в промптах, параметрах сэмплирования и программных обвязках. Последние особенно сильно искажают оценку ИИ-агентов, а нестабильность API провайдеров добавляет шум в данные, делая метрики новых моделей уязвимыми для ошибок измерения. epoch.ai ️ Salesforce теряет доверие к большим языковым моделям. В компании заметили, что первоначальный энтузиазм сменился более прагматичным взглядом. LLM оказываются ненадежными для бизнес-задач. Год назад оптимизма было больше, но теперь разработчики возвращаются к проверенной автоматизации на основе правил. Основная причина — непредсказуемость ИИ. Модели часто «дрейфуют», теряя контекст разговора или игнорируют инструкции. Чтобы сделать корпоративный софт предсказуемым, Salesforce переходит на жесткие ограничения. Вместо креатива нейросети теперь будет работать строгая логика выполнения сценариев. theinformation.com ️ Китай требует от Apple Intelligence отклонять 95% провокационных запросов. Для легального запуска Apple Intelligence в КНР компании придется доказать соответствие своих алгоритмов жестким стандартам местной цензуры. Поскольку иностранные LLM в стране заблокированы, Apple вынуждена использовать локальное решение — модель Qwen3 от Alibaba, которая сейчас проходит государственную аттестацию. Регламент проверки серьезный: регуляторы используют пул из 2 тыс. специально подобранных вопросов, касающихся политики и других чувствительных тем. Чтобы получить разрешение на релиз, нейросеть обязана отказаться отвечать минимум на 95% таких промптов. Процедура настолько сложна, что на китайском рынке сформировалась ниша консалтинговых агентств, которые помогают техно-гигантам настраивать фильтры моделей именно под этот тест. 9to5mac.com ️ Microsoft опровергла слухи о переписывании Windows на Rust с помощью ИИ. Компания заявила, что не планирует переписывать ядро операционной системы с использованием генеративных моделей. Поводом для спекуляций стал вирусный пост ведущего инженера Microsoft Галена Ханта в LinkedIn, где онописал цель — полностью избавиться от C/C++ к 2030 году и достичь производительности «один инженер, один месяц, миллион строк кода» за счет автоматизации. IT-сообщество интерпретировало это как анонс глобального рефакторинга Windows 11. В ответ Microsoft пояснила, что описанный сценарий относится лишь к исследовательским проектам по миграции легаси-кода, а не к продуктовой стратегии ОС. Хант также внес правки в публикацию, снизив градус категоричности. windowslatest.com ️ xAI запустила Grok Collections API. xAI представила инструмент для разработчиков, который упрощает создание RAG-приложений - Grok Collections API. Он берет на себя задачи по хранению, индексации и семантическому поиску по документам, избавляя инженеров от необходимости строить векторные баз данных. Решение использует технологию layout-aware parsing с использованием OCR и может сохранять структуру исходников: таблицы, макеты PDF и синтаксис кода остаются читаемыми для модели. По внутренним бенчмаркам xAI, в задачах на точность извлечения данных новый сервис превосходит показатели Gemini 3 Pro и GPT-5.1. Стоимость - $2.50 за 1000 поисковых запросов и, по словам xAI, загруженные в Collections файлы не используются для дообучения базовых моделей без явного согласия. x.ai @ai_machinelearning_big_data #news #ai #ml

Теги:

Epoch_AI

Salesforce

Apple