New Relic представила AI Evaluation для оценки ИИ-транзакций
New Relic выпустила AI Evaluation — фреймворк в составе AI Observability, который оценивает качество и поведение ИИ на уровне транзакций, а не отдельных вызовов LLM. Система использует «LLM-as-a-judge», привязывает оценки к распределённым трейсам и проверяет гардрейлы на промпт-инъекции, утечки PII и галлюцинации.
- Оценка идёт на уровне транзакций, а не отдельных вызовов LLM
- Асинхронный сервис «LLM-as-a-judge» сканирует живую телеметрию
- Оценки качества привязываются к распределённым трейсам
- Гардрейлы ловят промпт-инъекции, джейлбрейки и утечки PII
Читать дальше
Софт