제품마다 다른 안전 정책을 추론 시점에 적용할 수 있는 3B 멀티모달 안전 분류기 Shieldstral이 Apache 2.0으로 공개됨 고정된 유해성 분류 체계 대신 자연어 정책을 예·아니요 질문으로 받아 텍스트와 이미지를 하나의 인터페이스에서 평가함 yes와 no 로짓을 정규화한 연속 안전 점수를 반환해, 재학습 없이 정책을 바꾸고 신뢰도에 따라 임곗값을 설정하거나 결과를 정렬할 수 있음 이질적인 안전 데이터 통합, 유사 정책을 구별하는 대조 데이터, 이미지 데이터 보강·필터링, LoRA 체크포인트의 SLERP 병합을 훈련에 활용함 단일 16GB NVIDIA GPU에서 실행되며, 훈련에서 제외한 표본을 사용한 네 가지 평가 축에서 최대 7배 큰 오픈 가드 모델과 대등하거나 더 높은 성능을 기록함 고정 분류 체계 대신 추론 시점에 정책 적용 기존 가드레일 모델은 유해성 범주를 가중치에 내장하므로 새로운 제품이나 배포 환경에 맞추려면 다시 훈련해야 함 같은 콘텐츠라도 사이버보안 연구 도구에서는 허용될 수 있지만 정신건강 플랫폼에서는 유해할 수 있어, 모든 애플리케이션에 맞는 단일 안전 범주 집합은 없음 Shieldstral은 정책을 자연어 질문으로 전달받아 추론 시점에 적용하므로 하나의 체크포인트를 새로운 정책에 맞출 수 있음 텍스트와 이미지를 같은 방식으로 평가하고, 단일 토큰에서 계산한 보정된 안전 점수를 반환함 Shieldstral-1.0-3B는 NVIDIA 등과 함께한 Open Secure AI Alliance의 첫 구성원 모델로서 Apache 2.0 오픈 가중치로 공개됨 구체적인 구성과 평가는 기술 보고서에서 확인할 수 있음 콘텐츠 검열을 이진 질의응답으로 구성 각 요청은 instruction–query–document 형식의 세 부분으로 구성됨 <Instruct>: 평가 맥락과 엄격성을 지정하고, 필요하면 안전하지 않은 콘텐츠의 정의를 추가함 <Query>: “이 콘텐츠가 물리적 폭력을 조장하는가?”와 같은 하나의 예·아니요 질문을 입력함 <Document>: 프롬프트, 응답, 프롬프트–응답 쌍 또는 선택적 텍스트가 포함된 이미지를 제공함 추론 과정에서는 yes와 no 로짓만 읽고 소프트맥스로 정규화해 연속 안전 점수를 계산함 하나의 형식으로 프롬프트 분류, 응답 검열, 거부 감지, 독성 감지를 처리함 정책 전체가 프롬프트에 들어가므로 배포 단계에서 체크포인트를 재학습하...
Shieldstral - 멀티모달 콘텐츠 검열을 위한 3B 오픈 가중치 모델
2 weeks ago
16
Related
SSL에 대해 배운 모든 것이 더는 유효하지 않음 [유튜브]
5 hours ago
2
YC CEO Garry Tan이 말하는 창업자의 새로운 규칙 [유튜브]
5 hours ago
1
Computer Use와 Skills/Files API로 프로덕션 에이전트 구축하기
5 hours ago
1
Rust nightly, 차세대 트레이트 솔버 기본 활성화
6 hours ago
1
KDE에 Btrfs 스냅샷을 통합하는 KIO Snapshot
6 hours ago
1
더 나은 배터리
6 hours ago
1
Rust 1.98.0 발표
6 hours ago
1
Tips
click
Popular
마키나락스, 중견 제조사 현장에 AI 네이티브 팩토리 구축한다
4 weeks ago
64
제니, 빌보드 라디오 차트 1위…'골든' 이어 두 번째
3 weeks ago
62
라온시큐어 화이트해커 23명, 국제 해킹 대회 '데프콘 CTF 2026' 본선행
3 weeks ago
56
'산골총각 영웅' 차승원·김도훈 합류…임영웅과 찰떡+힐링 케미
3 weeks ago
46
© Clint IT 2026. All rights are reserved

![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)








English (US) ·