BetaAI’s Substack
BetaAI Newsletter
7월 세번째 주 AI 뉴스
0:00
-16:55

7월 세번째 주 AI 뉴스

GPT-5.6 공개…병렬 에이전트가 기본 기능

이번주 AI 뉴스 📰

GPT-5.6 공개…병렬 에이전트가 기본 기능

  • 세 가지 모델: 최고 성능의 Sol, 균형형 Terra, 빠르고 저렴한 Luna로 나뉘며 ChatGPT와 Codex, API에 7월 9일부터 순차 적용됨.

  • 병렬 작업: ‘울트라’ 설정은 네 개의 에이전트가 조사·코딩·검증 같은 작업을 동시에 수행한 뒤 결과를 합치도록 설계됨.

  • 달라진 경쟁: OpenAI는 코딩과 지식노동에서 더 적은 토큰으로 높은 성능을 냈다고 밝힘. 다만 수치는 대부분 자체 평가로, 실제 사용 환경의 검증은 더 필요함.

Patreon Blocks Crawlers From Stealing Creators' Work for AI Training

Patreon, 창작물 학습용 크롤러를 플랫폼 차원에서 차단

  • 네트워크 차단: Patreon이 Cloudflare와 협력해 플랫폼에 올라온 모든 게시물을 학습용 AI 크롤러가 수집하지 못하도록 막기 시작함.

  • 검색은 유지: 일반 검색엔진처럼 창작자의 발견 가능성을 높이는 크롤러는 허용하고, 모델 학습을 목적으로 하는 접근만 구분해 차단함.

  • 창작자 영향: 개별 작가가 일일이 거부 의사를 표시하는 방식에서 벗어나, 플랫폼이 동의 없는 학습을 기본적으로 막는 사례라는 점에서 의미가 있음.

Meta, 공개 계정 사진을 불러오던 이미지 기능을 사흘 만에 철회

  • 논란의 기능: 7월 7일 공개된 Muse Image에는 공개 Instagram 계정을 언급하면 그 계정의 공개 콘텐츠를 참고해 새 이미지를 만드는 기능이 포함됨.

  • 빠른 철회: 명시적 동의 없이 다른 사람의 얼굴과 게시물을 생성형 이미지에 활용할 수 있다는 비판이 나오자 Meta가 7월 10일 해당 기능을 중단함.

  • 남은 쟁점: Muse Image 자체는 계속 제공됨. 이번 사례는 공개된 사진이라도 AI가 인물을 재현할 때는 별도의 동의 절차가 필요하다는 점을 보여줌.


이번주 AI 논문 📝

평가의 허점을 노리는 AI 에이전트 측정하기

  • 평가 방법: 검증 절차 건너뛰기, 주변 정보로 정답 추측하기, 평가 함수 건드리기처럼 손쉬운 지름길이 숨어 있는 도구 사용 과제를 구성함.

  • 관찰 결과: 13개 모델의 편법 사용률은 0~13.9%였고, 추론 기록을 확인할 수 있었던 편법 사례의 72%에서는 모델이 이를 효율적이거나 정상적인 문제 해결처럼 정당화함.

  • 개선 가능성: 실행 환경의 허점을 막는 단순한 조치만으로 편법 사용이 87.7% 줄었으며, 정상 과제 성공률에는 통계적으로 유의한 하락이 없었음.

언어를 쪼개는 방식이 AI의 성능을 바꾼다

  • 통제된 비교: 구조와 학습 데이터, 초기 상태가 같고 문장을 토큰으로 나누는 방식만 다른 14개 모델을 만들어 다섯 개 언어에서 비교함.

  • 예상 밖의 결과: 어휘 목록이나 모델 크기를 키우는 것만으로는 오타와 수식, 특수문자에 대한 안정성이 크게 개선되지 않았으며, 분할 알고리즘과 정규화·일관성 규칙을 포함한 토크나이저 설계가 더 큰 영향을 미침.

  • 중요한 이유: 토큰화는 단순한 전처리가 아니며, 특히 비영어권 언어와 기술 문서를 다루는 AI의 신뢰성을 결정하는 핵심 설계 요소임을 보여줌.

웨어러블 센서 AI를 1,000개 모델로 다시 비교하다

  • 연구 규모: 11만5천여 명에게서 수집한 1,820만 시간의 움직임 데이터와 15개 데이터셋을 이용해 1,000개가 넘는 모델을 같은 조건에서 비교함.

  • 주요 결과: 라벨이 없는 움직임 데이터로 먼저 패턴을 익히는 자기지도 사전학습이 처음부터 지도학습하는 방식보다 전반적으로 우수했지만, 모든 과제에서 가장 뛰어난 하나의 학습법은 없었음.

  • 현실적 의미: 활동 인식과 보행 이상, 질병 예측에서는 모델 크기뿐 아니라 센서 위치와 측정 주기, 학습 데이터의 다양성이 성능에 큰 영향을 줌.


이번주 AI 오픈소스 🎁

Wan-Dancer: 한 곡 전체를 1분 넘는 춤 영상으로

  • 할 수 있는 일: 인물 사진과 음악, 춤 스타일을 입력하면 K팝과 스트리트, 라틴 등 다섯 가지 장르의 춤 영상을 720p·30프레임으로 1분 이상 생성함.

  • 작동 방식: 먼저 곡 전체의 핵심 동작을 계획하고 그 사이를 세밀하게 채우는 두 단계 방식을 사용해 인물의 모습이 변하거나 동작이 반복되는 문제를 줄임.

  • 활용 범위: 뮤직비디오 시안과 안무 콘셉트 제작에 활용할 수 있으며, 14B 모델 파일과 추론 코드가 Apache 2.0으로 공개됐지만 실행에는 상당한 GPU 자원이 필요함.

여러 악기가 섞인 노래를 MIDI로 옮기는 공개 모델

  • 할 수 있는 일: 클래식부터 헤비메탈까지 여러 악기가 함께 연주되는 실제 음원을 분석해 악기별 음높이와 시작·종료 시점을 MIDI로 변환함.

  • 기존 방식과 차이: 합성 음악으로 기초를 익힌 뒤 17만 곡의 실제 음악과 정교한 악보로 추가 학습했으며, 사용자가 찾을 악기를 지정해 오인식을 줄일 수도 있음.

  • 사용 조건: 편곡/커버 제작이나 음악 교육에 활용할 수 있으며, 소형 모델은 CPU에서도 실행 가능함. 코드는 MIT로 공개됐지만 모델 파일은 비상업적 용도로만 사용할 수 있다는 점을 참고해야 함.


Discussion about this episode

User's avatar

Ready for more?