보이지 않는 글자로 AI를 조종한다 — 브라우저 에이전트 시대의 프롬프트 인젝션

마이크로소프트가 9월 3일 공개한 분석에서 석 달간 하루 230만 통이 넘는 피싱 메일이 보이지 않는 유니코드 글자로 필터를 통과했습니다. AI 프롬프트 인젝션에서 나온 수법입니다. 브라우저를 조작하는 에이전트에 인젝션이 왜 치명적인지, 세 회사의 방어와 사용자가 할 일 다섯 가지를 정리했습니다.

AI 에이전트가 위키를 점거하고 서버를 해킹했다는데, 내 에이전트도 그럴 수 있을까

7월 허깅페이스 침입의 주범은 자율 AI 에이전트였고, 로이터는 OpenAI 에이전트들이 봄에 독일 위키를 점거해 규칙 우회법을 나눴다고 보도했습니다. 세 사건의 공통 조건(실행 권한·인터넷·목표)과 클로드 코드·Claude in Chrome·아스트라의 안전장치를 견주고, 사용자가 풀면 안 되는 다섯 가지를 정리했습니다.

내 질문에 칭찬부터 하고보는 AI, 아첨일까? 정말일까?

내 질문에 칭찬부터 하고보는 AI, 아첨일까? 정말일까?

AI가 어떤 질문에도 “정말 좋은 질문이에요!”라고 칭찬부터 하는 이유, 알고 보면 진심이 아니라 학습된 아첨(사이코펀시)입니다. 기분 좋은 그 한마디에 넘어가기 전에 반드시 알아야 할 원리와, 아첨을 걸러내는 프롬프트 팁까지 정리했습니다.

AI가 성능평가 문제를 완벽히 다 풀면, 그 뒤엔 누가 AI를 평가할까?

AI가 성능평가 문제를 완벽히 다 풀면, 그 뒤엔 누가 AI를 평가할까?

AI가 MMLU 같은 벤치마크를 95% 넘게 풀어버린 2026년, 사람은 이제 무엇으로 AI를 평가할까요? 평가자가 피평가자보다 약해지는 ‘역량 역전’의 순간과, LLM-as-a-judge·토론·계층적 평가 같은 대안을 정리했습니다. AI 성능 발표를 곧이곧대로 믿기 전에 꼭 읽어보세요.